Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

8
Survei: Apakah 25% perwakilan basis pengguna yang besar?
Majikan saya saat ini menjalankan survei di seluruh perusahaan tentang sikap terhadap kantor yaitu Sentimen. Di masa lalu, mereka membuka survei ke semua area bisnis (Mari kita asumsikan 10 departemen yang sangat berbeda) dan semua karyawan di dalamnya (Asumsikan total 1000 karyawan di seluruh perusahaan) Jumlah karyawan di setiap departemen …

1
Jika
Saya menemukan bukti untuk salah satu sifat dari model ARCH yang mengatakan bahwa jika E(X2t)&lt;∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty , maka {Xt}{Xt}\{X_t\} adalah stasioner iff ∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 mana model ARCH adalah: Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 + ... b_pX_{t-p}^2 Gagasan utama buktinya adalah untuk menunjukkan bahwa dapat ditulis …

4
Norma - Apa yang khusus tentang
Sebuah L1L1L_1 norma adalah unik (setidaknya sebagian) karena p=1p=1p=1 adalah pada batas antara non-cembung dan cembung. Sebuah L1L1L_1 norma adalah 'yang paling jarang' cembung norma (kanan?). Saya mengerti bahwa p=2p=2p=2 norma Euclidean memiliki akar dalam geometri dan memiliki interpretasi yang jelas ketika dimensi memiliki unit yang sama. Tapi saya tidak …

4
Haruskah orang memperhatikan multi-collinearity saat menggunakan model non-linear?
Katakanlah kita memiliki masalah klasifikasi biner dengan sebagian besar fitur kategorikal. Kami menggunakan beberapa model non-linear (mis. XGBoost atau Random Forests) untuk mempelajarinya. Haruskah orang masih khawatir tentang multi-collinearity? Mengapa? Jika jawaban di atas benar, bagaimana seharusnya seseorang melawannya mengingat dia menggunakan jenis model non-linear ini?



1
Mengapa penguatan yang dalam belajar tidak stabil?
Dalam makalah DeepMind tahun 2015 tentang pembelajaran penguatan dalam, ia menyatakan bahwa "Upaya sebelumnya untuk menggabungkan RL dengan jaringan saraf sebagian besar gagal karena pembelajaran yang tidak stabil". Makalah ini kemudian mencantumkan beberapa penyebabnya, berdasarkan korelasi antar pengamatan. Tolong bisakah seseorang menjelaskan apa artinya ini? Apakah itu bentuk overfitting, di …

3
Dari mana distribusi beta?
Karena saya yakin semua orang di sini sudah tahu, PDF dari distribusi Beta X∼B(a,b)X∼B(a,b)X \sim B(a,b) diberikan oleh f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} Saya telah berburu di seluruh tempat untuk penjelasan tentang asal-usul formula ini, tetapi saya tidak dapat menemukannya. Setiap artikel yang saya temukan pada distribusi Beta tampaknya memberikan formula ini, …

2
Pendekatan yang bertentangan dengan pemilihan variabel: AIC, nilai-p atau keduanya?
Dari apa yang saya pahami, pemilihan variabel berdasarkan nilai-p (setidaknya dalam konteks regresi) sangat cacat. Tampaknya pemilihan variabel berdasarkan AIC (atau serupa) juga dianggap cacat oleh beberapa, untuk alasan yang sama, meskipun ini tampaknya agak tidak jelas (mis. Lihat pertanyaan saya dan beberapa tautan pada topik ini di sini: Apa …


1
Pemodelan time series data sirkuler
Saya sedang membangun model ARIMA untuk beberapa data angin / gelombang. Saya sedang membangun model terpisah untuk setiap variabel. Dua variabel yang saya perlu model adalah arah gelombang dan angin. Nilai dalam derajat (0-360 °). Apakah mungkin untuk memodelkan tipe data ini di mana interval nilai melingkar? Jika tidak, kelas …

2
Apa yang dikatakan oleh r, r kuadrat dan standar deviasi residual tentang hubungan linier?
Sedikit latar belakang saya bekerja pada interpretasi analisis regresi tetapi saya benar-benar bingung tentang arti r, r kuadrat dan standar deviasi residual. Saya tahu definisi: Penokohan r mengukur kekuatan dan arah hubungan linear antara dua variabel pada sebar scatter R-squared adalah ukuran statistik seberapa dekat data dengan garis regresi pas. …

4
Bagaimana penjumlahan dua variabel dapat menjelaskan lebih banyak varians daripada variabel individual?
Saya mendapatkan beberapa hasil membingungkan untuk korelasi jumlah dengan variabel ketiga ketika kedua prediktor berkorelasi negatif. Apa yang menyebabkan hasil yang membingungkan ini? Contoh 1: Korelasi antara jumlah dua variabel dan variabel ketiga Pertimbangkan formula 16.23 di halaman 427 dari teks Guildford 1965, yang ditunjukkan di bawah ini. Temuan membingungkan: …

2
Singkatnya, secara grafis
Objektif Konfirmasikan apakah pemahaman tentang KKT benar atau tidak. Cari penjelasan dan konfirmasi lebih lanjut tentang KKT. Latar Belakang Mencoba memahami kondisi KKT, terutama yang saling melengkapi, yang selalu muncul tiba-tiba dalam artikel SVM. Saya tidak perlu daftar formula abstrak tetapi perlu penjelasan konkret, intuitif, dan grafis. Pertanyaan Jika P, …

3
Memilih hyperparameters menggunakan T-SNE untuk klasifikasi
Dalam masalah khusus yang saya kerjakan dengan (kompetisi) saya memiliki pengaturan follwoing: 21 fitur (angka pada [0,1]) dan output biner. Saya memiliki sekitar 100 K baris. Pengaturan tampaknya sangat bising. Saya dan peserta lain menerapkan pembuatan fitur untuk sementara waktu dan penyematan stokastik tetangga t-didistribusikan ternyata lebih kuat dalam pengaturan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.