Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


11
Podcast statistik
Apa sajakah podcast yang terkait dengan analisis statistik? Saya telah menemukan beberapa rekaman audio kuliah di ITunes U, tetapi saya tidak mengetahui adanya podcast statistik. Hal terdekat yang saya ketahui adalah podcast riset operasi The Science of Better . Menyentuh masalah statistik, tetapi tidak secara khusus menunjukkan statistik.
29 references 


6
Prosedur pemilihan variabel untuk klasifikasi biner
Apa pilihan variabel / fitur yang Anda sukai untuk klasifikasi biner ketika ada lebih banyak variabel / fitur daripada pengamatan dalam set pembelajaran? Tujuannya di sini adalah untuk membahas prosedur pemilihan fitur apa yang mengurangi kesalahan klasifikasi terbaik. Kita dapat memperbaiki notasi untuk konsistensi: untuk , mari menjadi kumpulan pembelajaran …


3
Bagaimana cara melakukan regresi ortogonal (kuadrat terkecil total) melalui PCA?
Saya selalu menggunakan lm()dalam R untuk melakukan regresi linier pada . Fungsi itu mengembalikan koefisien sehinggayyyxxxββ\betay=βx.y=βx.y = \beta x. Hari ini saya belajar tentang kuadrat terkecil total dan princomp()fungsi itu (analisis komponen utama, PCA) dapat digunakan untuk melakukannya. Itu harus baik untuk saya (lebih akurat). Saya telah melakukan beberapa tes …

6
Tes untuk varian terbatas?
Apakah mungkin untuk menguji ketelitian (atau keberadaan) dari varians dari variabel acak yang diberikan sampel? Sebagai nol, {varians ada dan terbatas} atau {varians tidak ada / tidak terbatas} akan diterima. Secara filosofis (dan komputasi), ini tampak sangat aneh karena seharusnya tidak ada perbedaan antara populasi tanpa varian terbatas, dan populasi …

3
Apa itu bermacam-macam?
Dalam teknik reduksi dimensionalitas seperti Principal Component Analysis, LDA dll sering istilah manifold digunakan. Apa yang banyak ragam dalam istilah non-teknis? Jika suatu titik milik bola yang dimensi yang ingin saya kurangi, dan jika ada suara dan dan tidak berkorelasi, maka titik sebenarnya akan jauh terpisah satu sama lain karena …

1
Apa kekurangan dari kesalahan persentase absolut rata-rata (MAPE)?
The Mean Absolute Perscentage Error ( mape ) adalah akurasi umum atau ukuran kesalahan untuk seri waktu atau prediksi lainnya, MAPE = 100n∑t = 1n| SEBUAHt- Ft|SEBUAHt% ,PETA=100n∑t=1n|SEBUAHt-Ft|SEBUAHt%, \text{MAPE} = \frac{100}{n}\sum_{t=1}^n\frac{|A_t-F_t|}{A_t}\%, di mana adalah aktual dan sesuai perkiraan atau prediksi.F tSEBUAHtSEBUAHtA_tFtFtF_t MAPE adalah persentase, jadi kami dapat dengan mudah membandingkannya …
29 accuracy  mape 

1
Interval prediksi bootstrap
Apakah ada teknik bootstrap yang tersedia untuk menghitung interval prediksi untuk prediksi titik yang diperoleh misalnya dari regresi linier atau metode regresi lainnya (k-tetangga terdekat, pohon regresi dll)? Entah bagaimana saya merasa bahwa cara yang kadang-kadang diusulkan untuk hanya menghapus prediksi titik (lihat misalnya interval prediksi untuk regresi kNN ) …

2
Mengapa menggunakan validasi silang bertingkat? Mengapa ini tidak merusak manfaat terkait varians?
Saya telah diberitahu bahwa bermanfaat untuk menggunakan validasi lintas bertingkat terutama ketika kelas respons tidak seimbang. Jika salah satu tujuan validasi silang adalah untuk membantu menjelaskan keacakan sampel data pelatihan asli kami, tentu membuat setiap lipatan memiliki distribusi kelas yang sama akan bekerja melawan hal ini kecuali Anda yakin set …

4
Interpretasi Pseudo-R2 McFadden
Saya memiliki model regresi logistik biner dengan pseudo R-kuadrat McFadden dari 0,192 dengan variabel dependen yang disebut pembayaran (1 = pembayaran dan 0 = tidak ada pembayaran). Apa interpretasi pseudo R-squared ini? Apakah ini perbandingan relatif untuk model bersarang (misalnya model 6 variabel memiliki pseudo R-kuadrat McFadden sebesar 0,192, sedangkan …

1
Metrik galat untuk memvalidasi silang model Poisson
Saya memvalidasi silang model yang mencoba memprediksi hitungan. Jika ini adalah masalah klasifikasi biner, saya akan menghitung AUC out-of-fold, dan jika ini adalah masalah regresi saya akan menghitung RMSE atau MAE out-of-fold Untuk model Poisson, metrik kesalahan apa yang dapat saya gunakan untuk mengevaluasi "keakuratan" dari prediksi out-of-sample? Apakah ada …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.