Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Betapa anehnya sekelompok kecelakaan pesawat?
Pertanyaan awal (7/25/14): Apakah kutipan dari media berita ini masuk akal, atau adakah cara statistik yang lebih baik untuk melihat serentetan kecelakaan pesawat baru-baru ini? Namun, Barnett juga menarik perhatian pada teori distribusi Poisson, yang menyiratkan bahwa interval pendek antara crash sebenarnya lebih mungkin daripada yang lama. "Misalkan ada rata-rata …

1
Regresi dalam pengaturan
Saya mencoba melihat apakah akan menggunakan regresi ridge , LASSO , regresi komponen utama (PCR), atau Partial Least Squares (PLS) dalam situasi di mana ada sejumlah besar variabel / fitur ( ) dan jumlah sampel yang lebih kecil ( n < p ), dan tujuan saya adalah prediksi.pppn<pn<pn np>10np>10np>10n Variabel …



3
Memprediksi varian data heteroskedastik
Saya mencoba melakukan regresi pada data heteroskedastik di mana saya mencoba untuk memprediksi varians kesalahan serta nilai rata-rata dalam hal model linier. Sesuatu seperti ini: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} Dengan kata lain, data terdiri dari pengukuran berulang pada berbagai nilai …


3
Saran untuk pembelajaran yang sensitif biaya dalam lingkungan yang sangat tidak seimbang
Saya memiliki dataset dengan beberapa juta baris dan ~ 100 kolom. Saya ingin mendeteksi sekitar 1% dari contoh dalam dataset, yang termasuk kelas umum. Saya memiliki batasan presisi minimum, tetapi karena biaya yang sangat asimetris, saya tidak terlalu tertarik pada penarikan tertentu (selama saya tidak dibiarkan dengan 10 pertandingan positif!) …

2
Regresi punggungan - interpretasi Bayesian
Saya telah mendengar bahwa regresi ridge dapat diturunkan sebagai rata-rata distribusi posterior, jika prior dipilih secara memadai. Apakah intuisi bahwa kendala seperti yang ditetapkan pada koefisien regresi oleh sebelumnya (misalnya distribusi normal standar sekitar 0) adalah identik / ganti hukuman yang ditetapkan pada ukuran kuadrat dari koefisien? Apakah sebelumnya harus …

1
Apa artinya menjelaskan perbedaan?
Secara khusus, saya bertanya-tanya mengapa kita memiliki konsep Multiple R (yang dapat saya pahami sebagai korelasi antara skor yang diamati dan yang diprediksi dalam regresi berganda), dan kemudian konsep terpisah R-squared yang hanya berbentuk bujur sangkar atau R. Saya telah diberi tahu bahwa R-squared adalah variasi persentase yang dijelaskan dan …

1
Gini berkurang dan Gini ketidakmurnian simpul anak
Saya sedang mengerjakan ukuran kepentingan fitur Gini untuk hutan acak. Oleh karena itu, saya perlu menghitung penurunan Gini dalam ketidakmurnian simpul. Inilah cara saya melakukannya, yang mengarah pada konflik dengan definisi tersebut, menunjukkan bahwa saya pasti salah di suatu tempat ... :) Untuk pohon biner, dan mengingat probabilitas anak-anak kiri …

3
SVM untuk data yang tidak seimbang
Saya ingin mencoba menggunakan Support Vector Machines (SVMs) pada dataset saya. Sebelum saya mencoba masalah, saya diperingatkan bahwa SVM tidak bekerja dengan baik pada data yang sangat tidak seimbang. Dalam kasus saya, saya dapat memiliki sebanyak 95-98% 0 dan 2-5% 1. Saya mencoba untuk menemukan sumber daya yang berbicara tentang …


2
Menghitung AIC "dengan tangan" di R
Saya telah mencoba menghitung AIC dari regresi linier dalam R tetapi tanpa menggunakan AICfungsi, seperti ini: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Namun, AICmemberikan nilai berbeda: AIC(lm_mtcars) [1] 190.7999 Bisakah seseorang memberi tahu saya apa yang saya lakukan salah?

4
Perangkap yang harus dihindari saat mengubah data?
Saya mencapai hubungan linier yang kuat antara variabel dan Y saya setelah mengubah responsnya. Modelnya adalah Y ∼ X tetapi saya mengubahnya menjadi √XXXYYYY∼XY∼XY\sim X meningkatkanR2dari 0,19 ke 0,76.YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X}R2R2R^2 Jelas saya melakukan beberapa operasi yang layak pada hubungan ini. Adakah yang bisa mendiskusikan kesulitan melakukan hal ini, seperti bahaya …

3
Mengapa tidak ada yang menggunakan klasifikasi Bayesian multinomial Naive Bayes?
Jadi dalam pemodelan teks (tanpa pengawasan), Latent Dirichlet Allocation (LDA) adalah versi Bayesian dari Probabilistic Latent Semantic Analysis (PLSA). Intinya, LDA = PLSA + Dirichlet sebelum parameternya. Pemahaman saya adalah bahwa LDA sekarang menjadi algoritma referensi dan diimplementasikan dalam berbagai paket, sementara PLSA seharusnya tidak digunakan lagi. Tetapi dalam kategorisasi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.