Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Apa metode non-Bayesian yang ada untuk inferensi prediktif?
Dalam kesimpulan Bayesian distribusi prediktif untuk data masa depan diperoleh dengan mengintegrasikan parameter yang tidak diketahui; mengintegrasikan lebih dari distribusi posterior dari parameter-parameter tersebut memberikan distribusi prediksi posterior — distribusi untuk data masa depan tergantung pada yang sudah diamati. Apa metode non-Bayesian untuk inferensi prediktif yang mempertimbangkan ketidakpastian dalam estimasi …



2
Regresi Aljabar Kuadrat Terkecil Langkah-demi-Langkah Komputasi Aljabar Linier
Sebagai pendahuluan untuk pertanyaan tentang model linear-campuran dalam R, dan untuk berbagi sebagai referensi bagi para pecinta statistik pemula / menengah, saya memutuskan untuk memposting sebagai "gaya Tanya Jawab" yang independen, langkah-langkah yang terlibat dalam perhitungan "manual" dari koefisien dan nilai prediksi regresi linier sederhana. Contohnya adalah dengan dataset R-built-in …

2
Shrunken
Ada beberapa kebingungan di kepala saya tentang dua jenis penduga nilai populasi dari koefisien korelasi Pearson. A. Fisher (1915) menunjukkan bahwa untuk populasi normal bivariat, empiris rrr adalah penaksir bias negatif dari ρρ\rho , meskipun bias bisa dibilang cukup besar hanya untuk ukuran sampel kecil ( n&lt;30n&lt;30n<30 ). Sampel rrr …

1
Memilih di antara aturan penilaian yang tepat
Sebagian besar sumber daya pada aturan penilaian yang tepat menyebutkan sejumlah aturan penilaian yang berbeda seperti log-loss, Brier score atau spherical scoring. Namun, mereka sering tidak memberikan banyak panduan tentang perbedaan di antara mereka. (Bukti A: Wikipedia .) Memilih model yang memaksimalkan skor logaritmik sesuai dengan memilih model maksimum-likelihood, yang …

2
Tentang apa itu "regresi penurunan peringkat"?
Saya telah membaca Elemen Pembelajaran Statistik dan saya tidak dapat memahami apa yang dimaksud dengan Bagian 3.7 "Penyusutan dan Seleksi Berganda Berganda". Ini berbicara tentang RRR (regresi tingkat rendah), dan saya hanya bisa mengerti bahwa premisnya adalah tentang model linear multivariat yang digeneralisasi di mana koefisien tidak diketahui (dan diperkirakan) …

1
Mengapa hanya ada
Dalam PCA, ketika jumlah dimensi lebih besar dari (atau bahkan sama dengan) jumlah sampel N , mengapa Anda akan memiliki paling banyak N - 1 vektor eigen bukan nol? Dengan kata lain, pangkat matriks kovarians di antara dimensi d ≥ N adalah N - 1 .dddNNNN−1N−1N-1d≥Nd≥Nd\ge NN−1N−1N-1 Contoh: Sampel Anda …

6
Contoh pemodelan regresi tingkat lanjut
Saya sedang mencari studi kasus regresi linier lanjutan yang menggambarkan langkah-langkah yang diperlukan untuk memodelkan hubungan yang kompleks dan banyak non-linear menggunakan GLM atau OLS. Secara mengejutkan sulit untuk menemukan sumber daya yang melampaui contoh-contoh sekolah dasar: sebagian besar buku yang saya baca tidak akan lebih jauh dari transformasi log …


2
Menghasilkan data dengan matriks kovarians sampel yang diberikan
Diberikan matriks kovarians , bagaimana cara menghasilkan data sedemikian rupa sehingga memiliki sampel matriks kovarians \ hat {\ boldsymbol \ Sigma} = \ boldsymbol \ Sigma_s ?Σ = Σ sΣsΣs\boldsymbol \Sigma_sΣ^=ΣsΣ^=Σs\hat{\boldsymbol \Sigma} = \boldsymbol \Sigma_s Lebih umum: kita sering tertarik untuk menghasilkan data dari kepadatan f(x|θ)f(x|θ) f(x \vert \boldsymbol\theta) , …

4
Yang merupakan visualisasi terbaik untuk tabel kontingensi?
Manakah plot terbaik, dari sudut pandang statistik, untuk menunjukkan tabel kontingensi , yang biasanya dianalisis dengan uji chi-square? Apakah itu barplot yang dihindari, barplot yang ditumpuk, peta panas, plot kontur, scatterplot jitterred, plot beberapa baris atau yang lainnya? Haruskah seseorang menunjukkan nilai atau persentase absolut? Sunting: Atau seperti yang @forecaster …

2
Perbedaan antara Tes Jumlah Wilcoxon Rank dan Tes Peringkat Wilcoxon Signed
Saya bertanya-tanya apa perbedaan teoretis antara Tes Wilcoxon Rank-Sum dan Tes Wilcoxon Signed-Rank menggunakan observasi berpasangan. Saya tahu bahwa Uji Wilcoxon Rank-Sum memungkinkan untuk jumlah pengamatan yang berbeda dalam dua sampel yang berbeda, sedangkan uji Signed-Rank untuk sampel berpasangan tidak memungkinkan, namun keduanya tampaknya menguji hal yang sama menurut pendapat …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.