Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Menghindari Transformasi Fourier untuk distribusi Fisher
Fungsi karakteristik distribusi Fisher adalah: C ( t ) = Γ ( α + 1F( 1 , α )F(1,α)\mathcal{F}(1,\alpha) manaUadalahfungsi hipergeometrik konfluen. Saya mencoba untuk menyelesaikan invers Fourier transformF-1t,xdarin -konvolusiuntuk memulihkan kepadatan variabelx, yaitu: F-1t,x(C(t)n) dengan tujuan mendapatkan distribusi jumlahnvariabel acak yang didistribusikan Fisher. Saya ingin tahu apakah seseorang mempunyai …

7
Apa yang salah dengan penyesuaian Bonferroni?
Saya membaca makalah berikut: Perneger (1998) Apa yang salah dengan penyesuaian Bonferroni . Penulis merangkum dengan mengatakan bahwa penyesuaian Bonferroni memiliki, paling-paling, aplikasi terbatas dalam penelitian biomedis dan tidak boleh digunakan ketika menilai bukti tentang hipotesis spesifik: Poin ringkasan: Menyesuaikan signifikansi statistik untuk jumlah tes yang telah dilakukan pada data …

1
Validasi silang (CV) dan statistik validasi silang umum (GCV)
Saya telah menemukan kemungkinan definisi yang bertentangan untuk statistik validasi silang (CV) dan untuk statistik validasi silang umum (GCV) yang terkait dengan model linier Y=Xβ+εY=Xβ+εY = X\boldsymbol\beta + \boldsymbol\varepsilon (dengan vektor kesalahan homoseksual yang normal εε\boldsymbol\varepsilon ). Di satu sisi, Golub, Heath & Wahba mendefinisikan estimasi GCV λ^λ^\hat{\lambda} sebagai (hlm. …

2
Konsekuensi pemodelan proses non-stasioner menggunakan ARMA?
Saya mengerti kita harus menggunakan ARIMA untuk pemodelan seri waktu non-stasioner. Juga, semua yang saya baca mengatakan ARMA seharusnya hanya digunakan untuk seri waktu stasioner. Apa yang saya coba pahami adalah, apa yang terjadi dalam praktik ketika salah mengklasifikasikan model, dan berasumsi d = 0untuk deret waktu yang non-stasioner? Sebagai …

1
Apakah analisis kekuatan apriori pada dasarnya tidak berguna?
Saya menghadiri pertemuan Masyarakat untuk Kepribadian dan Psikologi Sosial minggu lalu di mana saya melihat ceramah oleh Uri Simonsohn dengan premis bahwa menggunakan analisis kekuatan a priori untuk menentukan ukuran sampel pada dasarnya tidak berguna karena hasilnya sangat sensitif terhadap asumsi. Tentu saja, klaim ini bertentangan dengan apa yang saya …

2
CHAID vs CRT (atau CART)
Saya menjalankan klasifikasi pohon keputusan menggunakan SPSS pada kumpulan data dengan sekitar 20 prediktor (kategori dengan beberapa kategori). CHAID (Deteksi Interaksi Otomatis Chi-squared) dan CRT / CART (Klasifikasi Dan Pohon Regresi) memberi saya pohon yang berbeda. Adakah yang bisa menjelaskan manfaat relatif CHAID vs CRT? Apa implikasi dari menggunakan satu …
23 spss  cart 




3
Siswa t sebagai campuran dari gaussian
Menggunakan distribusi-t siswa dengan k>0k>0k > 0 derajat kebebasan, parameter lokasi lll dan parameter skala sss memiliki kepadatan Γ(k+12)Γ(k2kπs2−−−−√){1+k−1(x−ls)}−(k+1)/2,Γ(k+12)Γ(k2kπs2){1+k−1(x−ls)}−(k+1)/2,\frac{\Gamma \left(\frac{k+1}{2}\right)}{\Gamma\left(\frac{k}{2}\sqrt{k \pi s^2}\right)} \left\{ 1 + k^{-1}\left( \frac{x-l}{s}\right)\right\}^{-(k+1)/2}, bagaimana menunjukkan bahwa distribusi- Student tttdapat ditulis sebagai campuran dari distribusi Gaussian dengan membiarkan X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2) , τ=1/σ2∼Γ(α,β)τ=1/σ2∼Γ(α,β)\tau = 1/\sigma^2\sim\Gamma(\alpha,\beta) , dan mengintegrasikan …

2
Rata-rata batting Bayesian sebelumnya
Saya ingin mengajukan pertanyaan yang terinspirasi oleh jawaban yang sangat baik untuk pertanyaan tentang intuisi untuk distribusi beta. Saya ingin mendapatkan pemahaman yang lebih baik tentang derivasi untuk distribusi sebelumnya untuk rata-rata pukulan. Sepertinya David mendukung parameter dari mean dan kisaran. Dengan asumsi bahwa rata-rata adalah dan standar deviasi adalah …
23 bayesian  prior 

2
Bagaimana menangani perbedaan antara distribusi set tes dan set pelatihan?
Saya pikir salah satu asumsi dasar pembelajaran mesin atau estimasi parameter adalah bahwa data yang tak terlihat berasal dari distribusi yang sama dengan set pelatihan. Namun, dalam beberapa kasus praktis, distribusi set tes akan hampir berbeda dari set pelatihan. Katakanlah untuk masalah multi-klasifikasi skala besar yang mencoba untuk mengklasifikasikan deskripsi …

2
Apakah teknik pembelajaran mesin “algoritme aproksimasi”?
Baru-baru ini ada pertanyaan seperti ML di cstheory stackexchange, dan saya memposting jawaban yang merekomendasikan metode Powell, gradient descent, algoritma genetika, atau "algoritma aproksimasi" lainnya. Dalam komentar seseorang mengatakan kepada saya metode ini adalah "heuristik" dan bukan "algoritma perkiraan" dan sering tidak mendekati optimal teoritis (karena mereka "sering terjebak dalam …

4
Bagaimana cara menghitung distribusi kumulatif dalam R?
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Saya perlu menghitung fungsi distribusi kumulatif dari sampel data. Apakah ada sesuatu yang mirip dengan hist () dalam R yang mengukur fungsi kepadatan kumulatif? Saya sudah …
23 r  distributions  cdf 


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.