Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



3
Bisakah Anda jelaskan mengapa ikatan statistik tidak ditolak secara naif ketika
Saya perlu bantuan untuk menjelaskan, dan mengutip teks statistik dasar, makalah atau referensi lain, mengapa umumnya tidak benar menggunakan statistik margin of error (MOE) yang dilaporkan dalam polling untuk secara naif mendeklarasikan ikatan statistik. Contoh: Calon A memimpin Calon B dalam suatu jajak pendapat, persen, margin-of-error untuk pemilih yang disurvei.4,5 …
12 polling 

3
Teknik untuk Menangani Data Tidak Lengkap / Hilang
Pertanyaan saya diarahkan pada teknik untuk menangani data yang tidak lengkap selama pengklasifikasi / pelatihan model / pemasangan. Misalnya, dalam dataset dengan beberapa ratus baris, setiap baris memiliki misalkan lima dimensi dan label kelas sebagai item terakhir, sebagian besar titik data akan terlihat seperti ini: [0.74, 0.39, 0.14, 0.33, 0.34, …


1
Uji dua sampel dengan data tertimbang
Saya ingin melakukan uji-T dua sampel untuk menguji perbedaan antara dua sampel independen yang masing-masing sampel patuhi oleh asumsi uji-T (setiap distribusi dapat diasumsikan independen dan didistribusikan secara identik sebagai Normal dengan varian yang sama) . Satu-satunya komplikasi dari T-test dua sampel dasar adalah bahwa data ditimbang. Saya menggunakan cara …
12 t-test 

2
Uji statistik untuk tabel kontingensi nxm
Saya memiliki dataset yang terdiri dari elemen dari tiga grup, sebut saja mereka G1, G2, dan G3. Saya menganalisis karakteristik tertentu dari elemen-elemen ini dan membaginya menjadi 3 jenis "perilaku" T1, T2, dan T3 (saya menggunakan analisis kluster untuk melakukan itu). Jadi, sekarang saya memiliki tabel kontingensi 3 x 3 …

3
Uji Tepat Fisher dengan bobot?
Adakah yang tahu tentang variasi dari Exact Test Fisher yang mempertimbangkan bobot? Misalnya bobot sampel . Jadi alih-alih tabel silang 2x2 biasa, setiap titik data memiliki nilai "massa" atau "ukuran" yang menimbang titik. Contoh data: A B weight N N 1 N N 3 Y N 1 Y N 2 …


3
Apa itu estimasi bersama?
Pertanyaan saya sederhana saja: apa itu estimasi bersama? Dan apa artinya dalam konteks analisis regresi? Bagaimana ini dilakukan? Saya berkeliaran di Internet yang perkasa untuk beberapa waktu tetapi tidak menemukan jawaban untuk pertanyaan-pertanyaan ini.

2
Penaksir yang tidak sesuai untuk eksponensial ukuran satu set?
Misalkan kita memiliki set (terukur dan berperilaku baik) set , di mana kompak. Selain itu, misalkan kita dapat mengambil sampel dari distribusi seragam di atas wrt ukuran Lebesgue dan kita tahu ukuran . Misalnya, mungkin adalah kotak yang mengandung .S⊆B⊂RnS⊆B⊂RnS\subseteq B\subset\mathbb R^nBBBBBBλ(⋅)λ(⋅)\lambda(\cdot)λ(B)λ(B)\lambda(B)BBB[−c,c]n[−c,c]n[-c,c]^nSSS Untuk tetap , apakah ada cara sederhana yang …

3
Apakah model saya bagus, berdasarkan nilai metrik diagnostik ( / AUC / akurasi / RMSE dll.)?
Saya telah memasang model saya dan berusaha memahami apakah itu bagus. Saya telah menghitung metrik yang disarankan untuk menilainya ( / AUC / akurasi / kesalahan prediksi / dll) tetapi tidak tahu bagaimana menafsirkannya. Singkatnya, bagaimana cara mengetahui apakah model saya bagus berdasarkan metrik? Apakah dari 0,6 (misalnya) cukup untuk …

2
Dalam kesimpulan Bayesian, mengapa beberapa istilah dijatuhkan dari prediksi posterior?
Dalam analisis Konjugat Bayesian Kevin Murphy tentang distribusi Gaussian , ia menulis bahwa distribusi prediktif posterior adalah p(x∣D)=∫p(x∣θ)p(θ∣D)dθp(x∣D)=∫p(x∣θ)p(θ∣D)dθ p(x \mid D) = \int p(x \mid \theta) p(\theta \mid D) d \theta di mana DDD adalah data yang sesuai dengan model dan xxx adalah data yang tidak terlihat. Apa yang saya …

2
Mengapa fungsi kerugian 0-1 sulit diterapkan?
Dalam buku Deep Learning Ian Goodfellow , tertulis itu Terkadang, fungsi kerugian yang benar-benar kita pedulikan (katakanlah, kesalahan klasifikasi) bukan salah satu yang dapat dioptimalkan secara efisien. Misalnya, meminimalkan kerugian yang diharapkan 0-1 yang diharapkan biasanya tidak dapat dilakukan (eksponensial dalam dimensi input), bahkan untuk pengklasifikasi linier. Dalam situasi seperti …

4
Apa yang menyebabkan laso menjadi tidak stabil untuk pemilihan fitur?
Dalam penginderaan terkompresi, ada jaminan teorema bahwa memiliki solusi jarang yang unik c (Lihat lampiran untuk detail lebih lanjut).argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc Apakah ada teorema yang serupa untuk laso? Jika ada teorema seperti itu, tidak hanya akan menjamin stabilitas …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.