Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Konsistensi asimptotik dengan varian asimptotik yang tidak nol - apa yang diwakilinya?
Masalah ini telah muncul sebelumnya, tetapi saya ingin mengajukan pertanyaan spesifik yang akan berusaha mendapatkan jawaban yang akan mengklarifikasi (dan mengklasifikasikan): Dalam "Poor Man's Asymptotics", seseorang menyimpan perbedaan yang jelas di antara keduanya (A) urutan variabel acak yang konvergen dalam probabilitas ke konstan berbeda dengan (B) urutan variabel acak yang …

1
Memilih antara fungsi yang hilang untuk klasifikasi biner
Saya bekerja di domain masalah di mana orang sering melaporkan ROC-AUC atau AveP (presisi rata-rata). Namun, saya baru-baru ini menemukan makalah yang mengoptimalkan Kehilangan Log , sementara yang lain melaporkan Kehilangan Engsel . Sementara saya mengerti bagaimana metrik ini dihitung, saya mengalami kesulitan memahami trade-off antara mereka dan mana yang …

2
Interpretasi beta ketika ada beberapa variabel kategori
Saya memahami konsep bahwa ß 0 adalah mean ketika variabel kategoris sama dengan 0 (atau kelompok referensi), memberikan interpretasi akhir bahwa koefisien regresi adalah perbedaan mean dari dua kategori. Bahkan dengan> 2 kategori saya akan menganggap setiap β menjelaskan perbedaan antara kategori ini berarti dan referensi.β^0β^0\hat\beta_0β^β^\hat\beta Tetapi, bagaimana jika lebih …



3
GLM binomial negatif vs. transformasi log untuk data jumlah: peningkatan tingkat kesalahan Tipe I
Beberapa dari Anda mungkin telah membaca makalah yang bagus ini: O'Hara RB, Kotze DJ (2010) Jangan log-transform data hitungan. Metode dalam Ekologi dan Evolusi 1: 118-122. klick . Dalam bidang penelitian saya (ekotoksikologi), kita sedang berhadapan dengan eksperimen yang direplikasi dengan buruk dan GLM tidak banyak digunakan. Jadi saya melakukan …

4
Apa intuisi di balik independensi dan , ?
Saya berharap seseorang dapat mengajukan argumen yang menjelaskan mengapa variabel acak dan , memiliki distribusi normal standar, secara statistik independen. Bukti untuk fakta itu dengan mudah mengikuti dari teknik MGF, namun saya merasa sangat kontra-intuitif.Y1=X2−X1Y1=X2−X1Y_1=X_2-X_1Y2=X1+X2Y2=X1+X2Y_2=X_1+X_2XiXiX_i Karena itu saya akan menghargai intuisi di sini, jika ada. Terima kasih sebelumnya. EDIT : …

3
Mengapa statistik bayesian tidak lebih populer untuk pengendalian proses statistik?
Pemahaman saya tentang perdebatan bayesian vs sering adalah bahwa statistik sering: adalah (atau mengklaim sebagai) objektif atau setidaknya tidak bias jadi peneliti yang berbeda, menggunakan asumsi yang berbeda masih bisa mendapatkan hasil yang sebanding secara kuantitatif sementara statistik bayesian mengklaim membuat prediksi "lebih baik" (mis. kerugian yang diperkirakan lebih rendah), …

1
Bagaimana cara memutihkan data menggunakan analisis komponen utama?
Saya ingin mengubah data saya sehingga varians akan menjadi satu dan kovariansi akan menjadi nol (yaitu saya ingin memutihkan datanya). Lebih jauh lagi, berarti harus nol.XX\mathbf X Saya tahu saya akan sampai di sana dengan melakukan standardisasi-Z dan transformasi PCA, tetapi dalam urutan apa saya harus melakukannya? Saya harus menambahkan …

4
Pelatihan Model Markov Tersembunyi, beberapa contoh pelatihan
Saya telah mengimplementasikan HMM diskrit menurut tutorial ini http://cs229.stanford.edu/section/cs229-hmm.pdf Tutorial ini dan yang lainnya selalu berbicara tentang pelatihan HMM yang diberikan urutan pengamatan. Apa yang terjadi ketika saya memiliki beberapa rangkaian latihan? Haruskah saya menjalankannya secara berurutan, melatih model setelah yang lain? Pilihan lain adalah menggabungkan urutan ke satu dan …


4
Non-transitivitas korelasi: korelasi antara jenis kelamin dan ukuran otak dan antara ukuran otak dan IQ, tetapi tidak ada korelasi antara jenis kelamin dan IQ
Saya menemukan penjelasan berikut di blog dan saya ingin mendapatkan informasi lebih lanjut tentang non-transitivitas korelasi: Kami memiliki fakta tak terbantahkan berikut: Rata-rata, ada perbedaan volume otak antara pria dan wanita Ada korelasi antara IQ dan ukuran otak; korelasinya adalah 0,33 dan dengan demikian sesuai dengan 10% dari variabilitas IQ …

9
Permintaan Referensi: Model Linear Umum
Saya mencari buku pengantar tingkat menengah tentang Generalized Linear Models. Idealnya, selain teori di balik model, saya ingin memasukkan aplikasi dan contoh dalam R atau bahasa pemrograman lain - Saya dengar SAS juga merupakan pilihan yang populer. Saya bermaksud mempelajarinya sendiri dan jadi akan membantu jika memberikan jawaban untuk latihannya …

2
Mengapa mengoptimalkan campuran Gaussian secara langsung sulit secara komputasi?
Pertimbangkan kemungkinan log campuran Gaussians: l(Sn;θ)=∑t=1nlogf(x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Sn;θ)=∑t=1nlog⁡f(x(t)|θ)=∑t=1nlog⁡{∑i=1kpif(x(t)|μ(i),σi2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} Saya bertanya-tanya mengapa sulit secara komputasi untuk memaksimalkan persamaan itu secara langsung? Saya mencari intuisi yang jelas tentang mengapa harus jelas bahwa itu sulit atau mungkin penjelasan yang lebih keras mengapa sulit. Apakah ini masalah NP-complete …

3
Cara menghitung kesalahan standar dari koefisien regresi logistik
Saya menggunakan scikit-belajar Python untuk melatih dan menguji regresi logistik. scikit-belajar mengembalikan koefisien regresi dari variabel independen, tetapi itu tidak memberikan kesalahan standar koefisien. Saya membutuhkan kesalahan standar ini untuk menghitung statistik Wald untuk setiap koefisien dan, pada gilirannya, membandingkan koefisien ini satu sama lain. Saya telah menemukan satu deskripsi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.