Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



5
Mengapa menggunakan metode Monte Carlo dan bukannya grid sederhana?
ketika mengintegrasikan fungsi atau dalam simulasi yang kompleks, saya telah melihat metode Monte Carlo banyak digunakan. Saya bertanya pada diri sendiri mengapa orang tidak menghasilkan kisi poin untuk mengintegrasikan fungsi alih-alih menggambar titik acak. Bukankah itu membawa hasil yang lebih tepat?

4
Ziliak (2011) menentang penggunaan nilai-p dan menyebutkan beberapa alternatif; Apakah mereka?
Dalam sebuah artikel baru-baru ini yang membahas kerugian bergantung pada nilai-p untuk inferensi statistik, yang disebut "Matrixx v. Siracusano dan Student v. Fisher signifikansi statistik pada percobaan" (DOI: 10.1111 / j.1740-9713.2011.00511.x), Stephen T. Ziliak menentang penggunaan nilai-p. Dalam paragraf penutup dia berkata: Data adalah satu hal yang sudah kita ketahui, …



4
Mengatasi ketidakpastian model
Saya bertanya-tanya bagaimana orang Bayesian di komunitas CrossValidated melihat masalah ketidakpastian model dan bagaimana mereka lebih suka menghadapinya? Saya akan mencoba mengajukan pertanyaan saya dalam dua bagian: Seberapa penting (dalam pengalaman / pendapat Anda) berurusan dengan ketidakpastian model? Saya belum menemukan makalah yang menangani masalah ini di komunitas pembelajaran mesin, …

1
Membangun interval kepercayaan berdasarkan kemungkinan profil
Dalam kursus statistik dasar saya, saya belajar bagaimana membangun interval kepercayaan 95% seperti rata-rata populasi, μμ\mu , berdasarkan normalitas asimptotik untuk ukuran sampel "besar". Terlepas dari metode resampling (seperti bootstrap), ada pendekatan lain berdasarkan "kemungkinan profil" . Bisakah seseorang menjelaskan pendekatan ini? Dalam situasi apa, CI 95% yang dibangun berdasarkan …

2
Kapan saya * tidak * menggunakan fungsi nlm R untuk MLE?
Saya telah menemukan beberapa panduan yang menyarankan agar saya menggunakan R's nlm untuk estimasi kemungkinan maksimum. Tetapi tidak satu pun dari mereka (termasuk dokumentasi R ) yang memberikan banyak petunjuk teoritis tentang kapan harus menggunakan atau tidak menggunakan fungsi tersebut. Sejauh yang saya tahu, nlm hanya melakukan gradient descent di …




2
Uji rasio kemungkinan dalam R
Misalkan saya akan melakukan regresi logistik univariat pada beberapa variabel independen, seperti ini: mod.a <- glm(x ~ a, data=z, family=binominal("logistic")) mod.b <- glm(x ~ b, data=z, family=binominal("logistic")) Saya melakukan perbandingan model (uji rasio kemungkinan) untuk melihat apakah model lebih baik daripada model nol dengan perintah ini 1-pchisq(mod.a$null.deviance-mod.a$deviance, mod.a$df.null-mod.a$df.residual) Lalu saya …
25 r  logistic  diagnostic 

2
Apakah PCA tidak stabil di bawah multikolinieritas?
Saya tahu bahwa dalam situasi regresi, jika Anda memiliki satu set variabel yang sangat berkorelasi ini biasanya "buruk" karena ketidakstabilan dalam koefisien yang diperkirakan (varians menuju infinity sebagai determinan menuju nol). Pertanyaan saya adalah apakah "kejahatan" ini tetap ada dalam situasi PCA. Apakah vektor koefisien / beban / bobot / …

4
Kolaborasi statistik
Sebagai seorang ahli biologi, banyak dari proyek penelitian yang saya kerjakan pada titik tertentu melibatkan kolaborasi dengan ahli statistik, apakah itu untuk saran sederhana atau untuk menerapkan dan menguji model untuk data saya. Rekan-rekan statistik saya mengakui bahwa mereka melakukan sejumlah besar kolaborasi, sedemikian rupa sehingga proses tinjauan tenurial hanya …
25 academia 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.