Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

6
Posterior sangat berbeda dengan sebelum dan kemungkinan
Jika sebelumnya dan kemungkinan sangat berbeda satu sama lain, maka kadang-kadang terjadi situasi di mana posterior mirip dengan keduanya. Lihat misalnya gambar ini, yang menggunakan distribusi normal. Meskipun secara matematis ini benar, tampaknya itu tidak sesuai dengan intuisi saya - jika data tidak sesuai dengan keyakinan atau data yang saya …


6
Apa perbedaan antara statistik deskriptif dan inferensial?
Pemahaman saya adalah bahwa statistik deskriptif menggambarkan fitur sampel data secara kuantitatif, sementara statistik inferensial membuat kesimpulan tentang populasi dari mana sampel diambil. Namun, halaman wikipedia untuk status inferensi statistik : Sebagian besar, kesimpulan statistik membuat proposisi tentang populasi, menggunakan data yang diambil dari populasi yang diminati melalui beberapa bentuk …

1
Konversi (normalisasi) sangat kecil nilai kemungkinan menjadi probabilitas
Saya menulis sebuah algoritma di mana, diberikan model, saya menghitung kemungkinan untuk daftar dataset dan kemudian perlu menormalkan (untuk probabilitas) masing-masing kemungkinan. Jadi sesuatu seperti [0,00043, 0,00004, 0,00321] mungkin dikonversi menjadi seperti [0,2, 0,03, 0,77]. Masalah saya adalah kemungkinan log, saya bekerja dengan, cukup kecil (misalnya, dalam ruang log, nilainya …

2
Menggabungkan informasi dari berbagai penelitian untuk memperkirakan rata-rata dan ragam data yang terdistribusi normal - pendekatan Bayesian vs meta-analitik
Saya telah meninjau satu set makalah, masing-masing melaporkan rata-rata yang diamati dan SD pengukuran dalam masing-masing sampel dengan ukuran yang diketahui, . Saya ingin membuat tebakan terbaik tentang kemungkinan distribusi ukuran yang sama dalam studi baru yang saya rancang, dan seberapa besar ketidakpastian dalam tebakan itu. Saya senang menganggap ).XXXnnnX∼ …


5
Hutan acak vs regresi
Saya menjalankan model regresi OLS pada kumpulan data dengan 5 variabel independen. Variabel independen dan variabel dependen keduanya kontinu dan terkait linier. R Square adalah sekitar 99,3%. Tetapi ketika saya menjalankan hal yang sama menggunakan hutan acak di R hasil saya adalah '% Var menjelaskan: 88,42'. Mengapa hasil hutan acak …

5
Bagaimana cara mengontrol biaya kesalahan klasifikasi di Hutan Acak?
Apakah mungkin untuk mengontrol biaya kesalahan klasifikasi dalam paket R randomForest ? Dalam pekerjaan saya sendiri, negatif palsu (mis., Hilang karena kesalahan bahwa seseorang mungkin menderita penyakit) jauh lebih mahal daripada positif palsu. Paket rpart memungkinkan pengguna untuk mengontrol biaya kesalahan klasifikasi dengan menentukan matriks kerugian misclassifications berat badan berbeda. …


1
Mendeteksi pencilan dalam data hitungan
Saya memiliki apa yang saya anggap naif sebagai masalah yang cukup lurus ke depan yang melibatkan deteksi outlier untuk banyak set data penghitungan yang berbeda. Secara khusus, saya ingin menentukan apakah satu atau lebih nilai dalam serangkaian data jumlah lebih tinggi atau lebih rendah dari yang diharapkan relatif terhadap sisa …

1
Apa sajakah perbaikan terkenal atas algoritma MCMC buku teks yang digunakan orang untuk inferensi bayesian?
Ketika saya sedang mengkode simulasi Monte Carlo untuk beberapa masalah, dan modelnya cukup sederhana, saya menggunakan buku sampel Gibbs yang sangat dasar. Ketika tidak mungkin menggunakan sampling Gibbs, saya memberi kode pada buku teks Metropolis-Hastings yang telah saya pelajari bertahun-tahun yang lalu. Satu-satunya pemikiran yang saya berikan adalah memilih distribusi …

4
Beberapa imputasi dan pemilihan model
Beberapa imputasi cukup mudah ketika Anda memiliki model linear apriori yang ingin Anda perkirakan. Namun, hal-hal tampaknya menjadi sedikit lebih rumit ketika Anda benar-benar ingin melakukan pemilihan model (misalnya menemukan variabel prediktor "terbaik" dari variabel kandidat yang lebih besar - saya sedang berpikir secara khusus tentang LASSO dan polinomial pecahan …



2
Cara menguji persamaan varians dengan data lingkaran
Saya tertarik untuk membandingkan jumlah variabilitas dalam 8 sampel berbeda (masing-masing dari populasi yang berbeda). Saya sadar bahwa ini dapat dilakukan dengan beberapa metode dengan data rasio: F-test kesetaraan varian, uji Levene, dll. Namun, data saya adalah sirkuler / terarah (yaitu data yang menunjukkan periodisitas seperti arah angin dan data …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.