Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Rao-Blackwellization dari filter Monte Carlo berurutan
Dalam makalah seminal "Rao-Blackwellised Particle Filtering for Dynamic Bayesian Networks" oleh A. Doucet et. Al. filter monte carlo sekuensial (filter partikel) diusulkan, yang memanfaatkan substruktur linier dalam proses markov . Dengan memarginalkan struktur linier ini, filter dapat dibagi menjadi dua bagian: bagian non-linear yang menggunakan filter partikel, dan satu bagian …

5
Jika bukan Poisson, lalu distribusi apa ini?
Saya memiliki kumpulan data yang berisi jumlah tindakan yang dilakukan oleh individu selama 7 hari. Tindakan spesifik seharusnya tidak relevan untuk pertanyaan ini. Berikut adalah beberapa statistik deskriptif untuk kumpulan data: JarakBerartiPerbedaanJumlah pengamatan0 - 77218.22791696Range0−772Mean18.2Variance2791Number of observations696 \begin{array}{|c|c|} \hline \text{Range} & 0 - 772 \\ \hline \text{Mean} & 18.2 \\ …


3
Pentingnya variabel dalam regresi logistik
Saya mungkin berurusan dengan masalah yang mungkin telah dipecahkan seratus kali sebelumnya, tetapi saya tidak yakin di mana menemukan jawabannya. Ketika menggunakan regresi logistik, diberikan banyak fitur dan mencoba memprediksi nilai kategorikal biner , saya tertarik untuk memilih subset dari fitur yang memprediksi baik. y yx1,...,xnx1,...,xnx_1,...,x_nyyyyyy Apakah ada prosedur yang …

2
Ukuran pemisahan kelas dalam masalah klasifikasi
Contoh ukuran pemisahan kelas yang baik pada pembelajar diskriminan linier adalah rasio diskriminan linear Fisher. Apakah ada metrik berguna lainnya untuk menentukan apakah set fitur menyediakan pemisahan kelas yang baik antara variabel target? Secara khusus, saya tertarik untuk menemukan atribut input multivarian yang baik untuk memaksimalkan pemisahan kelas target dan …


2
Analisis pengayaan berdasarkan tingkat duplikasi gen
Latar Belakang Biologis Seiring waktu, beberapa spesies tanaman cenderung menggandakan seluruh genomnya, mendapatkan salinan tambahan dari setiap gen. Karena ketidakstabilan pengaturan ini, banyak dari gen-gen ini kemudian dihapus, dan genom menata ulang dirinya sendiri dan menjadi stabil, siap untuk digandakan lagi. Peristiwa duplikasi ini dikaitkan dengan peristiwa spesiasi dan invasi, …

2
Pengambilan sampel dengan penggantian dalam R randomForest
Implementasi randomForest tidak memungkinkan pengambilan sampel melebihi jumlah pengamatan, bahkan ketika pengambilan sampel dengan penggantian. Kenapa ini? Bekerja dengan baik: rf <- randomForest(Species ~ ., iris, sampsize=c(1, 1, 1), replace=TRUE) rf <- randomForest(Species ~ ., iris, sampsize=3, replace=TRUE) Apa yang ingin saya lakukan: rf <- randomForest(Species ~ ., iris, sampsize=c(51, …




1
Model campuran beberapa perbandingan untuk interaksi antara prediktor kontinu dan kategoris
Saya ingin menggunakan lme4agar sesuai dengan regresi efek campuran dan multcompuntuk menghitung perbandingan berpasangan. Saya memiliki kumpulan data yang kompleks dengan beberapa prediktor kontinu dan kategoris, tetapi pertanyaan saya dapat ditunjukkan dengan menggunakan ChickWeightkumpulan data bawaan sebagai contoh: m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, …

1
Dirichlet posterior
Saya punya pertanyaan tentang distribusi posterior Dirichlet. Diberi fungsi multinomial likelihood, diketahui bahwa posterior adalah , di mana adalah berapa kali kita telah melihat observasi .N i i t hDir(αi+Ni)Dir(αi+Ni)Dir({\alpha_i + N_i})NiNiN_iithithi^{th} Apa yang terjadi jika kita mulai mengurangi s untuk data tetap yang diberikan ? Tampaknya dari bentuk posterior …

3
Apa asumsi analisis faktor?
Saya ingin memeriksa apakah saya benar-benar memahami analisis faktor ( klasik, linier ), terutama asumsi yang dibuat sebelum (dan mungkin setelah) FA. Beberapa data awalnya harus dikorelasikan dan ada kemungkinan hubungan linier di antara mereka. Setelah melakukan analisis faktor, data terdistribusi secara normal (distribusi bivariat untuk setiap pasangan) dan tidak …

3
Intuisi dan penggunaan untuk koefisien variasi
Saat ini saya menghadiri kursus Pengantar Manajemen Operasi di Coursera.org. Pada titik tertentu dalam kursus, profesor mulai berurusan dengan variasi waktu operasi. Pengukuran yang ia gunakan adalah Koefisien Variasi , rasio antara standar deviasi dan rata-rata: cv=σμcv=σμc_v = \frac{\sigma}{\mu} Mengapa pengukuran ini digunakan? Apa kelebihan dan kekurangan bekerja dengan CV …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.