Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Dari HMM standar ke HMM Bayesian
Saya mencoba memahami apa perbedaan antara HMM standar dan HMM Bayesian. Wikipedia hanya menyebutkan secara singkat bagaimana modelnya tetapi saya perlu tutorial yang lebih rinci. Apakah ada yang tahu tentang makalah atau implementasi yang bisa saya lihat? Saya juga punya masalah dengan terminologi yang digunakan. Apa artinya secara praktis jika …



1
Seberapa dekat dengan nol seharusnya jumlah efek acak berada di GLMM (dengan lme4)
Saya menggunakan lme4paket dalam R untuk melakukan beberapa pemodelan efek campuran logistik. Pemahaman saya adalah bahwa jumlah setiap efek acak harus nol. Ketika saya membuat mainan model linier campuran menggunakan lmer, efek acak biasanya <10−1010−1010^{-10}mengkonfirmasikan keyakinan saya bahwa colSums(ranef(model)$groups) ~ 0 But in toy model binomial (dan dalam model data …

1
Estimasi Bayesian dari parameter distribusi Dirichlet
Saya ingin memperkirakan parameter model campuran Dirichlet menggunakan sampling Gibbs dan saya punya beberapa pertanyaan tentang itu: Apakah campuran dari distribusi Dirichlet setara dengan proses Dirichlet? Apa perbedaan utama mereka jika tidak? Juga, jika saya ingin memperkirakan parameter distribusi Dirichlet tunggal, distribusi parameter mana yang harus dipilih sebagai prior dalam …

1
Penghapusan bias variabel dalam regresi linier
Saya punya pertanyaan filosofis tentang bias variabel yang dihilangkan. Kami memiliki model regresi yang khas (model populasi) Y=β0+β1X1+...+βnXn+υ,Y=β0+β1X1+...+βnXn+υ, Y= \beta_0 + \beta_1X_1 + ... + \beta_nX_n + \upsilon, dari mana sampel berasal (Y,X1,...,Xn)(Y,X1,...,Xn)(Y,X_1,...,X_n), dan kemudian banyak kondisi di mana perkiraan OLS berperilaku cukup baik. Maka kita tahu bahwa, jika kita …

4
R: Menghitung rata-rata dan kesalahan standar rata-rata untuk faktor-faktor dengan lm () vs. perhitungan langsung -ditandai
Ketika berhadapan dengan data dengan faktor R dapat digunakan untuk menghitung rata-rata untuk setiap kelompok dengan fungsi lm (). Ini juga memberikan kesalahan standar untuk estimasi cara. Tetapi kesalahan standar ini berbeda dari apa yang saya dapatkan dari perhitungan dengan tangan. Ini adalah contoh (diambil dari sini. Memprediksi perbedaan antara …



5
Klasifikasi vs regresi untuk prediksi tanda variabel respon kontinu
Katakanlah saya ingin memprediksi apakah suatu proyek akan menguntungkan atau tidak. Dalam data sampel saya, variabel respons sebenarnya adalah variabel kontinu: $ untung / rugi proyek. Karena tujuan akhir saya hanyalah klasifikasi biner (proyek menguntungkan atau proyek tidak menguntungkan), haruskah saya menggunakan teknik klasifikasi? Atau haruskah saya menggunakan regresi agar …

2
Bagaimana cara membandingkan dua algoritma secara statistik pada tiga dataset dalam pemilihan dan klasifikasi fitur?
Latar belakang masalah: Sebagai bagian dari penelitian saya, saya telah menulis dua algoritma yang dapat memilih satu set fitur dari set data (data ekspresi gen dari pasien kanker). Fitur-fitur ini kemudian diuji untuk melihat seberapa baik mereka dapat mengklasifikasikan sampel yang tidak terlihat sebagai kanker atau non-kanker. Untuk setiap rangkaian …

2
Seberapa pentingkah pengetahuan domain dalam profesi kita?
atau: Apakah memilih domain saat memasuki suatu pekerjaan mempersempit pilihan masa depan Anda untuk domain dan karenanya pekerjaan? Untuk membuat pertanyaan ini seluas mungkin diterapkan ... profesi mengacu pada semua jenis analis data, dari ahli statistik di atas pemrogram pelajar mesin hingga penambang data. bayangkan Anda diminta untuk memberikan saran …
8 careers 

2
Imputasi dengan Hutan Acak
Saya punya dua pertanyaan tentang menggunakan hutan acak (khususnya randomForest di R) untuk hilangnya nilai imputasi (dalam ruang prediktor). 1) Bagaimana cara kerja algoritma imputasi - khususnya bagaimana dan mengapa label kelas diperlukan untuk imputasi? Apakah matriks kedekatan yang berfungsi untuk menimbang nilai rata-rata untuk menentukan nilai yang hilang yang …

2
Tes post-hoc setelah 2-faktor berulang mengukur ANOVA di R?
Saya memiliki masalah dalam menemukan solusi tentang cara menjalankan tes post-hoc (Tukey HSD) setelah 2-faktor (keduanya dalam-mata pelajaran) mengukur ANOVA berulang dalam R. Untuk ANOVA, saya telah menggunakan fungsi aov: summary(aov(dv ~ x1 * x2 + Error(subject/(x1*x2)), data=df1)) Setelah membaca jawaban untuk pertanyaan lain, saya mengumpulkan bahwa saya pertama-tama harus …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.