Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
MCMC dan augmentasi data
Saya telah melihat pertanyaan augmentasi data MCMC; bentuk umum dari pertanyaan adalah sebagai berikut: Misalkan data yang dikumpulkan pada suatu proses menyarankan dan prior untuk parameter rate disarankan sebagai . Data dicatat dan disajikan dalam bentuk yang khas (yaitu jumlah kemunculan dari setiap nilai untuk dari hingga ), namun, data …

3
Cara mengevaluasi hasil regresi linier
Saya memiliki masalah regresi linier. Singkatnya, saya punya dataset, saya membaginya menjadi dua himpunan bagian. Satu subset digunakan untuk menemukan regresi linier (subset pelatihan), yang lain digunakan untuk mengevaluasinya (subset evaluasi). Pertanyaan saya adalah bagaimana cara mengevaluasi hasil regresi linier ini setelah menerapkannya pada subset evaluasi data? Berikut detailnya: Di …

1
Mengapa ada begitu banyak generator acak di R?
Sebuah cepat melihat halaman bantuan dari nomor acak generator dari R menunjukkan bahwa Anda dapat memilih di antara 7 generator telah ditetapkan ( Wichmann-Hill, Marsaglia-Multicarry, Super-Duper, Mersenne-Twister, Knuth-TAOCP-2002, Knuth-TAOCP, L'Ecuyer-CMRG). ?Random Standarnya adalah Mersenne-Twister , yang tampaknya sangat bagus. Jadi mengapa Anda perlu menggunakan yang lain?


2
Jelaskan bagan kepadatan kernel
Saya menjalankan simulasi pada model linier. Saya mendapatkan 1000 hasil dan hasilnya dimasukkan ke dalam grafik kepadatan. Saya mengerti bahwa xaxis adalah variabel dependen dan yaxis mewakili kepadatan kernel. Yaxis dalam angka desimal seperti dari 0 hingga 0,15. Bagaimana cara saya menjelaskan hal ini kepada pengguna lain? Ada kemungkinan 15% …

1
Tingkat apa yang digunakan ketika membandingkan subjek dalam analisis Bayesian hirarkis?
Katakanlah saya memiliki percobaan di mana saya menguji waktu reaksi sejumlah subjek di mana setiap subjek membuat banyak percobaan waktu reaksi. Dalam kerangka Bayesian, waktu reaksi ( ) dapat dimodelkan oleh model hierarkis dengan distribusi sebelumnya baik pada tingkat subjek maupun untuk seluruh kelompok subjek. Diagram model, gaya Kruschke , …

4
Memilih antara regresi logistik dan Mann Whitney / uji-t
Saya memiliki variabel dikotomis , yang tidak memiliki proporsi yang ditentukan secara apriori dari 0 dan 1, dan variabel kontinu .SEBUAHAAbbb Dalam skenario 1, saya memutuskan untuk menunjuk sebagai variabel independen , dan sebagai variabel dependen . Saya kemudian menguji terhadap menggunakan tes seperti Mann Whitney (bebas distribusi), uji-t (distribusi …

1
Regresi Terbatas pada R: koefisien positif, jumlah ke 1 dan intersep tidak nol
Saya memiliki model yang perlu saya perkirakan, Y=π0+π1X1+π2X2+π3X3+ε,Y=π0+π1X1+π2X2+π3X3+ε, Y = \pi_0 + \pi_1 X_1 + \pi_2 X_2 + \pi_3 X_3 + \varepsilon, dengan ∑kπk=1 for k≥1∑kπk=1 for k≥1\sum_k \pi_k = 1 \text{ for }k \geq 1 dan πk≥0 for k≥1πk≥0 for k≥1\pi_k\ge0 \text{ for }k \geq 1. Elvis menjawab pertanyaan …


2
Non-parametrik untuk ANOVA dua arah (3x3)
Variabel dependen saya adalah kontinu, tidak normal (condong ke kiri menurut uji Shapiro-Wilk). Saya memiliki dua variabel independen (kelompok perlakuan berdasarkan warna, jenis makanan). Ada 3 level dalam setiap variabel independen. Jumlah pengamatan untuk setiap variabel independen tidak sama. Saya telah melihat tes non-parametrik seperti Friedman Test dan Scheirer-Ray-Hare Test, …

6
Apakah menggunakan data yang sama untuk pemilihan fitur dan validasi silang bias atau tidak?
Kami memiliki kumpulan data kecil (sekitar 250 sampel * 100 fitur) yang kami inginkan untuk membangun klasifikasi biner setelah memilih subset fitur terbaik. Katakanlah bahwa kita mempartisi data menjadi: Pelatihan, Validasi dan Pengujian Untuk pemilihan fitur, kami menerapkan model pembungkus berdasarkan pada pemilihan fitur yang mengoptimalkan kinerja pengklasifikasi X, Y …



3
Bagaimana cara memeriksa interaksi antara faktor dan kovariat dalam model efek campuran?
Saya memiliki 2 faktor Adan B(5 × 3) dan satu kovariat Xdalam desain subjek. Inilah cara saya menentukan keseluruhan model saya: lme.out = lme(y~ A*B*X, random=~1|Subject, data=mydata) Interpretasi saya adalah bahwa saya melihat grafik y~x, di mana kemiringan berubah karena kovariat, dan garis bergeser ke atas atau ke bawah berdasarkan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.