Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Peta yang diatur sendiri vs kernel k-means
Untuk aplikasi, saya ingin mengelompokkan data (berpotensi berdimensi tinggi) dan mengekstraksi kemungkinan milik sebuah cluster. Saya mempertimbangkan pada saat ini peta mengatur diri sendiri atau kernel k-cara untuk melakukan pekerjaan. Apa pro dan kontra dari setiap classifier untuk tugas ini? Apakah saya kehilangan algoritme pengelompokan orang lain yang bisa tampil …


1
Mengapa menggunakan bayesglm?
Pertanyaan keseluruhan saya adalah: mengapa menggunakan bayesglmmetode klasifikasi lainnya? catatan: Saya hanya tertarik pada prediksi. Saya memiliki jumlah data yang layak (~ 100.000 obs). Saya merasa ukuran sampel cukup besar sehingga parameter regresi logistik reguler akan terdistribusi normal (CLT). Apa yang akan saya dapatkan dengan menentukan prior? Firasat saya adalah …

1
Mengapa kemungkinan log harus menuju minus tak terhingga ketika parameter mendekati batas ruang parameter?
Dalam sebuah kuliah baru-baru ini saya diberitahu bahwa, agar estimasi kemungkinan maksimum menjadi valid, kemungkinan log harus menuju minus tak terhingga ketika parameter menuju ke batas ruang parameter. Tetapi saya tidak mengerti mengapa ini penting. Misalkan kemungkinan log masuk ke beberapa jenis asimtot. Maka parameter yang memaksimalkan kemungkinan masih merupakan …

2
Mencari 'Siku' dalam data
Subitisasi adalah penghitungan cepat, akurat untuk tampilan dengan angka rendah, dibedakan dari penghitungan dengan non-linearitas yang tajam dalam plot waktu respons. Di bawah ini adalah plot yang representatif, dari Watson, DG, Maylor, EA, & Bruce, LAM (2007). Perhatikan bahwa waktu pencacahan rata-rata untuk tampilan 1-3 meningkat secara linear, tetapi waktu …

1
Mengapa Proses Dirichlet tidak cocok untuk aplikasi di Bayesian nonparametrics?
Sifat diskrit dari DP membuatnya tidak cocok untuk aplikasi umum dalam Bayesian nonparametrics, tetapi sangat cocok untuk masalah penempatan prior pada komponen campuran dalam pemodelan campuran. Kutipan ini dari Hierarchical Dirichlet Processes (Teh, et al, (2006) ) dan saya mencari penjelasan tentang apa artinya. Nonparametrik Bayesian sepertinya terlalu samar untuk …

2
Perkiraan jumlah relatif koin di Kanada
Mungkinkah untuk memperkirakan secara akurat jumlah relatif Loonies , Twoonies , quarter, dimes, nickles (dan mungkin sen yang dihentikan) dalam sirkulasi dari sekadar memperoleh sampel koin yang cukup besar melalui penggunaan sehari-hari? Dengan penggunaan sehari-hari saya merujuk pada koin yang Anda kembalikan saat Anda melakukan pembelian di toko grosir misalnya. …



1
Apakah residual, e, penduga kesalahan,
Pertanyaan ini muncul di utas lain yang saya mulai jadi saya pikir saya akan mendapatkan lebih banyak pendapat orang tentang itu. Pertanyaanku adalah Apakah residual, e, penduga kesalahan, ϵϵ\epsilon? Alasan yang saya tanyakan adalah sebagai berikut. Dalam OLS, varian dari residu,RSS(n−K)RSS(n−K)\frac{\text{RSS}}{(n - K )}, dikenal sebagai varian dari regresi (di …

2
Menghasilkan variabel acak yang saling tergantung
Saya mencoba untuk menghasilkan set variabel acak yang terhubung secara kausal dan mulai melakukan ini dengan pendekatan monte carlo. Baseline adalah histogram 2 dimensi yang diukur dari mana saya menggambar nilai acak. Dalam contoh nyata saya, variabel-variabel ini adalah akselerasi aa\bf{a}dan kecepatan - jadi jelas harus ditahan.vv\bf{v}vi+1=vi+ai∗dtvi+1=vi+ai∗dtv_{i+1} = v_{i} + …

3
Bagaimana cara melakukan klasifikasi Hutan Acak tanpa pengawasan menggunakan kode Breiman?
Saya bekerja dengan kode hutan acak Breiman ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) untuk klasifikasi data satelit (supervised learning). Saya menggunakan dataset pelatihan dan tes yang memiliki ukuran sampel 2000 dan ukuran variabel 10. Data diklasifikasikan ke dalam dua kelas, A dan B. Dalam mode pembelajaran terawasi, algoritma berkinerja baik dengan kesalahan klasifikasi …

3
Gagasan untuk menghasilkan persamaan prediksi untuk Hutan Acak
Saya telah membaca tulisan-tulisan berikut yang menjawab pertanyaan yang akan saya tanyakan: Gunakan model Hutan Acak untuk membuat prediksi dari data sensor Pohon keputusan untuk prediksi keluaran Inilah yang telah saya lakukan sejauh ini: Saya membandingkan Regresi Logistik dengan Random Forests dan RF mengungguli Logistic. Sekarang peneliti medis yang bekerja …

1
Ketika membuat kesimpulan tentang cara-cara kelompok, apakah Interval yang kredibel sensitif terhadap varians dalam subjek sementara interval kepercayaan tidak?
Ini adalah spin-off dari pertanyaan ini: Bagaimana membandingkan dua kelompok dengan beberapa pengukuran untuk setiap individu dengan R? Dalam jawaban di sana (jika saya mengerti dengan benar) saya belajar bahwa varians dalam subjek tidak mempengaruhi kesimpulan yang dibuat tentang mean kelompok dan tidak apa-apa untuk hanya mengambil rata-rata rata-rata untuk …

1
Dapatkah saya menggunakan interval keyakinan dari poisson mean untuk variansnya
Dalam distribusi Poisson rata-rata sama dengan varians. Saya ingin mencari interval kepercayaan varians. Apakah alasan saya di bawah ini benar? Menggunakan teorema limit pusat saya membangun interval kepercayaan 95% untuk rata-rataμμ\mu L≤μ≤UL≤μ≤UL \leq \mu \leq U μ=σ2μ=σ2\mu=\sigma^2 Karena itu L≤σ2≤UL≤σ2≤UL \leq \sigma^2 \leq U Tampak bagi saya bahwa ketidaksetaraan harus …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.