Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Mengapa kita memperkirakan rata-rata menggunakan MLE ketika kita sudah tahu bahwa rata-rata adalah data?
Saya telah menemukan masalah dalam buku teks untuk memperkirakan rata-rata. Masalah buku teks adalah sebagai berikut: Asumsikan bahwa NNNtitik data, , ,. . . , , telah dihasilkan oleh pdf Gaussian satu dimensi dengan mean yang tidak diketahui, tetapi dari varian yang diketahui. Turunkan estimasi ML rata-rata.x1x1x_1x2x2x_2xNxNx_N Pertanyaan saya adalah, …

1
Mengapa seseorang harus menggunakan EM vs mengatakan, Gradient Descent with MLE?
Secara matematis, sering terlihat bahwa ekspresi dan algoritme untuk Ekspektasi Maksimalisasi (EM) sering lebih sederhana untuk model campuran, namun tampaknya hampir semua (jika bukan semuanya) yang dapat diselesaikan dengan EM juga dapat diselesaikan dengan MLE (oleh, katakanlah, metode Newton-Raphson, untuk ekspresi yang tidak tertutup). Namun, dalam literatur, tampaknya banyak yang …

1
Variabel terpusat VS standar
Saya telah menemukan banyak posting berguna tentang variabel independen standar dan variabel bebas terpusat pada stats.stackexchange.com, tetapi saya masih agak bingung. Saya meminta Anda untuk mengevaluasi apa yang telah saya pahami. Juga, jika yang berikut ini tidak benar, bisakah Anda memperbaiki saya? Bagaimana cara standarisasi. Variabel terstandarisasi diperoleh dengan mengurangi …

1
Menggabungkan beberapa rantai MCMC paralel menjadi satu rantai yang lebih panjang
Mari kita mengatakan bahwa salah satu telah menjalankan rantai paralel MCMC di mana masing-masing rantai memiliki burn-in. Biarkan rantai yang dihasilkan akan dilambangkan dengan di mana adalah panjang masing-masing rantai setelah burn-in.mmmx(i)1,…,x(i)N for i=1,…,m,x1(i),…,xN(i) for i=1,…,m, x_1^{(i)},\dots,x_N^{(i)} \quad \text{ for } i=1,\dots,m,NNN Jika seseorang ingin menggabungkan rantai ini ke dalam …

4
Apakah rata-rata dari seperangkat rata-rata selalu sama dengan rata-rata yang diperoleh dari seluruh set data mentah?
Jika saya telah menghitung rata-rata untuk 4 set data (yang memang memiliki ukuran sampel berbeda), dapatkah saya memperoleh "rata-rata keseluruhan" dengan menghitung "rata-rata rata-rata"? Jika ya, apakah "rata-rata rata-rata" ini sama dengan jika saya telah menggabungkan data dari keempat set dan kemudian menghitung rata-rata?

1
Jumlah komponen utama saat preprocessing menggunakan PCA dalam paket caret di R
Saya menggunakan caretpaket Runtuk pelatihan pengklasifikasi biner SVM. Untuk pengurangan fitur, saya melakukan preprocessing dengan PCA menggunakan fitur preProc=c("pca")bawaan saat menelepon train(). Ini pertanyaan saya: Bagaimana caret memilih komponen utama? Apakah ada sejumlah komponen utama yang dipilih? Apakah komponen utama dipilih oleh sejumlah varian yang dijelaskan (mis. 80%)? Bagaimana saya …

1
Pertanyaan tentang PCA: kapan PC independen? mengapa PCA sensitif terhadap penskalaan? mengapa PC dibatasi menjadi orthogonal?
Saya mencoba memahami beberapa deskripsi PCA (dua yang pertama dari Wikipedia), penekanan ditambahkan: Komponen utama dijamin independen hanya jika kumpulan data terdistribusi secara normal . Apakah independensi komponen utama sangat penting? Bagaimana saya bisa mengerti deskripsi ini? PCA sensitif terhadap skala relatif dari variabel asli. Apa artinya 'penskalaan' di sana? …

4
Memahami dan Menerapkan model Proses Dirichlet
Saya mencoba menerapkan dan mempelajari Proses Dirichlet untuk mengelompokkan data saya (atau ketika orang belajar mesin berbicara, perkirakan kepadatannya). Saya membaca banyak makalah di topik dan semacam mendapat ide. Tapi saya masih bingung; di sini adalah serangkaian pertanyaan, 1) Apa perbedaan antara Chinese Restaurant Model dan DP? 2) Apa perbedaan …

2
Regresi berganda dengan prediktor kategoris dan numerik
Saya relatif baru untuk R, dan saya mencoba menyesuaikan model dengan data yang terdiri dari kolom kategoris dan kolom numerik (integer). Variabel dependen adalah bilangan kontinu. Data memiliki format berikut: predCateg, predIntNum, ResponseVar Data terlihat seperti ini: ranking, age_in_years, wealth_indicator category_A, 99, 1234.56 category_A, 21, 12.34 category_A, 42, 234.56 .... …


2
Properti invarian dari MLE: berapakah MLE dari normal, ?
Properti invarian dari MLE: jika adalah MLE dari , maka untuk fungsi apa pun , MLE dari adalah . θ^θ^\hat{\theta}θθ\thetaf( θ )f(θ)f(\theta)f( θ )f(θ)f(\theta)f(θ^)f(θ^)f(\hat{\theta}) Juga, harus berupa fungsi satu-ke-satu.fff Buku itu berkata, "Misalnya, untuk memperkirakan , kuadrat dari rata-rata normal, pemetaannya tidak satu-ke-satu." Jadi, kami tidak dapat menggunakan properti invarian.θ2θ2{\theta}^2 …

1
"Minor utama urutan 1 tidak pasti positif" kesalahan menggunakan 2l.norm pada tikus
Saya mengalami masalah menggunakan 2l.normmetode imputasi bertingkat di mice. Sayangnya saya tidak dapat memposting contoh yang dapat direproduksi karena ukuran data saya - ketika saya mengurangi ukurannya, masalahnya hilang. Untuk variabel tertentu, micebuat kesalahan dan peringatan berikut: Error in chol.default(inv.sigma2[class] * X.SS[[class]] + inv.psi) : the leading minor of order …

3
Kelas distribusi ditutup maksimum
Membiarkan QpQpQ_p menjadi kelas distribusi probabilitas pada real non-negatif yang ditentukan oleh ppp, maka Qp([0,∞))=1.Qp([0,∞))=1. Q_p([0,\infty)) = 1. Saya ingin tahu kelas distribusi mana yang ditutup untuk mengambil maksimum dan, yaitu jika X1∼Qp1X1∼Qp1X_1\sim Q_{p_1} dan X2∼Qp2X2∼Qp2X_2\sim Q_{p_2} independen kemudian max(X1,X2)∼Qp3max(X1,X2)∼Qp3\max(X_1,X_2)\sim Q_{p_3}.

2
Bagaimana memproyeksikan secara seragam hash ke sejumlah bucket yang tetap
Hai Rekan Statistik, Saya memiliki hash penghasil sumber (mis., Menghitung string dengan stempel waktu dan informasi lainnya dan hashing dengan md5) dan saya ingin memproyeksikannya ke sejumlah bucket (katakan 100). contoh hash: 0fb916f0b174c66fd35ef078d861a367 Apa yang saya pikirkan pada awalnya adalah menggunakan hanya karakter pertama dari hash untuk memilih ember, tetapi …
11 uniform 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.