Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Berapa banyak data yang Anda butuhkan untuk jaringan saraf convolutional?
Jika saya memiliki jaringan saraf convolutional (CNN), yang memiliki sekitar 1.000.000 parameter, berapa banyak data pelatihan yang diperlukan (anggap saya sedang melakukan penurunan gradien stokastik)? Apakah ada aturan praktis? Catatan tambahan: Ketika saya melakukan penurunan gradien stokastik (mis., 64 tambalan untuk 1 iterasi), setelah ~ 10.000 iterasi, akurasi classifier dapat …


1
Bagaimana "Teorema Dasar Analisis Faktor" berlaku untuk PCA, atau bagaimana pemuatan PCA didefinisikan?
Saya saat ini akan melalui set slide yang saya miliki untuk "analisis faktor" (PCA sejauh yang saya tahu). Di dalamnya, "teorema fundamental analisis faktor" diturunkan yang mengklaim bahwa matriks korelasi dari data yang dimasukkan ke dalam analisis ( ) dapat dipulihkan dengan menggunakan matriks pemuatan faktor ( A ):RR\bf RSEBUAHSEBUAH\bf …

2
Melaporkan derajat kebebasan untuk uji-Welch
Uji t Welch untuk varian yang tidak sama (juga dikenal sebagai Welch-Satterthwaite atau Welch-Aspin) umumnya memiliki derajat kebebasan yang tidak bilangan bulat . Bagaimana seharusnya tingkat kebebasan ini dikutip ketika melaporkan hasil tes? "Adalah konvensional untuk membulatkan ke bilangan bulat terdekat sebelum berkonsultasi dengan tabel t standar" menurut berbagai sumber …


1
Mengapa definisi penaksir konsisten seperti itu? Bagaimana dengan definisi alternatif konsistensi?
Kutipan dari wikipedia: Dalam statistik, penduga yang konsisten atau penduga yang konsisten secara asimptotik adalah penduga — aturan untuk menghitung estimasi parameter θ∗θ∗θ^* —memiliki properti yang karena jumlah titik data yang digunakan meningkat tanpa batas, urutan hasil estimasi konvergen dalam probabilitas untuk θ∗θ∗θ^* . Untuk membuat pernyataan ini tepat, biarkan …



1
Bagaimana cara menggunakan Metode Delta sedangkan turunan orde pertama adalah nol?
http://en.wikipedia.org/wiki/Delta_method Dalam artikel Wikipedia, diasumsikan bahwa g′( θ )g′(θ)g'(\theta) harus ada dan tidak bernilai nol. Apakah mungkin untuk menemukan distribusi asimptotik untuk mengingat bahwa mungkin nol dan √g′( θ )g′(θ)g'(\theta)n--√( g( Xn) - g( θ ) )n(g(Xn)-g(θ))\sqrt{n}(g(X_n)-g(\theta)) g′( θ )g′(θ)g'(\theta)n--√( Xn- θ ) →dN( 0 , σ2)n(Xn-θ)→dN(0,σ2)\sqrt{n}(X_n-\theta) \stackrel{d}{\rightarrow} N(0,\sigma^2)?

3
Teori Respon Item vs Analisis Faktor Konfirmatori
Saya bertanya-tanya apa inti, perbedaan yang bermakna antara Item Response Theory dan Confirmatory Factor Analysis. Saya mengerti bahwa ada perbedaan dalam perhitungan (lebih fokus pada item vs kovarian; log-linear vs linear). Namun, saya tidak tahu apa artinya ini dari perspektif tingkat yang lebih tinggi - apakah ini berarti bahwa IRT …


5
Apa sebenarnya data yang disensor?
Saya telah membaca berbagai deskripsi data yang disensor: A) Sebagaimana dijelaskan dalam utas ini , data yang tidak dikuantifikasi di bawah atau di atas ambang tertentu disensor. Tidak dikenali berarti data di atas atau di bawah ambang tertentu tetapi kami tidak tahu nilai pastinya. Data kemudian ditandai pada nilai ambang …

3
Bootstrap: masalah overfitting
Misalkan seseorang melakukan apa yang disebut bootstrap non-parametrik dengan menggambar sampel ukuran masing-masing dari pengamatan asli dengan penggantian. Saya percaya prosedur ini setara dengan memperkirakan fungsi distribusi kumulatif oleh cdf empiris:n nBBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function dan kemudian mendapatkan sampel bootstrap dengan mensimulasikan pengamatan dari estimasi cdf kali berturut-turut.BnnnBBB Jika saya benar dalam …

2
k-means vs k-median?
Saya tahu ada algoritma pengelompokan k-means dan k-median. Satu yang menggunakan mean sebagai pusat cluster dan yang lainnya menggunakan median. Pertanyaan saya adalah: kapan / di mana menggunakannya?

1
Pita keyakinan untuk saluran QQ
Pertanyaan ini tidak secara khusus berkaitan R, tetapi saya memilih untuk menggunakannya Runtuk menggambarkannya. Pertimbangkan kode untuk membuat band-band kepercayaan diri di sekitar qq-line (normal): library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Saya mencari penjelasan (atau alternatif tautan ke kertas / dokumen daring yang menjelaskan) bagaimana pita kepercayaan ini dibangun (saya telah melihat …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.