Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Pemahaman geometris PCA dalam ruang subjek (ganda)
Saya mencoba untuk mendapatkan pemahaman intuitif tentang bagaimana analisis komponen utama (PCA) bekerja di ruang subjek (ganda) . Pertimbangkan dataset 2D dengan dua variabel, dan , dan titik data (matriks data adalah dan dianggap berpusat). Presentasi PCA yang umum adalah bahwa kami mempertimbangkan poin dalam , tulis matriks kovarian , …

3
Peristiwa regresi logistik yang langka: bagaimana mensimulasikan p yang diremehkan dengan contoh minimal?
CrossValidated memiliki beberapa pertanyaan tentang kapan dan bagaimana menerapkan koreksi bias peristiwa langka oleh King dan Zeng (2001) . Saya mencari sesuatu yang berbeda: demonstrasi berbasis simulasi minimal bahwa bias ada. Secara khusus, Raja dan negara Zeng "... dalam data kejadian yang jarang, bias dalam probabilitas dapat secara substantif bermakna …


1
Apa yang akan disimpulkan dari plot laso ini (glmnet)
Berikut ini adalah plot glmnet dengan alpha default (1, karenanya laso) menggunakan mtcarsset data dalam R dengan mpgsebagai DV dan yang lainnya sebagai variabel prediktor. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Apa yang bisa kita simpulkan dari plot ini mengenai berbagai variabel, khususnya am, cyldan wt(garis merah, hitam dan biru muda)? Bagaimana kita akan …

3
Mengapa Pearson parametrik dan Spearman non-parametrik
Tampaknya koefisien korelasi Pearson adalah parametrik dan Spearman rho adalah non-parametrik. Saya mengalami kesulitan memahami hal ini. Seperti yang saya pahami, Pearson dihitung sebagai dan Spearman dihitung dengan cara yang sama, kecuali kami mengganti semua nilai dengan peringkat mereka.rx y= c o v ( X, Y)σxσyrxy=cHaiv(X,Y)σxσy r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Wikipedia …

3
Kebingungan dengan tingkat penemuan yang salah dan beberapa pengujian (pada Colquhoun 2014)
Saya telah membaca makalah hebat ini oleh David Colquhoun: Investigasi tingkat penemuan yang salah dan salah tafsir dari nilai-p (2014). Intinya, ia menjelaskan mengapa false discovery rate (FDR) bisa setinggi meskipun kami mengontrol kesalahan tipe I dengan α = 0,05 .30 %30%30\%α = 0,05α=0,05\alpha=0.05 Namun saya masih bingung apa yang …







4
Apa sebenarnya momen itu? Bagaimana mereka diturunkan?
Kami biasanya diperkenalkan dengan metode penduga momen dengan "menyamakan momen populasi dengan sampel pendampingnya" hingga kami memperkirakan semua parameter populasi; sehingga, dalam kasus distribusi normal, kita hanya perlu momen pertama dan kedua karena mereka sepenuhnya menggambarkan distribusi ini. E(X)=μ⟹∑ni=1Xi/n=X¯E(X)=μ⟹∑i=1nXi/n=X¯E(X) = \mu \implies \sum_{i=1}^n X_i/n = \bar{X} E( X2) = μ2+ …

4
Alasan untuk data terdistribusi secara normal
Apa beberapa teorema yang mungkin menjelaskan (yaitu, secara umum) mengapa data dunia nyata mungkin diharapkan terdistribusi secara normal? Ada dua yang saya tahu: Theor Limit Limit Theorem (tentu saja), yang memberitahu kita bahwa jumlah dari beberapa variabel acak independen dengan mean dan varians (bahkan ketika mereka tidak terdistribusi secara identik) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.