Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Mengapa Anda harus memberikan model variogram saat Anda melakukan kriging?
Saya sangat baru dalam statistik spasial dan menonton banyak tutorial, Tapi saya tidak benar-benar mengerti mengapa Anda harus memberikan model variogram ketika Anda krige. Saya menggunakan paket gstat di R, dan ini adalah contoh yang mereka berikan: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m <- vgm(.59, …
9 spatial 



2
Clustering data yang berisik atau dengan outlier
Saya memiliki data berisik dari dua variabel seperti ini. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, …

1
Membakukan fitur saat menggunakan LDA sebagai langkah pra-pemrosesan
Jika Analisis Diskriminan Linier multi-kelas (atau saya juga membaca Analisis Diskriminan Berganda kadang-kadang) digunakan untuk pengurangan dimensi (atau transformasi setelah pengurangan dimensi melalui PCA), saya memahami bahwa secara umum "normalisasi Z-score" (atau standardisasi) dari fitur tidak akan diperlukan, bahkan jika diukur pada skala yang sama sekali berbeda, benar? Karena LDA …

1
Mengapa algoritma EM harus berulang?
Misalkan Anda memiliki populasi dengan unit, masing-masing dengan variabel acak . Anda mengamati nilai untuk setiap unit yang . Kami ingin perkiraan .X i ∼ Poisson ( λ ) n = N - n 0 X i > 0 λNNNXsaya∼ Poisson ( λ )Xi∼Poisson(λ)X_i \sim \text{Poisson}(\lambda)n = N- n0n=N−n0n = …

1
Memahami Dekomposisi Nilai Singular dalam konteks LSI
Pertanyaan saya umumnya pada Dekomposisi Nilai Singular (SVD), dan khususnya tentang Latent Semantic Indexing (LSI). Katakanlah, saya memiliki yang berisi frekuensi 5 kata untuk 7 dokumen.SEBUAHw o r d× do c u m e n tAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- …

2
Sejarah: peran statistik dalam astronomi
Saya baru-baru ini dengan berani mengklaim di depan sekelompok siswa kelas delapan yang cukup pintar bahwa astronomi berkontribusi besar pada fondasi statistik dan banyak konsep statistik diciptakan untuk digunakan dalam astronomi. Namun, melihat ke belakang itu, saya cukup kecewa. Kesalahan, rerata dan penyimpangan median dari rerata mungkin pertama kali diamati …

2
Mengapa korelasi pangkat Pearson valid meskipun ada asumsi normalitas?
Saat ini saya membaca asumsi untuk korelasi Pearson. Asumsi penting untuk uji-t berikutnya tampaknya adalah bahwa kedua variabel berasal dari distribusi normal; jika tidak, maka penggunaan langkah-langkah alternatif seperti Spearman rho dianjurkan. Korelasi Spearman dihitung seperti korelasi Pearson, hanya menggunakan jajaran X dan Y, bukan X dan Y sendiri, benar? …

1
Berapa CDF dua sampel dari dan dari Tes Kolmogorov-Smirnov satu sisi?
Saya mencoba memahami cara mendapatkan nilai- untuk tes Kolmogorov-Smirnov satu sisi , dan saya berjuang untuk menemukan CDF untuk dan dalam kasus dua sampel. Di bawah ini dikutip di beberapa tempat sebagai CDF untuk dalam satu contoh kasus:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 …

1
Dekomposisi aditif vs multiplikasi
Pertanyaan saya adalah pertanyaan yang sangat sederhana, tetapi itu adalah pertanyaan yang benar-benar membuat saya :) Saya tidak benar-benar tahu bagaimana cara mengevaluasi apakah rangkaian waktu tertentu akan diuraikan menggunakan aditif atau metode dekomposisi multiplikatif. Saya tahu ada isyarat visual untuk membedakan mereka satu sama lain tetapi saya tidak mengerti. …

2
Memperkirakan rasio risiko yang disesuaikan dalam data biner menggunakan regresi Poisson
Saya tertarik untuk memperkirakan rasio risiko yang disesuaikan, analog dengan bagaimana seseorang memperkirakan rasio odds yang disesuaikan menggunakan regresi logistik. Beberapa literatur (misalnya, ini ) menunjukkan bahwa menggunakan regresi Poisson dengan kesalahan standar Huber-White adalah cara berbasis model untuk melakukan ini Saya belum menemukan literatur tentang bagaimana penyesuaian untuk kovariat …

1
Mensimulasikan Konvergensi dalam Probabilitas ke konstanta
Hasil asimptotik tidak dapat dibuktikan dengan simulasi komputer, karena mereka adalah pernyataan yang melibatkan konsep infinity. Tetapi kita harus bisa mendapatkan perasaan bahwa segala sesuatunya benar-benar berbaris seperti yang dikatakan teori. Pertimbangkan hasil teoretis limn→∞P(|Xn|>ϵ)=0,ϵ>0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 di mana XnXnX_n adalah fungsi dari nnn variabel acak, katakanlah …

1
Berlebihan dengan variabel kategori
Saya ingin melakukan kombinasi oversampling dan undersampling untuk menyeimbangkan dataset saya dengan sekitar 4000 pelanggan dibagi menjadi dua kelompok, di mana salah satu grup memiliki proporsi sekitar 15%. Saya telah melihat SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) dan ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), tetapi keduanya membuat sampel sintetis baru menggunakan pengamatan yang …

1
Apa hubungan antara ukuran keandalan skala (alpha Cronbach dll.) Dan pemuatan komponen / faktor?
Katakanlah saya memiliki dataset dengan skor pada banyak item kuesioner, yang secara teoritis terdiri dari sejumlah skala yang lebih kecil, seperti dalam penelitian psikologi. Saya tahu pendekatan umum di sini adalah untuk memeriksa keandalan skala menggunakan alpha Cronbach atau sesuatu yang serupa, kemudian mengumpulkan item dalam skala untuk membentuk skor …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.