Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
X, Y variabel acak univariat dengan
Membiarkan X:Ω→RX:Ω→RX:\Omega\to\mathbb{R} dan Y:Ω→RY:Ω→RY:\Omega\to\mathbb{R} menjadi variabel acak univariat dengan CDF FX,Y(x,y)FX,Y(x,y)F_{X,Y}(x,y) seperti yang: FX,Y(x,y)=G1(x)G2(y),∀(x,y)∈R×RFX,Y(x,y)=G1(x)G2(y),∀(x,y)∈R×R F_{X,Y}(x,y)=G_1(x)G_2(y),\forall (x,y)\in\mathbb{R}\times\mathbb{R} dimana G1:R→RG1:R→RG_1:\mathbb{R}\to\mathbb{R}, G2:R→RG2:R→RG_2:\mathbb{R}\to\mathbb{R} dikenal fungsinya. Pertanyaan : Benarkah ituXXX dan YYY Apakah RV independen? Adakah yang bisa memberi saya beberapa petunjuk? Saya mencoba untuk: FX(x)=limy→∞FX,Y(x,y)=limy→∞G1(x)G2(y)=G1(x)⋅limy→∞G2(y)FX(x)=limy→∞FX,Y(x,y)=limy→∞G1(x)G2(y)=G1(x)⋅limy→∞G2(y) F_X(x)=\lim_{y\to\infty}F_{X,Y}(x,y)=\lim_{y\to\infty}G_1(x)G_2(y)=G_1(x)\cdot\lim_{y\to\infty}G_2(y) tapi saya tidak tahu mengapa (atau jika) .limy→∞G2(y)=1limy→∞G2(y)=1\lim_{y\to\infty}G_2(y)=1

1
Mengapa PDF Distribusi Dirichlet tampaknya tidak berintegrasi ke 1?
Saya telah mencoba untuk menemukan nilai yang diharapkan dari fungsi variabel acak dengan distribusi Dirichlet dengan mengintegrasikan produknya dengan fungsi kepadatan Dirichlet melalui simpleks dalam R. Untuk memeriksa saya menerapkan fungsi yang benar dalam R, saya mencoba mengintegrasikan fungsi kerapatan pada seluruh simpleks, berharap untuk mendapatkan 1, namun saya terus …

1
estimasi paket kepadatan kernel dengan kernel Epanechnikov
Saya sedang bekerja dengan kumpulan data "geyser" dari paket MASS dan membandingkan perkiraan kepadatan kernel dari paket np. Masalah saya adalah untuk memahami estimasi kepadatan menggunakan cross-validasi kuadrat terkecil dan kernel Epanechnikov: blep<-npudensbw(~geyser$waiting,bwmethod="cv.ls",ckertype="epanechnikov") plot(npudens(bws=blep)) Untuk kernel Gaussian sepertinya baik-baik saja: blga<-npudensbw(~geyser$waiting,bwmethod="cv.ls",ckertype="gaussian") plot(npudens(bws=blga)) Atau jika saya menggunakan kernel Epanechnikov dan kemungkinan …






1
Bisakah Anda menggunakan tes Kolmogorov-Smirnov untuk langsung menguji kesetaraan dua distribusi?
Ada pembicaraan tentang pertanyaan lain tentang bagaimana seseorang dapat menggunakan pendekatan Two-Sided Tests (TOST) untuk tes Kolmogorov-Smirnov (KS), tetapi saya bertanya-tanya apakah mungkin untuk langsung menggunakan statistik uji untuk menunjukkan bahwa dua distribusi serupa? Sejauh yang saya mengerti, statistik uji KS mewakili perbedaan terbesar antara dua CDF, dengan versi satu-sampel …

3
Mengapa GLM memprediksi mean dan bukan mode?
Mengapa GLM memprediksi mean dan bukan mode sinyal? Bukankah ini bertentangan dengan dasar di balik GLM, yaitu kemungkinan maksimum? Persamaan untuk memecahkan parameter model dalam GLM didasarkan pada maksimalisasi kemungkinan seperti yang dijelaskan oleh distribusi probabilitas dari sinyal yang dimodelkan. Distribusi probabilitas ini maksimum untuk mode bukan untuk rata - …

1
Kapan menggunakan LDA daripada GMM untuk pengelompokan?
Saya memiliki dataset yang berisi aktivitas pengguna dengan 168 dimensi, di mana saya ingin mengekstraksi kluster menggunakan pembelajaran tanpa pengawasan. Tidak jelas bagi saya apakah akan menggunakan pendekatan pemodelan topik dalam alokasi Latent Dirichlet (LDA) atau Gaussian Mixture Model (GMM), yang lebih merupakan pendekatan Bayesian. Dalam hal itu saya punya …



2
Mengapa beberapa perkiraan regresi berbeda dengan perubahan tanda, tetapi yang lain tidak, ketika saya mengubah tingkat referensi?
Misalkan saya memiliki hasil yang terus menerus ydan dua prediktor faktorial, masing-masing dengan dua level. Salah satu prediktor kategori saya drug,, dapat memiliki dua level ("A" atau "B"), yang lain adalah smokeYes. Ketika saya menjalankan model regresi saya dapat memilih garis dasar atau tingkat referensi druguntuk menjadi "A", seperti yang …

2
OLS dalam hal sarana dan ukuran sampel
Diberikan model: y=β0+β1⋅f+uy=β0+β1⋅f+u y = \beta_0 + \beta_1 \cdot f + u Di mana adalah dummy jika betina dan sebaliknya, y adalah tinggi dalam cm. Ukuran sampel adalah secara total. Selanjutnya dan . Hitung estimasi parameter.fff=1=1=1000nfemale=nmale=100→200nfemale=nmale=100→200n_{female}=n_{male}=100 \rightarrow 200y¯male=175y¯male=175\bar{y}_{male} = 175y¯female=165y¯female=165\bar{y}_{female}=165 Usaha saya: Menggunakan rumus well know: β^=(X′X)−1X′yβ^=(X′X)−1X′y \boldsymbol{\hat{\beta}} = (\boldsymbol{X}'\boldsymbol{X})^{-1} …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.