Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Haruskah saya membuat keputusan berdasarkan langkah-langkah evaluasi mikro-rata-rata atau rata-rata makro?
Saya menjalankan validasi silang 10 kali lipat pada algoritma klasifikasi biner yang berbeda, dengan dataset yang sama, dan menerima hasil rata-rata Mikro dan Makro. Harus disebutkan bahwa ini adalah masalah klasifikasi multi-label. Dalam kasus saya, negatif sejati dan positif sejati juga diberi bobot yang sama. Itu berarti memprediksi dengan benar …

3
Distribusi perbedaan antara dua distribusi normal
Saya memiliki dua fungsi kepadatan probabilitas dari distribusi normal: f1( x1|μ1, σ1) = 1σ12 π--√e- ( x - μ1)22 σ21f1(x1|μ1,σ1)=1σ12πe-(x-μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } dan f2( x2|μ2, σ2) = 1σ22 π--√e- ( x - μ2)22 σ22f2(x2|μ2,σ2)=1σ22πe-(x-μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = …

1
Mengapa kuasi-Poisson di GLM tidak diperlakukan sebagai kasus khusus binomial negatif?
Saya mencoba menyesuaikan model linier umum untuk beberapa set data jumlah yang mungkin atau mungkin tidak disebarkan secara berlebihan. Dua distribusi kanonik yang berlaku di sini adalah Poisson dan Negative Binomial (Negbin), dengan EV dan variansμμ\mu Va rP= μVSebuahrP=μVar_P = \mu Va rNB= μ + μ2θVSebuahrNB=μ+μ2θVar_{NB} = \mu + \frac{\mu^2}{\theta} …


4
Mengapa data campuran merupakan masalah untuk algoritma pengelompokan berbasis euclidean?
Kebanyakan algoritma pengelompokan dan pengurangan dimensi klasik (pengelompokan hierarkis, analisis komponen utama, k-means, peta pengorganisasian sendiri ...) dirancang khusus untuk data numerik, dan data inputnya dipandang sebagai titik dalam ruang euclidean. Ini tentu saja merupakan masalah, karena banyak pertanyaan di dunia nyata melibatkan data yang dicampur: misalnya jika kita mempelajari …


3
Korelasi aneh dalam hasil SVD dari data acak; apakah mereka memiliki penjelasan matematis atau apakah itu bug LAPACK?
Saya mengamati perilaku yang sangat aneh dalam hasil SVD dari data acak, yang dapat saya tiru di Matlab dan R. Sepertinya beberapa masalah numerik di perpustakaan LAPACK; Apakah itu? Saya menarik n=1000n=1000n=1000 sampel dari k=2k=2k=2 dimensi Gaussian dengan nol mean dan kovarian identitas: X∼N(0,I)X∼N(0,I)X\sim \mathcal N (0, \mathbf I) . …


2
Dalam regresi linier sederhana, dari mana formula untuk varian dari residual berasal?
Menurut teks yang saya gunakan, rumus untuk varian dari sisa diberikan oleh:ithithi^{th} σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) Saya menemukan ini sulit untuk percaya karena residual adalah perbedaan antara nilai diamati dan nilai dipasang; jika seseorang menghitung varians dari perbedaan, paling tidak saya akan mengharapkan beberapa "plus" dalam ekspresi yang dihasilkan. …

3
Arti 'jumlah parameter' dalam AIC
Saat menghitung AIC, AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k berarti 'jumlah parameter'. Tapi apa yang dianggap sebagai parameter? Jadi misalnya dalam model y=ax+by=ax+by = ax + b Apakah a dan b selalu dihitung sebagai parameter? Bagaimana jika saya tidak peduli dengan nilai intersep, dapatkah saya mengabaikannya atau masih …
21 aic 




1
Dua cara menggunakan bootstrap untuk memperkirakan interval kepercayaan koefisien dalam regresi
Saya menerapkan model linier ke data saya: ysaya= β0+ β1xsaya+ ϵsaya,ϵsaya∼ N( 0 , σ2) .ysaya=β0+β1xsaya+ϵsaya,ϵsaya∼N(0,σ2). y_{i}=\beta_{0}+\beta_{1}x_{i}+\epsilon_{i}, \quad\epsilon_{i} \sim N(0,\sigma^{2}). Saya ingin memperkirakan interval kepercayaan (CI) dari koefisien ( , β 1 ) menggunakan metode bootstrap. Ada dua cara agar saya dapat menerapkan metode bootstrap:β0β0\beta_{0}β1β1\beta_{1} Prediktor respons pasangan berpasangan: Secara …

2
Jika k-means clustering adalah suatu bentuk pemodelan campuran Gaussian, dapatkah itu digunakan ketika data tidak normal?
Saya membaca Bishop pada algoritma EM untuk GMM dan hubungan antara GMM dan k-means. Dalam buku ini dikatakan bahwa k-means adalah versi GMM yang sulit. Saya bertanya-tanya apakah itu menyiratkan bahwa jika data yang saya coba kluster bukan Gaussian, saya tidak dapat menggunakan k-means (atau setidaknya itu tidak cocok untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.