Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Pro dan Kontra dari Tautan Log vs. Tautan Identitas untuk Regresi Poisson
Saya melakukan regresi Poisson dengan tujuan akhir membandingkan (dan mengambil perbedaan) rata-rata yang diprediksi dihitung antara dua tingkat faktor dalam model saya: , sambil memegang kovariat model lain (yang semuanya biner) konstan. Saya bertanya-tanya apakah ada yang bisa memberikan saran praktis tentang kapan harus menggunakan tautan log versus tautan identitas. …

2
Regresi ketika setiap titik memiliki ketidakpastiannya sendiri dalam
Saya membuat pengukuran dua variabel dan . Mereka berdua mengetahui ketidakpastian dan terkait dengannya. Saya ingin menemukan hubungan antara dan . Bagaimana saya bisa melakukannya?x y σ x σ y x ynnnxxxyyyσxσx\sigma_xσyσy\sigma_yxxxyyy EDIT : setiap memiliki terkait dengannya, dan sama dengan .σ x , i y ixsayaxix_iσx , sayaσx,i\sigma_{x,i}ysayayiy_i Contoh …




2
Ekspektasi Maksimum dari Variabel Gumbel id
Saya terus membaca di jurnal ekonomi tentang hasil tertentu yang digunakan dalam model utilitas acak. Salah satu versi hasilnya adalah: jika ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, Gumbel ( μ,1),∀iμ,1),∀i\mu, 1), \forall i , maka: E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), dengan γ≈0.52277γ≈0.52277\gamma \approx 0.52277 adalah konstanta Euler-Mascheroni. …

2
Definisi AIC berbeda
Dari Wikipedia ada definisi Akaike Information Criterion (AIC) sebagai , di mana adalah jumlah parameter dan \ log L adalah log-kemungkinan model.k log LAIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L Namun, Ekonometrik kami mencatat di universitas yang dihormati bahwa AIC=log(σ^2)+2⋅kTAIC=log⁡(σ^2)+2⋅kT AIC = \log (\hat{\sigma}^2) + \frac{2 \cdot k}{T} …

2
Matriks kovarians yang dikondisikan buruk dalam regresi GP untuk optimisasi Bayesian
Latar belakang dan masalah Saya menggunakan Proses Gaussian (GP) untuk regresi dan optimasi Bayesian berikutnya (BO). Untuk regresi saya menggunakan paket gpml untuk MATLAB dengan beberapa modifikasi custom-made, tetapi masalahnya umum. Adalah fakta yang diketahui bahwa ketika dua input pelatihan terlalu dekat dalam ruang input, matriks kovarians dapat menjadi tidak-pasti …

2
Jumlah skor penilaian vs skor faktor yang diperkirakan?
Saya tertarik untuk menerima saran tentang kapan harus menggunakan " skor faktor " dibandingkan jumlah skor saat membuat skala. Yaitu metode "Refined" daripada "non-refined" untuk menilai suatu faktor. Dari DiStefano et al. (2009; pdf ), penekanan ditambahkan: Ada dua kelas utama metode perhitungan skor faktor: disempurnakan dan tidak disempurnakan. Metode …

3
Mengapa penting untuk membuat perbedaan antara regresi "linear" versus "non-linear"?
Apa pentingnya perbedaan antara model linear dan non-linear? Pertanyaannya Nonlinear vs generalised model: Bagaimana Anda merujuk pada regresi logistik, Poisson, dll.? dan jawabannya adalah klarifikasi yang sangat membantu tentang linearitas / non-linearitas model linier umum. Tampaknya sangat penting untuk membedakan model linear dari model non-linear, tetapi tidak jelas bagi saya …

2
Apakah teorema Slutsky masih valid ketika dua sekuens keduanya konvergen ke variabel acak non-degenerasi?
Saya bingung tentang beberapa detail tentang teorema Slutsky : Biarkan {Xn}{Xn}\{X_n\} , {Yn}{Yn}\{Y_n\} menjadi dua urutan elemen skalar / vektor / matriks acak. Jika XnXnX_n konvergen dalam distribusi ke elemen acak XXX dan YnYnY_n konvergen dalam probabilitas ke konstan ccc, maka Xn+Yn XnYn Xn/Yn →d X+c→d cX→d X/c,Xn+Yn →d X+cXnYn …

1
Distribusi probabilitas khusus
Jika p(x)p(x)p(x) adalah distribusi probabilitas dengan nilai bukan nol pada [0,+∞)[0,+∞)[0,+\infty) , untuk tipe p(x)p(x)p(x) apa ada konstanta c>0c>0c\gt 0 sehingga ∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^2untuk semua0<ϵ<10<ϵ<10\lt\epsilon\lt 1? Ketidaksamaan di atas sebenarnya adalah Kullback-Leibler Divergence antara distribusi p(x)p(x)p(x) dan versi terkompresi (1+ϵ)p(x(1+ϵ))(1+ϵ)p(x(1+ϵ)){(1+\epsilon)}p({x}{(1+\epsilon)}) . Saya telah menemukan bahwa ketidaksetaraan ini berlaku …

1
Nilai yang diharapkan dari
Saya ingin tahu tentang pernyataan yang dibuat di bagian bawah halaman pertama dalam teks ini mengenai penyesuaianR2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). Teks menyatakan: Logika penyesuaian adalah sebagai berikut: dalam regresi berganda biasa, prediktor acak menjelaskan rata-rata proporsi dari variasi respons, sehingga m prediktor acak menjelaskan bersama, rata-rata, m / (n - 1) …

2
Turunan dari Proses Gaussian
Saya percaya bahwa turunan dari proses Gaussian (GP) adalah GP lain, dan jadi saya ingin tahu apakah ada persamaan bentuk tertutup untuk persamaan prediksi turunan dari GP? Secara khusus, saya menggunakan kernel kovarian eksponensial kuadrat (juga disebut Gaussian) dan ingin tahu tentang membuat prediksi tentang turunan dari proses Gaussian.


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.