Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Perbandingan antara Newey-West (1987) dan Hansen-Hodrick (1980)
Pertanyaan: Apa perbedaan utama dan persamaan antara menggunakan kesalahan standar Newey-West (1987) dan Hansen-Hodrick (1980)? Dalam situasi apa salah satu dari ini lebih disukai daripada yang lain? Catatan: Saya tahu bagaimana masing-masing prosedur penyesuaian ini bekerja; namun, saya belum menemukan dokumen apa pun yang akan membandingkannya, baik online atau di …




4
Nilai yang diharapkan vs. nilai yang paling mungkin (mode)
Nilai yang diharapkan dari distribusi adalah rata-rata, yaitu nilai rata-rata tertimbang E [ x ] = ∫ + ∞ - ∞ xf(x)f(x)f(x)E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx Nilai yang paling mungkin adalah mode, itu adalah nilai yang paling mungkin. Namun apakah kita berharap untuk melihat berkali-kali? Mengutip dari sini :E[x]E[x]E[x] …


2
Notasi matriks untuk regresi logistik
Dalam regresi linear (kerugian kuadrat), menggunakan matriks kami memiliki notasi yang sangat ringkas untuk tujuan minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 Di mana adalah matriks data, adalah koefisien, dan adalah respons.x bAAAxxxbbb Apakah ada notasi matriks yang serupa untuk tujuan regresi logistik? Semua notasi yang saya lihat tidak dapat menghilangkan jumlah atas …

2
Regresi bertahap di R - Bagaimana cara kerjanya?
Saya mencoba memahami perbedaan mendasar antara regresi bertahap dan mundur dalam R menggunakan fungsi langkah. Untuk regresi bertahap saya menggunakan perintah berikut step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") Saya mendapat output di bawah ini untuk kode di atas. Untuk pemilihan variabel mundur saya menggunakan perintah berikut step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") Dan saya mendapat output di bawah ini untuk …
15 r  regression 

3
Apakah kita benar-benar perlu memasukkan "semua prediksi yang relevan?"
Asumsi dasar menggunakan model regresi untuk inferensi adalah bahwa "semua prediktor yang relevan" telah dimasukkan dalam persamaan prediksi. Alasannya adalah bahwa kegagalan untuk memasukkan faktor dunia nyata yang penting mengarah pada koefisien bias dan dengan demikian kesimpulan yang tidak akurat (yaitu, bias variabel dihilangkan). Tetapi dalam praktik penelitian, saya belum …

5
Masalah singularitas dalam model campuran Gaussian
Dalam bab 9 buku Pengenalan pola dan pembelajaran mesin, ada bagian ini tentang model campuran Gaussian: Sejujurnya saya tidak begitu mengerti mengapa ini akan menciptakan singularitas. Adakah yang bisa menjelaskan hal ini kepada saya? Maaf, saya hanya sarjana dan pemula dalam pembelajaran mesin, jadi pertanyaan saya mungkin terdengar sedikit konyol, …

3
Regresi Logistik: Belajar Scikit vs glmnet
Saya mencoba untuk menduplikasi hasil dari sklearnperpustakaan regresi logistik menggunakan glmnetpaket di R. sklearnminw,c12wTw+C∑i=1Nlog(exp(−yi(XTiw+c))+1)minw,c12wTw+C∑i=1Nlog⁡(exp⁡(-ysaya(XsayaTw+c))+1)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) Dari sketsa dari glmnet, pelaksanaannya meminimalkan biaya yang sedikit berbeda fungsi minβ,β0- [ 1N∑i =1Nysaya(β0+xTsayaβ) - log( 1 + e( β0+ xTsayaβ)) ] + λ [ ( α - …


3
Untuk pengklasifikasi linier, apakah koefisien yang lebih besar menyiratkan fitur yang lebih penting?
Saya seorang insinyur perangkat lunak yang sedang mengerjakan pembelajaran mesin. Dari pemahaman saya, regresi linier (seperti OLS) dan klasifikasi linier (seperti regresi logistik dan SVM) membuat prediksi berdasarkan produk dalam antara koefisien terlatih dan variabel fitur → x :w⃗ w→\vec{w}x⃗ x→\vec{x} y^= f( b⃗ ⋅ x⃗ ) = f( ∑sayawsayaxsaya)y^=f(w→⋅x→)=f(∑sayawsayaxsaya) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.