Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Mengapa tidak selalu menggunakan pembelajaran ensemble?
Tampak bagi saya bahwa ensemble learning AKAN selalu memberikan kinerja prediksi yang lebih baik daripada hanya dengan satu hipotesis pembelajaran. Jadi, mengapa kita tidak menggunakannya sepanjang waktu? Dugaan saya adalah karena mungkin, keterbatasan komputasi? (meski begitu, kami menggunakan prediktor yang lemah, jadi saya tidak tahu).

1
Bagaimana cara menguji apakah suatu distribusi mengikuti hukum kekuasaan?
Saya memiliki data tentang berapa banyak pengguna memposting berapa banyak pertanyaan. Sebagai contoh, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... Ini berarti bahwa 2 pengguna masing-masing memposting 100 pertanyaan, masing-masing 9 pengguna memposting 10 pertanyaan, dan seterusnya. Jadi, bagaimana saya bisa menentukan apakah UserCount, QuestionCountdistribusi mengikuti hukum …

2
Menggunakan paket caret apakah mungkin untuk mendapatkan matriks kebingungan untuk nilai ambang tertentu?
Saya telah mendapatkan model regresi logistik (via train) untuk respons biner, dan saya telah mendapatkan matriks kebingungan logistik via confusionMatrixin caret. Ini memberi saya matriks kebingungan model logistik, meskipun saya tidak yakin apa ambang batas yang digunakan untuk mendapatkannya. Bagaimana cara mendapatkan matriks kebingungan untuk nilai ambang batas tertentu menggunakan …


2
Turunkan distribusi Poisson bivariat
Saya baru-baru ini menemukan distribusi Poisson bivariat, tapi saya agak bingung bagaimana itu bisa diturunkan. Distribusi diberikan oleh: P(X=x,Y=y)=e−(θ1+θ2+θ0)θx1x!θy2y!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X=x,Y=y)=e−(θ1+θ2+θ0)θ1xx!θ2yy!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X = x, Y = y) = e^{-(\theta_{1}+\theta_{2}+\theta_{0})} \displaystyle\frac{\theta_{1}^{x}}{x!}\frac{\theta_{2}^{y}}{y!} \sum_{i=0}^{min(x,y)}\binom{x}{i}\binom{y}{i}i!\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)^{i} Dari apa yang saya dapat kumpulkan, istilah θ0θ0\theta_{0} adalah ukuran korelasi antara XXX dan YYY ; karenanya, ketika XXX dan YYY bersifat …

4
Bagaimana perbedaan validasi silang dengan pengintaian data?
Saya baru saja menyelesaikan "Pengantar Pembelajaran Statistik" . Saya bertanya-tanya apakah menggunakan cross-validation untuk menemukan parameter tuning terbaik untuk berbagai teknik pembelajaran mesin berbeda dari pengintaian data? Kami berulang kali memeriksa nilai parameter tuning mana yang menghasilkan hasil prediksi terbaik di set uji. Bagaimana jika parameter penyetelan yang kami tiba …

2
Variabel acak seragam diskrit (?) Mengambil semua nilai rasional dalam interval tertutup
Saya baru saja mengalami serangan panik (intelektual). Variabel acak kontinu yang mengikuti seragam dalam interval tertutup U(a,b)U(a,b)U(a,b) : konsep statistik yang akrab dengan nyaman. Seragam yang berkesinambungan yang memiliki dukungan terhadap real yang diperluas (setengah atau seluruhnya): bukan yang layak, tetapi konsep Bayesian dasar untuk prior, berguna, dan dapat diterapkan …


2
Model asumsi regresi partial least square (PLS)
Saya mencoba mencari informasi mengenai asumsi regresi PLS (tunggal ). Saya terutama tertarik pada perbandingan asumsi PLS sehubungan dengan orang-orang dari regresi OLS. yyy Saya telah membaca / membaca sekilas banyak literatur tentang topik PLS; makalah oleh Wold (Svante dan Herman), Abdi, dan banyak lainnya tetapi belum menemukan sumber yang …

1
MLE dari parameter lokasi dalam distribusi Cauchy
Setelah pemusatan, dua pengukuran x dan −x dapat diasumsikan sebagai pengamatan independen dari distribusi Cauchy dengan fungsi kerapatan probabilitas: f(x:θ)=f(x:θ)=f(x :\theta) = 1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Tunjukkan bahwa jika MLE dari θ adalah 0, tetapi jika x 2 &gt; 1 ada dua MLE's dari θ , …

1
Mengapa menggunakan bootstrap parametrik?
Saat ini saya mencoba untuk mendapatkan beberapa hal tentang bootstrap parametrik. Kebanyakan hal mungkin sepele tetapi saya masih berpikir saya mungkin melewatkan sesuatu. Misalkan saya ingin mendapatkan interval kepercayaan untuk data menggunakan prosedur bootstrap parametrik. Jadi saya punya sampel ini dan saya asumsikan terdistribusi normal. Saya kemudian akan memperkirakan varians …


2
menggunakan informasi tetangga dalam memasukkan data atau mencari off-data (dalam R)
Saya memiliki dataset dengan asumsi bahwa tetangga terdekat adalah prediktor terbaik. Hanya contoh sempurna dari gradien dua arah divisualisasikan- Misalkan kita memiliki kasus di mana beberapa nilai hilang, kita dapat dengan mudah memprediksi berdasarkan tetangga dan tren. Matriks data yang sesuai dalam R (contoh boneka untuk latihan): miss.mat &lt;- matrix …

3
Kriteria apa yang harus dipenuhi untuk menyimpulkan 'efek langit-langit' yang terjadi?
Menurut The SAGE Encyclopedia of Metode Penelitian Ilmu Sosial ... [a] efek langit-langit terjadi ketika suatu ukuran memiliki batas atas yang berbeda untuk respons potensial dan konsentrasi besar skor peserta pada atau dekat batas ini. Redaman skala adalah masalah metodologis yang terjadi setiap kali varians dibatasi dengan cara ini. ... …

2
Kausalitas dalam mikroekonometrik versus kausalitas granger dalam ekonometrik deret waktu
Saya memahami kausalitas seperti yang digunakan dalam ekonomi mikro (khususnya IV atau desain diskontinuitas regresi) dan juga kausalitas Granger seperti yang digunakan dalam ekonometrik time-series. Bagaimana saya berhubungan satu sama lain? Sebagai contoh, saya telah melihat kedua pendekatan yang digunakan untuk data panel (katakanlah , ). Referensi ke makalah dalam …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.