Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bantu saya memahami fungsi quantile (CDF)
Saya membaca tentang fungsi kuantil, tetapi tidak jelas bagi saya. Bisakah Anda memberikan penjelasan yang lebih intuitif daripada yang disediakan di bawah ini? Karena cdf FFF adalah fungsi yang meningkat secara monoton, ia memiliki kebalikan; mari kita nyatakan ini dengan F−1F−1F^{−1} . Jika FFF adalah cdf dari XXX , maka …

1
Kapan model campuran nol-korelasi secara teoritis baik?
Kutipan blok di bawah ini, dari para pemimpin di bidang pemodelan efek campuran, mengklaim bahwa mengoordinasikan pergeseran dalam model dengan korelasi nol antara efek acak (model 'ZCP') mengubah prediksi model. Tapi, bisakah seseorang menguraikan atau lebih jauh membenarkan klaim mereka? Pernyataan yang dipertanyakan berasal dari makalah Bates et al 2015 …

0
Distribusi Jaynes
Dalam buku Jaynes "Probability Theory: The Logic of Science" , Jaynes memiliki bab (Bab 18) berjudul " Distribusi dan aturan suksesi" di mana ia memperkenalkan ide distribusi , yang mana bagian ini membantu menggambarkan:ApApA_pApApA_p [...] Untuk melihatnya, bayangkan efek mendapatkan informasi baru. Misalkan kita melemparkan koin lima kali dan muncul …

1
Pembelajaran streaming yang canggih
Saya telah bekerja dengan kumpulan data besar belakangan ini dan menemukan banyak makalah metode streaming. Untuk beberapa nama: Ikuti-the-Regularized-Leader dan Mirror Descent: Teorema Kesetaraan dan Regularisasi L1 ( http://jmlr.org/proceedings/papers/v15/mcmahan11b/mcmahan11b.pdf ) Streamed Learning: One-Pass SVMs ( http://www.umiacs.umd.edu/~hal/docs/daume09onepass.pdf ) Pegasos: Primal Estimasi sub-GrAdient SOlver untuk SVM http://ttic.uchicago.edu/~nati/Publications/PegasosMPB.pdf atau di sini: Dapatkah SVM …

4
Untuk apa peringkat kepentingan variabel berguna?
Saya telah menjadi semacam nihilis ketika datang ke peringkat tingkat kepentingan variabel (dalam konteks model multivarian dari semua jenis). Seringkali dalam perjalanan pekerjaan saya, saya diminta untuk membantu tim lain menghasilkan peringkat kepentingan variabel, atau menghasilkan peringkat kepentingan variabel dari pekerjaan saya sendiri. Menanggapi permintaan ini, saya mengajukan pertanyaan berikut …


2
Bias penaksir momen dari distribusi lognormal
Saya melakukan beberapa percobaan numerik yang terdiri dari pengambilan sampel distribusi lognormal X∼LN(μ,σ)X∼LN(μ,σ)X\sim\mathcal{LN}(\mu, \sigma) , dan mencoba memperkirakan momen dengan dua metode:E[Xn]E[Xn]\mathbb{E}[X^n] Melihat rata-rata sampelXnXnX^n Memperkirakan dan dengan menggunakan mean sampel untuk , dan kemudian menggunakan fakta bahwa untuk distribusi lognormal, kita memiliki .σ 2μμ\muσ2σ2\sigma^2E [ X n ] = …

2
Diagnostik untuk model linier umum (campuran) (khususnya residu)
Saat ini saya kesulitan menemukan model yang tepat untuk data penghitungan yang sulit (variabel dependen). Saya telah mencoba berbagai model yang berbeda (model efek campuran diperlukan untuk jenis data saya) seperti lmerdan lme4(dengan log transformasi) serta model efek campuran linier umum dengan berbagai keluarga seperti Gaussian atau binomial negatif. Namun, …

5
Estimasi Kemungkinan Maksimum - mengapa digunakan meskipun bias dalam banyak kasus
Estimasi kemungkinan maksimum seringkali menghasilkan estimasi bias (mis. Estimasi untuk varians sampel bias untuk distribusi Gaussian). Lalu apa yang membuatnya begitu populer? Mengapa persisnya itu digunakan begitu banyak? Juga, apa yang secara khusus membuatnya lebih baik daripada pendekatan alternatif - metode momen? Juga, saya perhatikan bahwa untuk Gaussian, penskalaan sederhana …


4
Memvisualisasikan banyak variabel dalam satu plot
Saya ingin menunjukkan bagaimana nilai-nilai variabel tertentu (~ 15) berubah seiring waktu, tetapi saya juga ingin menunjukkan bagaimana variabel berbeda satu sama lain di setiap tahun. Jadi saya membuat plot ini: Tetapi bahkan ketika mengubah skema warna atau menambahkan jenis garis / bentuk yang berbeda ini terlihat berantakan. Apakah ada …

5
Bagaimana komponen utama teratas dapat mempertahankan daya prediksi pada variabel dependen (atau bahkan mengarah ke prediksi yang lebih baik)?
Misalkan Saya menjalankan regresi . Mengapa dengan memilih komponen prinsip k atas X , apakah model mempertahankan daya prediksi pada Y ?Y∼XY∼XY \sim XkkkXXXYYY Saya mengerti bahwa dari dimensi-reduksi / titik fitur-seleksi pandang, jika adalah vektor eigen dari kovarians matriks X dengan top k eigen, maka X v 1 , …

3
Apa hubungan antara ortogonal, korelasi, dan independensi?
Saya telah membaca sebuah artikel yang mengatakan bahwa ketika menggunakan kontras yang direncanakan untuk menemukan cara yang berbeda dalam ANOVA satu arah, konstrast harus ortogonal sehingga mereka tidak berkorelasi dan mencegah kesalahan tipe I dari inflasi. Saya tidak mengerti mengapa ortogonal berarti tidak berkorelasi dalam keadaan apa pun. Saya tidak …


3
Interpretasi regularisasi ridge dalam regresi
Saya punya beberapa pertanyaan tentang penalti punggungan dalam konteks kuadrat terkecil: βridge=(λID+X′X)−1X′yβridge=(λID+X′X)−1X′y\beta_{ridge} = (\lambda I_D + X'X)^{-1}X'y 1) Ekspresi menunjukkan bahwa matriks kovarians X menyusut ke arah matriks diagonal, yang berarti bahwa (dengan asumsi bahwa variabel distandarisasi sebelum prosedur) korelasi antara variabel input akan diturunkan. Apakah interpretasi ini benar? 2) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.