Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Distribusi lebih dari daftar yang diurutkan
Katakanlah kita memiliki daftar barang yang dipesan [a, b, c, ... x, y, z, ...] Saya mencari keluarga distribusi dengan dukungan pada daftar di atas yang diatur oleh beberapa parameter alpha sehingga: Untuk alpha = 0, ia menetapkan probabilitas 1 ke item pertama, a di atas, dan 0 ke yang …

2
Independensi rata-rata bersyarat menyiratkan ketidakberpihakan dan konsistensi estimator OLS
Pertimbangkan model regresi berganda berikut:Y=Xβ+Zδ+U.(1)(1)Y=Xβ+Zδ+U.Y=X\beta+Z\delta+U.\tag{1} Di sini adalah vektor vektor kolom; Matriks a ; a vektor kolom; a matriks; a vektor kolom; dan , istilah kesalahan, vektor kolom .YYYn×1n×1n\times 1XXXn×(k+1)n×(k+1)n\times (k+1)ββ\beta(k+1)×1(k+1)×1(k+1)\times 1ZZZn×ln×ln\times lδδ\deltal×1l×1l\times 1UUUn×1n×1n\times1 PERTANYAAN Dosen saya, buku teks Pengantar Ekonometrika, edisi ke-3. oleh James H. Stock dan Mark W. …

3
Variabel indikator untuk data biner: {-1,1} vs {0,1}
Saya tertarik pada interaksi perlakuan-kovariat dalam konteks eksperimen / percobaan terkontrol acak, dengan perawatan tugas indikator biner .TTT Bergantung pada metode / sumber spesifik, saya telah melihat masing-masing dan masing-masing untuk subjek yang dirawat dan yang tidak diobati.T={1,0}T={1,0}T=\{1,0\}T={1,−1}T={1,−1}T=\{1, -1\} Apakah ada aturan praktis kapan harus menggunakan atau ?{1,0}{1,0}\{1,0\}{1,−1}{1,−1}\{1, -1\} Apa …


2
Pengujian untuk koefisien signifikansi dalam regresi logistik Lasso
[Pertanyaan serupa ditanyakan di sini tanpa jawaban] Saya telah cocok dengan model regresi logistik dengan L1 regularisasi (regresi logistik Lasso) dan saya ingin menguji koefisien yang dipasang untuk signifikansi dan mendapatkan nilai-p mereka. Saya tahu tes Wald (misalnya) adalah pilihan untuk menguji signifikansi koefisien individu dalam regresi penuh tanpa regularisasi, …

1
Hitung prediksi efek acak secara manual untuk model campuran linier
Saya mencoba menghitung prediksi efek acak dari model campuran linier dengan tangan, dan menggunakan notasi yang diberikan oleh Wood dalam Generalized Additive Models: sebuah pengantar dengan R (pg 294 / pg 307 pdf), saya semakin bingung mengenai apa yang masing-masing parameter mewakili. Di bawah ini adalah ringkasan dari Wood. Tentukan …

2
Apa yang dimaksud dengan sampel variabel acak?
Variabel acak didefinisikan sebagai fungsi yang dapat diukur dari satu aljabar dengan ukuran dasar ke aljabar lainnya .XXXσσ\sigma(Ω1,F1)(Ω1,F1)(\Omega_1, \mathcal F_1)PPPσσ\sigma(Ω2,F2)(Ω2,F2)(\Omega_2, \mathcal F_2) Bagaimana kita berbicara tentang sampel dari variabel acak ini? Apakah kami memperlakukannya sebagai elemen dari ? Atau sebagai fungsi terukur yang sama dengan ?XnXnX^nΩ2Ω2\Omega_2XXX Di mana saya bisa …

1
Bagaimana cara melakukan validasi silang dengan cv.glmnet (regresi LASSO dalam R)?
Saya bertanya-tanya bagaimana cara pendekatan dengan benar pelatihan dan pengujian model LASSO menggunakan glmnet di R? Secara khusus, saya bertanya-tanya bagaimana cara melakukannya jika kurangnya set data uji eksternal mengharuskan saya gunakan validasi silang (atau pendekatan serupa lainnya) untuk menguji model LASSO saya. Biarkan saya memecah skenario saya: Saya hanya …

1
Apakah ada sampler Monte Carlo / MCMC yang diimplementasikan yang dapat menangani maxima distribusi posterior lokal yang terisolasi?
Saat ini saya menggunakan pendekatan bayesian untuk memperkirakan parameter untuk model yang terdiri dari beberapa ODE. Karena saya memiliki 15 parameter untuk diperkirakan, ruang pengambilan sampel saya adalah 15-dimensi dan pencarian saya untuk distribusi posterior tampaknya memiliki banyak maxima lokal yang sangat terisolasi oleh daerah besar dengan probabilitas sangat rendah. …

1
Hasil replikasi untuk regresi linier glmnet menggunakan pengoptimal generik
Seperti yang dinyatakan judul, saya mencoba mereplikasi hasil dari glmnet linear menggunakan pengoptimal LBFGS dari perpustakaan lbfgs. Pengoptimal ini memungkinkan kita untuk menambahkan istilah regularizer L1 tanpa harus khawatir tentang diferensiabilitas, selama fungsi objektif kami (tanpa istilah regularizer L1) adalah cembung. minβ∈Rp12n∥β0+Xβ−y∥22+αλ∥β∥1+12(1−α)λ∥β∥22minβ∈Rp12n‖β0+Xβ−y‖22+αλ‖β‖1+12(1−α)λ‖β‖22\min_{\beta \in \mathbb{R}^p} \frac{1}{2n}\Vert \beta_0 + X\beta - y …

4
Bagaimana seseorang menjelaskan apa yang dimaksud dengan penaksir yang tidak bias terhadap orang awam?
Misalkan adalah estimator yang tidak bias untuk . Maka tentu saja, . θE[ θ |θ]=θθ^θ^\hat{\theta}θθ\thetaE[θ^∣θ]=θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta Bagaimana seseorang menjelaskan hal ini kepada orang awam? Di masa lalu, apa yang saya katakan adalah jika Anda rata-rata banyak nilai , karena ukuran sampel semakin besar, Anda mendapatkan perkiraan yang …

4
perbedaan antara jaringan saraf dan pembelajaran yang mendalam
Dalam hal perbedaan antara jaringan saraf dan pembelajaran yang mendalam, kita dapat membuat daftar beberapa item, seperti lebih banyak lapisan yang disertakan, kumpulan data yang besar, perangkat keras komputer yang kuat untuk membuat model pelatihan yang rumit menjadi mungkin. Selain itu, apakah ada penjelasan lebih rinci mengenai perbedaan antara NN …



2
Apakah model grafis dan mesin Boltzmann terkait secara matematis?
Sementara saya benar-benar telah melakukan beberapa pemrograman dengan mesin Boltzmann di kelas fisika, saya tidak akrab dengan karakterisasi teoretis mereka. Sebaliknya, saya tahu sedikit tentang teori model grafis (tentang beberapa bab pertama buku Lauritzen, Graphical Models ). Pertanyaan: Apakah ada hubungan yang bermakna antara model grafis dan mesin Boltzmann? Apakah …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.