Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Penduga parameter poisson yang tidak sesuai
Jumlah kecelakaan per hari adalah variabel acak Poisson dengan parameter , pada 10 hari yang dipilih secara acak jumlah kecelakaan diamati sebagai 1,0,1,1,2,0,2,0,0,1, apa yang akan menjadi penaksir yang tidak bias dari ?e λλλ\lambdaeλeλe^{\lambda} Saya mencoba mencoba dengan cara ini: Kita tahu bahwa , tetapi . Lalu apa yang akan …

1
Apa yang biasa, di kotak paling tidak biasa?
Seorang teman saya baru-baru ini bertanya apa yang begitu biasa, tentang kotak paling tidak biasa. Kami sepertinya tidak berhasil dalam diskusi. Kami berdua sepakat bahwa OLS adalah kasus khusus dari model linier, ia memiliki banyak kegunaan, diketahui dengan baik, dan merupakan kasus khusus dari banyak model lainnya. Tetapi apakah ini …


2
Cara meningkatkan waktu berjalan untuk imputasi data R MICE
Singkatnya pertanyaan saya: apakah ada metode untuk meningkatkan waktu berjalan R MICE (data imputasi)? Saya bekerja dengan satu set data (30 variabel, 1,3 juta baris) yang berisi (secara acak) data yang hilang. Sekitar 8% dari pengamatan di sekitar 15 dari 30 variabel mengandung NAs. Untuk memasukkan data yang hilang, saya …

2
Kekuatan percobaan mencicipi teh wanita
Dalam terkenal percobaan Fisher yang diamati adalah jumlah dikoreksi menduga cup memiliki dua jenis cup dan . Biasanya menarik untuk menghitung daerah kritis untuk menolak hipotesis nol (wanita itu menebak secara acak) mengingat ukuran tes . Ini mudah dilakukan dengan menggunakan distribusi hypergeometric. Dengan cara yang sama saya dapat menghitung …

2
Mengapa derajat kebebasan untuk pasangan yang cocok
Saya terbiasa mengetahui "derajat kebebasan" sebagai n−rn−rn - r , di mana Anda memiliki model linier dengan , matriks desain dengan peringkat , , dengan , .y=Xβ+ϵy=Xβ+ϵ\mathbf{y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\epsilon}y∈Rny∈Rn\mathbf{y} \in \mathbb{R}^nX∈Mn×p(R)X∈Mn×p(R)\mathbf{X} \in M_{n \times p}(\mathbb{R})rrrβ∈Rpβ∈Rp\boldsymbol{\beta} \in \mathbb{R}^pϵ∈Rnϵ∈Rn\boldsymbol{\epsilon} \in \mathbb{R}^nϵ∼N(0,σ2In)ϵ∼N(0,σ2In)\boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \sigma^2 \mathbf{I}_n)σ2>0σ2>0\sigma^2 > 0 Dari apa yang …


2
Apakah penaksir pohon SELALU bias?
Saya sedang mengerjakan pekerjaan rumah di Pohon Keputusan, dan salah satu pertanyaan yang harus saya jawab adalah "Mengapa estimator dibangun dari pohon yang bias, dan bagaimana mengantongi membantu mengurangi variansnya?". Sekarang, saya tahu bahwa model overfitted cenderung memiliki bias yang sangat rendah, karena mereka mencoba menyesuaikan semua poin data. Dan, …
9 cart  bias 


1
Apa yang ditunjukkan oleh bentuk seperti plot PCA?
Dalam mereka kertas autoencoders untuk klasifikasi teks Hinton dan Salakhutdinov menunjukkan plot yang dihasilkan oleh 2-dimensi LSA (yang berkaitan erat dengan PCA): . Menerapkan PCA ke data dimensi sedikit tinggi yang benar-benar berbeda, saya memperoleh plot yang mirip: (kecuali dalam hal ini saya benar-benar ingin tahu apakah ada struktur internal). …


2
Perbandingan antara penaksir Bayes
Pertimbangkan kerugian kuadratik , dengan diberikan sebelumnya mana . Misalkan kemungkinan. Temukan estimator Bayes .L(θ,δ)=(θ−δ)2L(θ,δ)=(θ−δ)2L(\theta,\delta)=(\theta-\delta)^2π(θ)π(θ)\pi(\theta)π(θ)∼U(0,1/2)π(θ)∼U(0,1/2)\pi(\theta)\sim U(0,1/2)f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|\theta)=\theta x^{\theta-1}\mathbb{I}_{[0,1]}(x), \theta>0δπδπ\delta^\pi Pertimbangkan kehilangan kuadratik tertimbang mana dengan prior . Biarkan menjadi kemungkinannya. Temukan estimator Bayes .Lw(θ,δ)=w(θ)(θ−δ)2Lw(θ,δ)=w(θ)(θ−δ)2L_w(\theta,\delta)=w(\theta)(\theta-\delta)^2w(θ)=I(−∞,1/2)w(θ)=I(−∞,1/2)w(\theta)=\mathbb{I}_{(-\infty,1/2)}π1(θ)=I[0,1](θ)π1(θ)=I[0,1](θ)\pi_1(\theta)=\mathbb{I}_{[0,1]}(\theta)f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|\theta)=\theta x^{\theta-1}\mathbb{I}_{[0,1]}(x), \theta>0δπ1δ1π\delta^\pi_1 Bandingkan danδπδπ\delta^\piδπ1δ1π\delta^\pi_1 Pertama saya perhatikan bahwa , dan saya berasumsi bahwa itu adalah kemungkinannya, kalau …


1
Kapan boleh menulis "kita mengasumsikan distribusi normal" dari pengukuran empiris?
Sudah tertanam dalam pengajaran disiplin ilmu terapan, seperti kedokteran, bahwa pengukuran jumlah bio-medis dalam populasi mengikuti "kurva lonceng" yang normal. Pencarian Google pada string "kami mengasumsikan distribusi normal" menghasilkan hasil ! Mereka terdengar seperti, "mengingat sejumlah kecil titik data ekstrim, kami mengasumsikan distribusi normal untuk anomali suhu" dalam sebuah studi …

1
Berapa banyak data untuk pembelajaran mendalam?
Saya belajar tentang pembelajaran yang mendalam (khususnya CNN), dan bagaimana hal itu biasanya membutuhkan banyak data untuk mencegah overfitting. Namun, saya juga telah diberitahu bahwa semakin tinggi kapasitas / lebih banyak parameter model, semakin banyak data yang diperlukan untuk mencegah overfitting. Oleh karena itu, pertanyaan saya adalah: Mengapa Anda tidak …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.