Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

5
James-Stein susut 'di alam liar'?
Saya tertarik dengan gagasan penyusutan James-Stein (yaitu bahwa fungsi nonlinier dari pengamatan tunggal terhadap suatu vektor yang normalnya independen dapat menjadi penaksir yang lebih baik dari rata-rata variabel acak, di mana 'lebih baik' diukur dengan kuadrat kesalahan ). Namun, saya belum pernah melihatnya dalam pekerjaan terapan. Jelas saya tidak cukup …

9
Buku apa yang memberikan ikhtisar statistik komputasi yang berlaku untuk ilmu komputer?
Sebagai seorang insinyur perangkat lunak, saya tertarik pada topik-topik seperti algoritma statistik, penambangan data, pembelajaran mesin, jaringan Bayesian, algoritma klasifikasi, jaringan saraf, rantai Markov, metode Monte Carlo, dan pembangkitan angka acak. Saya pribadi belum merasa senang bekerja langsung dengan salah satu teknik ini, tetapi saya harus bekerja dengan perangkat lunak …


2
Apakah ada metode standar untuk menangani masalah penggantian label dalam estimasi MCMC untuk model campuran?
Pergantian label (yaitu, distribusi posterior tidak berbeda dengan pergantian label komponen) adalah masalah ketika menggunakan MCMC untuk memperkirakan model campuran. Apakah ada metodologi standar (seperti yang diterima secara luas) untuk menangani masalah ini? Jika tidak ada pendekatan standar maka apa pro dan kontra dari pendekatan terkemuka untuk memecahkan masalah label …
15 bayesian  mcmc  mixture 




8
Grafik alternatif untuk plot plot “handle bar”
Dalam bidang penelitian saya, cara populer menampilkan data adalah dengan menggunakan kombinasi diagram batang dengan "bilah pegangan". Sebagai contoh, The "handle-bar" bergantian antara kesalahan standar dan standar deviasi tergantung pada penulis. Biasanya, ukuran sampel untuk setiap "bilah" cukup kecil - sekitar enam. Plot-plot ini tampaknya sangat populer dalam ilmu biologi …

5
Mengapa Sekolah AS dan Inggris mengajarkan berbagai metode Menghitung Deviasi Standar?
Seperti yang saya pahami, Sekolah UK mengajarkan bahwa Standar Deviasi ditemukan menggunakan: sedangkan Sekolah AS mengajar: (pada tingkat dasar pula). Ini telah menyebabkan sejumlah masalah siswa saya di masa lalu ketika mereka mencari di Internet, tetapi menemukan penjelasan yang salah. Kenapa bedanya? Dengan dataset sederhana yang mengatakan 10 nilai, tingkat …

4
Mengapa kita membutuhkan estimator agar konsisten?
Saya pikir, saya sudah mengerti definisi matematika dari penduga yang konsisten. Koreksi saya jika saya salah: WnWnW_n adalah estimator yang konsisten untukθθ\theta jika∀ϵ>0∀ϵ>0\forall \epsilon>0 limn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θlimn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θ\lim_{n\to\infty} P(|W_n - \theta|> \epsilon) = 0, \quad \forall\theta \in \Theta Di mana, ΘΘ\Theta adalah Parametric Space. Tetapi saya ingin memahami perlunya penaksir untuk konsisten. Mengapa …

2
Apa itu distribusi fungsi?
Saya membaca buku teks Proses Gaussian untuk Pembelajaran Mesin oleh CE Rasmussen dan CKI Williams dan saya mengalami kesulitan memahami apa arti distribusi dari fungsi . Dalam buku pelajaran, contoh diberikan, bahwa orang harus membayangkan fungsi sebagai vektor yang sangat panjang (pada kenyataannya, itu harus sangat panjang?). Jadi saya membayangkan …


5
Apa perlunya asumsi dalam regresi linier?
Dalam regresi linier, kami membuat asumsi berikut Mean dari respon, E(Yi)E(Yi)E(Y_i) , pada setiap set nilai prediktor, (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , adalah fungsi Linear dari prediktor. Kesalahan, εiεiε_i , adalah Independen. Kesalahan, εiεiε_i , pada setiap rangkaian nilai prediktor, (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , terdistribusi secara normal. Kesalahan, εiεiε_i , pada setiap set …

4
Apa itu * Jaringan Syaraf Tiruan?
Ketika kita mempelajari literatur Neural Networks , kita dapat mengidentifikasi metode lain dengan topologi neuromorfik (arsitektur seperti Neural-Network). Dan saya tidak berbicara tentang Teorema Perkiraan Universal . Contoh diberikan di bawah ini. Lalu, itu membuat saya bertanya-tanya: apa definisi Jaringan Syaraf Tiruan buatan? Topologinya tampaknya mencakup segalanya. Contoh: Salah satu …

1
Meminimalkan bias dalam pemodelan penjelas, mengapa? (Galit Shmueli "Untuk Menjelaskan atau Memprediksi")
Pertanyaan ini merujuk pada makalah Galit Shmueli "Untuk Menjelaskan atau Memprediksi" . Secara khusus, di bagian 1.5, "Penjelasan dan Prediksi Berbeda", Profesor Shmueli menulis: Dalam pemodelan penjelas fokusnya adalah pada meminimalkan bias untuk mendapatkan representasi paling akurat dari teori yang mendasarinya. Ini membingungkan saya setiap kali saya membaca koran. Dalam …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.