Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Cara menggunakan DLM dengan pemfilteran Kalman untuk perkiraan
Bisakah seseorang memandu saya melalui contoh tentang cara menggunakan filter DLM Kalman dalam R pada seri waktu. Katakanlah saya memiliki nilai-nilai ini (nilai triwulanan dengan musiman tahunan); bagaimana Anda menggunakan DLM untuk memprediksi nilai selanjutnya? Dan BTW, apakah saya memiliki data historis yang cukup (berapa minimum)? 89 2009Q1 82 2009Q2 …



3
Apakah statistik Bayes benar-benar merupakan peningkatan dari statistik tradisional (sering) untuk penelitian perilaku?
Saat menghadiri konferensi, ada sedikit dorongan oleh pendukung statistik Bayesian untuk menilai hasil eksperimen. Ini dibanggakan karena keduanya lebih sensitif, tepat, dan selektif terhadap temuan asli (lebih sedikit positif palsu) daripada statistik sering. Saya telah menjelajahi topik tersebut, dan sejauh ini saya tidak yakin akan manfaat menggunakan statistik Bayesian. Analisis …


3
Bagaimana cara mengambil sampel dari
Saya ingin sampel sesuai dengan kepadatan f(a)∝cada−1Γ(a)1(1,∞)(a)f(a)∝cada−1Γ(a)1(1,∞)(a) f(a) \propto \frac{c^a d^{a-1}}{\Gamma(a)} 1_{(1,\infty)}(a) manadanbenar-benar positif. (Motivasi: Ini bisa berguna untuk pengambilan sampel Gibbs ketika parameter bentuk kepadatan Gamma memiliki seragam sebelumnya.)cccddd Adakah yang tahu cara mengambil sampel dari kepadatan ini dengan mudah? Mungkin itu standar dan hanya sesuatu yang tidak saya …

2
Kapan "Tetangga Terdekat" bermakna, hari ini?
Pada tahun 1999, Beyer et al. bertanya, Kapan "Tetangga Terdekat" bermakna? Adakah cara yang lebih baik untuk menganalisis dan memvisualisasikan efek jarak rata pada pencarian NN sejak 1999? Apakah set data yang diberikan memberikan jawaban yang berarti untuk masalah 1-NN? Masalah 10-NN? Masalah 100-NN? Bagaimana Anda para pakar mendekati pertanyaan …

1
Menafsirkan plot analisis korespondensi 2D
Saya telah mencari di internet jauh dan luas ... Saya belum menemukan gambaran yang sangat bagus tentang bagaimana menafsirkan plot analisis korespondensi 2D. Bisakah seseorang menawarkan saran untuk menafsirkan jarak antar titik? Mungkin contoh akan membantu, berikut adalah plot yang ditemukan di banyak situs web yang saya lihat membahas analisis …

7
Ukuran kompleksitas model
Bagaimana kita membandingkan kompleksitas dua model dengan jumlah parameter yang sama? Sunting 09/19 : Untuk memperjelas, kompleksitas model adalah ukuran seberapa sulitnya untuk belajar dari data yang terbatas. Ketika dua model cocok dengan data yang ada sama baiknya, model dengan kompleksitas yang lebih rendah akan memberikan kesalahan yang lebih rendah …


10
Sumber daya untuk belajar membuat visualisasi data?
Saya tertarik mempelajari cara membuat jenis visualisasi yang Anda lihat di http://flowingdata.com dan informasinya bagus. EDIT: Artinya, visualisasi yang menarik dalam diri mereka sendiri - agak seperti grafik NY Times, bukan sesuatu yang cepat untuk laporan. Apa jenis alat yang digunakan untuk membuat ini - apakah sebagian besar banyak Adobe …

6
Apa perbedaan antara penambangan data dan analisis statistik?
Apa perbedaan antara penambangan data dan analisis statistik? Untuk beberapa latar belakang, pendidikan statistik saya, saya pikir, agak tradisional. Sebuah pertanyaan spesifik diajukan, penelitian dirancang, dan data dikumpulkan dan dianalisis untuk menawarkan beberapa wawasan tentang pertanyaan itu. Akibatnya, saya selalu skeptis dengan apa yang saya anggap "pengerukan data", yaitu mencari …

6
Apa ide 'mendasar' pembelajaran mesin untuk memperkirakan parameter?
Gagasan statistik 'mendasar' untuk memperkirakan parameter adalah kemungkinan maksimum . Saya bertanya-tanya apa ide yang sesuai dalam pembelajaran mesin. Qn 1. Apakah adil untuk mengatakan bahwa ide 'mendasar' dalam pembelajaran mesin untuk memperkirakan parameter adalah: 'Kehilangan Fungsi' [Catatan: Adalah kesan saya bahwa algoritma pembelajaran mesin sering mengoptimalkan fungsi kerugian dan …

1
Mengapa estimator James-Stein disebut sebagai estimator “penyusutan”?
Saya telah membaca tentang estimator James-Stein. Ini didefinisikan, dalam catatan ini , sebagai θ^=(1−p−2∥X∥2)Xθ^=(1−p−2‖X‖2)X \hat{\theta}=\left(1 - \frac{p-2}{\|X\|^2}\right)X Saya telah membaca buktinya tetapi saya tidak mengerti pernyataan berikut: Secara geometris, estimator James-Stein menyusut setiap komponen menuju titik asal ...XXX Apa arti "menyusutkan setiap komponen XXX ke titik asal"? Saya sedang memikirkan …

2
Apa alasan fungsi kovarian Matérn?
Fungsi kovarians Matérn umumnya digunakan sebagai fungsi kernel dalam Proses Gaussian. Ini didefinisikan seperti ini Cν(d)=σ221−νΓ(ν)(2ν−−√dρ)νKν(2ν−−√dρ)Cν(d)=σ221−νΓ(ν)(2νdρ)νKν(2νdρ) {\displaystyle C_{\nu }(d)=\sigma ^{2}{\frac {2^{1-\nu }}{\Gamma (\nu )}}{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}^{\nu }K_{\nu }{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}} di mana ddd adalah fungsi jarak (seperti jarak Euclidean), ΓΓ\Gamma adalah fungsi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.