Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Masalah pohon uang ajaib
Saya memikirkan masalah ini di kamar mandi, itu terinspirasi oleh strategi investasi. Katakanlah ada pohon uang ajaib. Setiap hari, Anda dapat menawarkan sejumlah uang ke pohon uang dan itu akan melipatgandakannya, atau menghancurkannya dengan probabilitas 50/50. Anda segera melihat bahwa rata-rata Anda akan mendapatkan uang dengan melakukan ini dan ingin …

6
Apakah menyetel hyperparameter pada sampel dataset adalah ide yang buruk?
Saya memiliki dataset 140000 contoh dan 30 fitur yang saya latih beberapa pengklasifikasi untuk klasifikasi biner (SVM, Regresi Logistik, Hutan Acak dll) Dalam banyak kasus, penyetelan hyperparameter pada keseluruhan dataset menggunakan pencarian Grid atau Random terlalu memakan waktu. Saya mulai menggunakan teknik berikut Sub sampel dataset saya Gunakan fraksi yang …



2
Metodologi peramalan VAR
Saya sedang membangun model VAR untuk memperkirakan harga suatu aset dan ingin tahu apakah metode saya baik secara statistik, apakah tes yang saya sertakan relevan atau tidak, dan jika lebih banyak diperlukan untuk memastikan perkiraan yang andal berdasarkan variabel input saya. Di bawah ini adalah proses saya saat ini untuk …
19 r  forecasting  modeling  var 


1
Goodness of fit dan model mana untuk memilih regresi linier atau Poisson
Saya memerlukan beberapa saran mengenai dua dilema utama dalam penelitian saya, yang merupakan studi kasus dari 3 farmasi dan inovasi besar. Jumlah paten per tahun adalah variabel dependen. Pertanyaan saya adalah Apa kriteria paling penting untuk model yang baik? Apa yang lebih / kurang penting? Apakah sebagian besar atau semua …




5
Cara mengkode ulang variabel kategori menjadi variabel numerik saat menggunakan SVM atau Neural Network
Untuk menggunakan SVM atau Neural Network perlu mengubah (menyandikan) variabel kategorikal menjadi variabel numerik, metode normal dalam hal ini adalah dengan menggunakan nilai biner 0-1 dengan nilai k-th kategori ditransformasikan menjadi (0,0, .. ., 1,0, ... 0) (1 ada di posisi k-th). Apakah ada metode lain untuk melakukan ini, terutama …

2
Structural Equation Model (SEMs) versus Bayesian Networks (BNs)
Terminologi di sini berantakan. "Persamaan struktural" kira-kira sama samarnya dengan "jembatan arsitektural" dan "jaringan Bayesian" secara intrinsik bukan Bayesian . Bahkan yang lebih baik, Judea Pearl dari sebab akibat mengatakan bahwa kedua aliran model hampir identik. Jadi, apa perbedaan penting? (Luar biasa bagi saya, halaman Wikipedia untuk SEM bahkan tidak …

3
Mengapa distribusi t menjadi lebih normal karena ukuran sampel meningkat?
Sesuai Wikipedia, saya mengerti bahwa distribusi-t adalah distribusi pengambilan sampel dari nilai-t ketika sampel adalah pengamatan benar dari populasi yang berdistribusi normal. Namun, saya tidak mengerti secara intuisi mengapa hal itu menyebabkan bentuk distribusi-t berubah dari ekor berlemak menjadi sangat normal. Saya mengerti bahwa jika Anda mengambil sampel dari distribusi …


2
Makna jaringan saraf sebagai kotak hitam?
Saya sering mendengar orang berbicara tentang jaringan saraf sebagai sesuatu yang tidak Anda mengerti apa artinya atau apa artinya. Sebenarnya saya tidak mengerti apa yang mereka maksud dengan itu! Jika Anda memahami cara kerja back-propagation, lalu bagaimana ini adalah kotak hitam? Apakah itu berarti kita tidak mengerti bagaimana bobot yang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.