Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



2
Normalisasi variabel dummy
Data saya terdiri dari beberapa pengukuran kontinu dan beberapa variabel dummy mewakili tahun pengukuran telah dilakukan. Sekarang, saya ingin belajar jaringan saraf dengan data. Karena itu, saya zScore-menormalkan semua variabel, termasuk variabel dummy. Namun, saya bertanya-tanya apakah ini merupakan pendekatan yang masuk akal, karena normalisasi variabel dummy mengubah rentang mereka, …



1
Model keadaan tersembunyi vs model tanpa negara untuk regresi deret waktu
Ini adalah pertanyaan yang cukup umum: anggap saya ingin membangun model untuk memprediksi pengamatan berikutnya berdasarkan sebelumnya NNN pengamatan (NNNdapat menjadi parameter untuk mengoptimalkan secara eksperimental). Jadi pada dasarnya kami memiliki jendela geser fitur input untuk memprediksi pengamatan selanjutnya. Saya dapat menggunakan pendekatan Model Hidden Markov, yaitu Baum-Welch untuk memperkirakan …

2
Apa input model MA (q) di dunia nyata?
Saya mengerti model AR (p): inputnya adalah deret waktu yang dimodelkan. Saya benar-benar terjebak ketika membaca tentang model MA (q): inputnya adalah inovasi atau kejutan acak seperti yang sering dirumuskan. Masalahnya adalah saya tidak bisa membayangkan bagaimana mendapatkan komponen inovasi yang tidak memiliki model seri waktu (sempurna) yang sudah ada …

1
Pemodelan hirarki Bayesian tingkat kejadian
Buku Kevin Murphy membahas masalah Hierarchical Bayesian klasik (awalnya dibahas dalam Johnson and Albert, 1999, p24): Misalkan kita mencoba memperkirakan tingkat kanker di NNNkota. Di setiap kota, kami mencicipi sejumlah individuNiNiN_i dan mengukur jumlah penderita kanker xi∼Bin(Ni,θi)xi∼Bin(Ni,θi)x_i \sim \text{Bin}(N_i, \theta_i)dimana θiθi\theta_i adalah tingkat kanker sejati di kota. Kami ingin memperkirakan …

2
Bagaimana cara menangani Infs dengan benar dalam fungsi statistik?
Misalkan saya memiliki fungsi seperti: f <- function(x){ exp(x) / (1 + exp(x)) } itu seharusnya bekerja untuk setiap nilai nyata x, tetapi sebenarnya mengembalikan NaN ketika x adalah 710 atau lebih besar. Saya bertanya-tanya apa cara yang tepat untuk menangani masalah ini. Saya menyadari mudah untuk membuatnya hanya mengembalikan …
8 r  function  numerics 


1
Apakah akan ada masalah pemilihan model jika kami memiliki akses ke oracle yang memberi kami kesalahan generalisasi yang tepat?
Membiarkan E( h )E(h)\mathcal{E(h)} sebuah fungsi yang diberi beberapa hipotesis hhh mengembalikan kesalahan generalisasi untuk perbaikan itu hhh. Saya membaca beberapa catatan tentang pemilihan model dan kesalahan generalisasi dan dikatakan: "Jika kita memiliki akses ke E( h )E(h)\mathcal{E(h)}, tidak akan ada masalah pemilihan model juga. Kami hanya akan memilih gambut …

1
Bagaimana cara memperkenalkan secara lembut ahli epidemiologi / rekan kerja kesehatan masyarakat ke pemodelan prediktif tingkat lanjut?
Berasal dari latar belakang ilmu sosial dan epidemiologi, rekan kerja saya dilatih tentang regresi kuadrat terkecil, regresi logistik, dan analisis kelangsungan hidup. Mereka suka melihat interval kepercayaan 95% dan nilai-p dengan koefisien parameter, dan tidak mempercayai alat prediktif yang lebih terkini seperti jaringan saraf, CART, bagging & boosting, serta teknik …

1
Kemungkinan vs Probabilitas
Saya mengalami kesulitan dengan Kemungkinan . Saya mengerti Teorema Bayes p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B, \mathcal{H}) = \frac{p(B|A, \mathcal{H}) p(A|\mathcal{H})}{p(B|\mathcal{H})} yang dapat disimpulkan secara langsung dari penerapan . Jadi dalam interpretasi saya, fungsi dalam Bayes Theorem entah bagaimana semuanya kemungkinan, baik marjinal atau bersyarat. Jadi saya benar-benar berpikir bahwa kemungkinan sebagai konsep lebih merupakan …


1
Ketika mengoptimalkan model regresi logistik, kadang-kadang lebih banyak data membuat segalanya berjalan * lebih cepat *. Ada yang tahu kenapa?
Saya telah bermain-main dengan regresi logistik dengan berbagai algoritma optimasi batch (gradien konjugat, newton-raphson, dan berbagai metode quasinewton). Satu hal yang saya perhatikan adalah bahwa kadang-kadang, menambahkan lebih banyak data ke model sebenarnya dapat membuat pelatihan model membutuhkan waktu lebih sedikit. Setiap iterasi membutuhkan melihat lebih banyak titik data, tetapi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.