Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Berapa panjang urutan yang layak untuk model RNN?
Saya melihat ke dalam menggunakan versi LSTM ( memori jangka pendek ) dari jaringan saraf berulang (RNN) untuk memodelkan data deret waktu. Ketika panjang urutan data meningkat, kompleksitas jaringan meningkat. Karena itu saya ingin tahu berapa panjang urutan yang layak untuk model dengan akurasi yang baik? Saya ingin menggunakan versi …

7
Apa yang Anda lakukan untuk mengingat peraturan Bayes?
Saya pikir cara yang baik untuk mengingat rumus adalah dengan memikirkan rumus seperti ini: Probabilitas bahwa beberapa peristiwa A memiliki hasil tertentu yang diberikan peristiwa independen hasil B = probabilitas kedua hasil yang terjadi secara bersamaan / apa pun yang kita katakan probabilitas hasil peristiwa yang diinginkan A akan jika …
15 bayesian  bayes 

4
Penambangan Teks: bagaimana cara mengelompokkan teks (misalnya artikel berita) dengan kecerdasan buatan?
Saya telah membangun beberapa jaringan saraf (MLP (terhubung penuh), Elman (berulang)) untuk tugas yang berbeda, seperti bermain Pong, mengklasifikasikan angka tulisan tangan dan lainnya ... Selain itu saya mencoba untuk membangun beberapa jaringan saraf convolutional pertama, misalnya untuk mengklasifikasikan catatan tulisan tangan multi-digit, tetapi saya benar-benar baru untuk menganalisis dan …

1
Regularisasi untuk model ARIMA
Saya mengetahui jenis LASSO, ridge, dan elastisitas-net dalam model regresi linier. Pertanyaan: Bisakah estimasi jenis ini (atau sejenisnya) diterapkan pada pemodelan ARIMA (dengan bagian MA yang tidak kosong)? Dalam membangun model ARIMA, tampaknya biasa untuk mempertimbangkan urutan lag maksimum yang dipilih sebelumnya ( pmaxpmaxp_{max} , qmaxqmaxq_{max} ) dan kemudian memilih …


2
Pertanyaan tentang pengorbanan bias-varians
Saya mencoba memahami pengorbanan varians-varians, hubungan antara bias estimator dan bias model, dan hubungan antara varians estimator dan varians model. Saya sampai pada kesimpulan ini: Kita cenderung menyesuaikan data ketika kita mengabaikan bias estimator, yaitu ketika kita hanya bertujuan untuk meminimalkan bias model mengabaikan varians model (dengan kata lain kita …

2
Berulang langkah ANOVA: apa asumsi normalitas?
Saya bingung tentang asumsi normalitas dalam tindakan berulang ANOVA. Secara khusus, saya bertanya-tanya normalitas seperti apa yang harus dipenuhi. Dalam membaca literatur dan jawaban pada CV, saya menemukan tiga kata berbeda dari asumsi ini. Variabel dependen dalam setiap kondisi (berulang) harus didistribusikan secara normal. Sering dinyatakan bahwa rANOVA memiliki asumsi …

1
Bagaimana menanggapi pengulas yang meminta nilai p dalam model multilevel bayesian?
Kami diminta oleh reviewer untuk memberikan nilai-p agar dapat lebih memahami estimasi model dalam model multilevel bayesian kami. Model ini adalah model khas dari beberapa pengamatan per peserta dalam percobaan. Kami memperkirakan model dengan Stan, sehingga kami dapat dengan mudah menghitung statistik posterior tambahan. Saat ini, kami melaporkan (secara visual …

1
Apakah hutan acak Breiman menggunakan informasi atau indeks Gini?
Saya ingin tahu apakah hutan acak Breiman (hutan acak dalam paket R randomForest) digunakan sebagai kriteria pemisahan (kriteria untuk pemilihan atribut) informasi atau indeks Gini? Saya mencoba untuk mengetahuinya di http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm dan dalam dokumentasi untuk paket randomForest di R. Tetapi satu-satunya hal yang saya temukan adalah bahwa indeks Gini dapat …

2
Apa arti teori belajar PAC?
Saya baru dalam pembelajaran mesin. Saya belajar kursus dalam pembelajaran mesin (Stanford University) dan saya tidak mengerti apa yang dimaksud dengan teori ini dan apa kegunaannya. Saya bertanya-tanya apakah seseorang dapat merinci teori ini untuk saya. Teori ini didasarkan pada persamaan ini.

1
Klarifikasi tentang Peraturan Perceptron vs. Keturunan Gradien vs. Penerapan Keturunan Gradien Stokastik
Saya bereksperimen sedikit dengan implementasi Perceptron yang berbeda dan ingin memastikan apakah saya memahami "iterasi" dengan benar. Aturan perceptron asli Rosenblatt Sejauh yang saya mengerti, dalam algoritma perceptron klasik Rosenblatt, bobot secara bersamaan diperbarui setelah setiap contoh pelatihan melalui Δ b( t + 1 )= Δ w( t )+ η( …

2
Apa yang sering diambil dalam kisah voltmeter?
Apa yang sering diambil oleh kisah voltmeter dan variasinya? Gagasan di baliknya adalah bahwa analisis statistik yang menarik bagi peristiwa hipotetis harus direvisi jika kemudian diketahui bahwa peristiwa hipotetis itu tidak mungkin terjadi sebagaimana diasumsikan. The versi cerita di Wikipedia tersedia di bawah ini. Seorang insinyur mengambil sampel acak dari …

2
Membuat indeks tunggal dari beberapa komponen atau faktor utama yang dipertahankan dari PCA / FA
Saya menggunakan Principal Component Analysis (PCA) untuk membuat indeks yang diperlukan untuk penelitian saya. Pertanyaan saya adalah bagaimana saya harus membuat indeks tunggal dengan menggunakan komponen utama yang disimpan yang dihitung melalui PCA. Sebagai contoh, saya memutuskan untuk mempertahankan 3 komponen utama setelah menggunakan PCA dan saya menghitung skor untuk …

1
Keuntungan Box-Muller dibandingkan metode CDF terbalik untuk mensimulasikan distribusi Normal?
Untuk mensimulasikan distribusi normal dari satu set variabel seragam, ada beberapa teknik: Algoritma Box-Muller , di mana satu sampel dua varian seragam independen pada dan mengubahnya menjadi dua distribusi normal standar independen melalui: Z 0 = √(0,1)(0,1)(0,1)Z0=−2lnU1−−−−−−√cos(2πU0)Z1=−2lnU1−−−−−−√sin(2πU0)Z0=−2lnU1cos(2πU0)Z1=−2lnU1sin(2πU0) Z_0 = \sqrt{-2\text{ln}U_1}\text{cos}(2\pi U_0)\\ Z_1 = \sqrt{-2\text{ln}U_1}\text{sin}(2\pi U_0) metode CDF , di mana …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.