Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Backpropagation yang luar biasa melalui koneksi lewati ResNet
Saya ingin tahu tentang bagaimana gradien diperbanyak kembali melalui jaringan saraf menggunakan modul ResNet / lewati koneksi. Saya telah melihat beberapa pertanyaan tentang ResNet (mis. Jaringan saraf dengan koneksi lompatan-lapisan ) tetapi yang satu ini menanyakan secara khusus tentang back-propagation of gradien selama pelatihan. Arsitektur dasarnya ada di sini: Saya …


2
Apakah ada yang namanya
Setelah memasukkan model regresi kuantil dalam makalah, pengulas ingin saya memasukkan disesuaikanR2R2R^2 di koran. Saya telah menghitung pseudo-R2R2R^2 (darimakalah JASA 1999 karya Koenker dan Machado) untuk tiga kuantil yang menarik untuk studi saya. Namun, saya tidak pernah mendengar sebuah disesuaikan R2R2R^2 untuk regresi kuantil dan tidak akan tahu bagaimana cara …

3
Relu vs Sigmoid vs Softmax sebagai neuron lapisan tersembunyi
Saya bermain dengan Neural Network sederhana dengan hanya satu lapisan tersembunyi, oleh Tensorflow, dan kemudian saya mencoba berbagai aktivasi untuk lapisan tersembunyi: Relu Sigmoid Softmax (well, biasanya softmax digunakan di lapisan terakhir ..) Relu memberikan akurasi kereta terbaik & akurasi validasi. Saya tidak yakin bagaimana menjelaskannya. Kita tahu bahwa Relu …


4
Apakah estimator kemungkinan maksimum tidak bias selalu merupakan estimator terbaik yang tidak bias?
Saya tahu untuk masalah reguler, jika kita memiliki penaksir tidak bias reguler terbaik, itu harus penaksir kemungkinan maksimum (MLE). Tetapi secara umum, jika kita memiliki MLE yang tidak bias, apakah itu juga akan menjadi penaksir tidak bias yang terbaik (atau mungkin saya harus menyebutnya UMVUE, asalkan memiliki varian terkecil)?

4
Mengapa metode Bayesian tidak membutuhkan banyak koreksi pengujian?
Andrew Gelman menulis artikel yang luas tentang mengapa pengujian Bayesian AB tidak memerlukan beberapa koreksi hipotesis: Mengapa Kita (Biasanya) Tidak Perlu Khawatir Tentang Multiple Comparisons , 2012. Saya tidak begitu mengerti: mengapa metode Bayesian tidak membutuhkan banyak koreksi pengujian? A ~ Distribution1 + Common Distribution B ~ Distribution2 + Common …


1
Hukuman jembatan vs. Regulerisasi Jaring Elastis
Beberapa fungsi dan perkiraan penalti dipelajari dengan baik, seperti LASSO ( ) dan Ridge ( ) dan bagaimana ini dibandingkan dalam regresi.L 2L1L1L_1L2L2L_2 Saya telah membaca tentang penalti Bridge, yang merupakan ∑∥βj∥γ∑‖βj‖γ\sum \|\beta_{j}\|^{\gamma} penalti umum Bandingkan dengan LASSO, yang memiliki γ=1γ=1\gamma = 1 , dan Ridge, dengan γ=2γ=2\gamma = 2 …

3
Mengapa menggunakan gradient descent dengan jaringan saraf?
Saat melatih jaringan saraf menggunakan algoritma back-propagation, metode gradient descent digunakan untuk menentukan pembaruan bobot. Pertanyaan saya adalah: Daripada menggunakan metode gradient descent untuk secara perlahan menemukan titik minimum sehubungan dengan bobot tertentu, mengapa kita tidak mengatur turunan , dan temukan nilai bobot yang meminimalkan kesalahan?wd( Kesalahan )dw= 0d(Kesalahan)dw=0\frac{d(\text{Error})}{dw}=0www Juga, …


2
Mengapa Laplace sebelumnya memproduksi solusi jarang?
Saya melihat-lihat literatur tentang regularisasi, dan sering melihat paragraf yang menghubungkan L2 regulatization dengan Gaussian sebelumnya, dan L1 dengan Laplace berpusat pada nol. Saya tahu bagaimana rupa prior ini, tetapi saya tidak mengerti, bagaimana ini diterjemahkan menjadi, misalnya, bobot dalam model linier. Di L1, jika saya mengerti dengan benar, kami …

4
Apa nama grafik ini yang menunjukkan tingkat positif palsu dan benar dan bagaimana cara menghasilkannya?
Gambar di bawah ini menunjukkan kurva kontinu dari tingkat positif palsu vs. Namun, yang saya tidak segera dapatkan adalah bagaimana tarif ini dihitung. Jika suatu metode diterapkan pada dataset, ia memiliki tingkat FP tertentu dan tingkat FN tertentu. Bukankah itu berarti bahwa setiap metode harus memiliki satu titik daripada kurva? …

2
Bagaimana cara memperoleh fungsi kemungkinan untuk distribusi binomial untuk estimasi parameter?
Menurut Miller dan Freund's Probability and Statistics for Engineers, 8ed (hal.217-218), fungsi kemungkinan dimaksimalkan untuk distribusi binomial (uji coba Bernoulli) diberikan sebagai L(p)=∏ni=1pxi(1−p)1−xiL(p)=∏i=1npxi(1−p)1−xsayaL(p) = \prod_{i=1}^np^{x_i}(1-p)^{1-x_i} Bagaimana cara mencapai persamaan ini? Tampaknya cukup jelas bagi saya mengenai distribusi lainnya, Poisson dan Gaussian; L(θ)=∏ni=1PDF or PMF of dist.L(θ)=∏i=1nPDF or PMF of dist.L(\theta) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.