Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

5
Mengapa fitur rekayasa bekerja?
Baru-baru ini saya telah belajar bahwa salah satu cara untuk menemukan solusi yang lebih baik untuk masalah ML adalah dengan membuat fitur. Seseorang dapat melakukannya dengan, misalnya, menjumlahkan dua fitur. Sebagai contoh, kami memiliki dua fitur "serangan" dan "pertahanan" semacam pahlawan. Kami kemudian membuat fitur tambahan yang disebut "total" yang …


2
Bagaimana masuk akal untuk melakukan OLS setelah pemilihan variabel LASSO?
Baru-baru ini saya menemukan bahwa dalam literatur ekonometrik terapan, ketika berhadapan dengan masalah pemilihan fitur, tidak jarang melakukan LASSO diikuti oleh regresi OLS menggunakan variabel yang dipilih. Saya bertanya-tanya bagaimana kita memenuhi syarat validitas dari prosedur semacam itu. Apakah ini akan menyebabkan masalah seperti variabel yang dihilangkan? Adakah bukti yang …


4
Perbedaan antara umpan balik RNN ​​dan LSTM / GRU
Saya mencoba memahami arsitektur Recurrent neural network (RNN) yang berbeda untuk diterapkan pada data deret waktu dan saya agak bingung dengan nama-nama berbeda yang sering digunakan ketika menggambarkan RNN. Apakah struktur memori jangka pendek panjang (LSTM) dan Gated Recurrent Unit (GRU) pada dasarnya adalah RNN dengan loop umpan balik?

2
Dari distribusi seragam ke distribusi eksponensial dan sebaliknya
Ini mungkin pertanyaan sepele, tapi pencarian saya telah sia-sia sejauh ini, termasuk artikel wikipedia , dan "Kompendium Distribusi" dokumen . Jika memiliki distribusi seragam, apakah ini berarti bahwa mengikuti distribusi eksponensial?XXXeXeXe^X Demikian pula, jika mengikuti distribusi eksponensial, apakah ini berarti mengikuti distribusi yang seragam?l n ( Y )YYYln(Y)ln(Y)ln(Y)

2
Apa artinya sebuah nama: Presisi (kebalikan dari varians)
Secara intuitif, rata-rata hanyalah rata-rata pengamatan. Perbedaannya adalah seberapa banyak pengamatan ini bervariasi dari rata-rata. Saya ingin tahu mengapa kebalikan dari varian dikenal sebagai presisi. Intuisi apa yang bisa kita buat dari ini? Dan mengapa matriks presisi berguna seperti matriks kovarians dalam distribusi multivariat (normal)? Wawasan tolong?

2
Dalam jaring saraf, mengapa menggunakan metode gradien daripada metaheuristik lainnya?
Dalam pelatihan jaringan saraf yang dalam dan dangkal, mengapa metode gradien (misalnya gradient descent, Nesterov, Newton-Raphson) umum digunakan, berbeda dengan metaheuristik lainnya? Metaheuristik yang saya maksud adalah metode seperti annealing yang disimulasikan, optimisasi koloni semut, dll., Yang dikembangkan untuk menghindari terjebak dalam minima lokal.

2
Memahami derivasi tradeoff varians
Saya membaca bab bias-varians dari unsur-unsur pembelajaran statistik dan saya ragu dalam rumus di halaman 29. Biarkan data muncul dari model sehingga Y=f(x)+ϵY=f(x)+ϵ Y = f(x)+\epsilon mana adalah bilangan acak dengan nilai yang diharapkan dan Variance . Biarkan nilai kesalahan model yang diharapkan adalah mana adalah prediksi dari pelajar kita. …

2
Metode optimasi apa yang paling cocok untuk LSTM?
Saya telah menggunakan theano untuk bereksperimen dengan LSTM, dan bertanya-tanya apa metode optimasi (SGD, Adagrad, Adadelta, RMSprop, Adam, dll) bekerja paling baik untuk LSTM? Apakah ada makalah penelitian tentang topik ini? Juga, apakah jawabannya tergantung pada jenis aplikasi yang saya gunakan untuk LSTM? Jika demikian, saya menggunakan LSTM untuk klasifikasi …

2
Plot residual: mengapa plot versus nilai pas, tidak diamati nilai ?
Dalam konteks regresi OLS, saya memahami bahwa plot residual (vs nilai pas) secara konvensional dipandang untuk menguji varians konstan dan menilai spesifikasi model. Mengapa residu diplot terhadap fit, dan bukan nilai ? Apa perbedaan informasinya dengan kedua plot ini?YYY Saya sedang mengerjakan model yang menghasilkan plot sisa berikut: Jadi plot …

4
Mengelompokkan matriks korelasi
Saya memiliki matriks korelasi yang menyatakan bagaimana setiap item berkorelasi dengan item lainnya. Karenanya untuk item N, saya sudah memiliki matriks korelasi N * N. Dengan menggunakan matriks korelasi ini, bagaimana cara mengelompokkan item N dalam M bin sehingga saya dapat mengatakan bahwa Item Nk di kth bin berperilaku sama. …

3
Mengapa Faktor Normalisasi Diperlukan dalam Teorema Bayes?
Teorema Bayes berlaku P(model|data)=P(model)×P(data|model)P(data)P(model|data)=P(model)×P(data|model)P(data) P(\textrm{model}|\textrm{data}) = \frac{P(\textrm{model}) \times P(\textrm{data}|\textrm{model})}{P(\textrm{data})} Ini semua baik-baik saja Tapi, saya pernah membaca di suatu tempat: Pada dasarnya, P (data) tidak lain adalah konstanta normalisasi, yaitu konstanta yang membuat kerapatan posterior berintegrasi menjadi satu. Kita tahu bahwa dan . 0≤P(model)≤10≤P(model)≤10 \leq P(\textrm{model}) \leq 10≤P(data|model)≤10≤P(data|model)≤1 0 \leq …


2
Memilih antara -test dan -test
Latar belakang: Saya memberikan presentasi kepada kolega di tempat kerja tentang pengujian hipotesis, dan memahami sebagian besar dari itu baik-baik saja tetapi ada satu aspek yang saya mengikat diri dalam simpul yang mencoba memahami serta menjelaskannya kepada orang lain. Ini yang saya pikir saya tahu (tolong perbaiki jika salah!) Statistik …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.