Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Memahami regresi ridge negatif
Saya mencari literatur tentang regresi ridge negatif . Singkatnya, ini adalah generalisasi dari regresi ridge linier menggunakan negatif dalam rumus estimator:Kasus positif memiliki teori yang bagus: sebagai fungsi kerugian, sebagai kendala, seperti Bayes sebelumnya ... tapi saya merasa bingung dengan versi negatif dengan hanya rumus di atas. Kebetulan berguna untuk …


5
Mungkinkah dua Variabel Acak dari keluarga distribusi yang sama memiliki harapan dan varian yang sama, tetapi momen lebih tinggi berbeda?
Saya sedang memikirkan arti keluarga skala lokasi. Pemahaman saya adalah bahwa untuk setiap anggota keluarga skala lokasi dengan parameter lokasi dan skala, maka distribusi tidak tergantung dari parameter apapun dan itu sama untuk setiap milik keluarga itu.a b Z = ( X - a ) / b XXXXSebuahaabbbZ= ( X- …

1
RMSProp dan Adam vs SGD
Saya melakukan percobaan pada set validasi EMNIST menggunakan jaringan dengan RMSProp, Adam dan SGD. Saya mencapai akurasi 87% dengan SGD (tingkat belajar 0,1) dan dropout (0,1 dropout prob) serta regularisasi L2 (penalti 1e-05). Saat menguji konfigurasi persis yang sama dengan RMSProp dan Adam serta tingkat pembelajaran awal 0,001, saya mencapai …

1
Efek kausal oleh penyesuaian pintu belakang dan pintu depan
Jika kita ingin menghitung efek kausal pada dalam grafik kausal di bawah ini, kita dapat menggunakan teorema penyesuaian pintu belakang dan teorema penyesuaian pintu depan, yaitu XXXYYYP(y|do(X=x))=∑uP(y|x,u)P(u)P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) P(u) dan P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y | \textit{do}(X = x)) = \sum_z P(z | x) \sum_{x'} …

2
Bisakah satu (secara teoritis) melatih jaringan saraf dengan sampel pelatihan lebih sedikit dari berat?
Pertama-tama: Saya tahu, tidak ada jumlah umum ukuran sampel yang diperlukan untuk melatih jaringan saraf. Itu tergantung pada terlalu banyak faktor seperti kerumitan tugas, kebisingan dalam data dan sebagainya. Dan semakin banyak sampel pelatihan yang saya miliki, semakin baik jaringan saya. Tetapi saya bertanya-tanya: Apakah secara teori mungkin untuk melatih …

3
Algoritma apa yang membutuhkan pengodean satu-panas?
Saya tidak pernah yakin kapan harus menggunakan pengodean satu-panas untuk variabel kategori yang tidak dipesan dan kapan tidak. Saya menggunakannya setiap kali algoritma menggunakan metrik jarak untuk menghitung kesamaan. Adakah yang bisa memberikan aturan umum tentang apa jenis algoritma akan membutuhkan fitur kategorikal non-teratur menjadi satu-hot-encoded dan mana yang tidak?

1
Inferensi Variasi, divergensi KL membutuhkan true
Untuk saya (sangat sederhana) memahami inferensi variasional, orang mencoba untuk memperkirakan p distribusi yang tidak diketahui dengan menemukan q distribusi yang mengoptimalkan berikut ini:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Setiap kali saya menginvestasikan waktu untuk memahami inferensi variasional, saya terus memukul formula ini dan tidak bisa membantu tetapi …



2
Bagaimana cara gradient descent minibatch memperbarui bobot untuk setiap contoh dalam satu batch?
Jika kita memproses 10 contoh dalam satu batch, saya mengerti kita bisa menjumlahkan kerugian untuk setiap contoh, tetapi bagaimana cara backpropagation dalam hal memperbarui bobot untuk masing-masing contoh? Sebagai contoh: Contoh 1 -> kerugian = 2 Contoh 2 -> kerugian = -2 Ini menghasilkan kerugian rata-rata 0 (E = 0), …

3
Apakah ada masalah serius dengan menjatuhkan pengamatan dengan nilai yang hilang saat menghitung matriks korelasi?
Saya memiliki kumpulan data besar ini dengan 2500 variabel dan 142 observasi. Saya ingin menjalankan korelasi antara Variabel X dan variabel lainnya. Tetapi untuk banyak kolom, ada entri yang hilang. Saya mencoba melakukan ini di R menggunakan argumen "pairwise-complete" ( use=pairwise.complete.obs) dan menghasilkan banyak korelasi. Tetapi kemudian seseorang di StackOverflow …

2
Keras: mengapa kehilangan berkurang sementara val_loss meningkat?
Saya menyiapkan pencarian grid untuk sekelompok params. Saya mencoba mencari parameter terbaik untuk jaring neural Keras yang melakukan klasifikasi biner. Outputnya adalah 1 atau 0. Ada sekitar 200 fitur. Ketika saya melakukan pencarian kotak, saya mendapat banyak model dan parameternya. Model terbaik memiliki parameter ini: Epochs : 20 Batch Size …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.