Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Apa penurunan berat badan?
Saya mulai dengan pembelajaran yang mendalam, dan saya memiliki pertanyaan yang jawabannya tidak dapat saya temukan, mungkin saya belum mencari dengan benar. Saya telah melihat jawaban ini , tetapi masih belum jelas apa penurunan berat badan dan bagaimana hubungannya dengan fungsi penurunan.

2
Mengambil sampel secara efisien distribusi Beta yang di-threshold
Bagaimana saya bisa mengambil sampel secara efisien dari distribusi berikut? x∼B(α,β), x>kx∼B(α,β), x>k x \sim B(\alpha, \beta),\space x > k Jika tidak terlalu besar maka penolakan sampel mungkin merupakan pendekatan terbaik, tetapi saya tidak yakin bagaimana untuk melanjutkan ketika besar. Mungkin ada beberapa perkiraan asimptotik yang bisa diterapkan?kkkkkkk

1
Mengapa hasil hutan acak saya sangat bervariasi?
Saya mencoba menguji kemampuan hutan acak untuk mengklasifikasikan sampel antara 2 kelompok; Ada 54 sampel dan berbagai jumlah variabel yang digunakan untuk klasifikasi. Saya bertanya-tanya mengapa perkiraan out-of-bag (OOB) dapat bervariasi sebanyak 5% dari satu sama lain bahkan ketika saya menggunakan 50k pohon? Apakah ini sesuatu yang bisa membantu bootstrapping?

3
Apa yang dimaksud para ahli statistik ketika mereka mengatakan kita tidak benar-benar memahami bagaimana LASSO (regularisasi) bekerja?
Saya telah ke beberapa pembicaraan statistik baru-baru ini tentang Lasso (regularisasi) dan satu hal yang terus muncul adalah bahwa kita tidak benar-benar mengerti mengapa Lasso bekerja atau mengapa ia bekerja dengan sangat baik. Saya bertanya-tanya apa maksud pernyataan ini. Jelas saya mengerti mengapa Lasso bekerja secara teknis, dengan cara mencegah …



2
Bagaimana Tensorflow `tf.train.Optimizer` menghitung gradien?
Saya mengikuti tutorial mnist Tensorflow ( https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py ). Tutorial menggunakan tf.train.Optimizer.minimize(khusus tf.train.GradientDescentOptimizer). Saya tidak melihat argumen yang dilewatkan di mana pun untuk menentukan gradien. Apakah Tensor flow menggunakan diferensiasi numerik secara default? Apakah ada cara untuk lulus dalam gradien seperti yang Anda bisa scipy.optimize.minimize?



1
Apa yang menjustifikasi perhitungan turunan dari fungsi matriks ini?
Dalam kursus pembelajaran mesin Andrew Ng, ia menggunakan rumus ini: ∇Atr(ABATC)=CAB+CTABT∇Atr(ABATC)=CAB+CTABT\nabla_A tr(ABA^TC) = CAB + C^TAB^T dan dia melakukan bukti cepat yang ditunjukkan di bawah ini: ∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = \nabla_{\circ} tr(f(\circ)A^TC) + \nabla_{\circ}tr(f(A)\circ^T C)\\ =(A^TC)^Tf'(\circ) + (\nabla_{\circ^T}tr(f(A)\circ^T C)^T \\ = C^TAB^T + (\nabla_{\circ^T}tr(\circ^T)Cf(A))^T \\ =C^TAB^T …

2
Dapatkah jaringan saraf convolutional mengambil sebagai input gambar dengan ukuran yang berbeda?
Saya sedang mengerjakan jaringan konvolusi untuk pengenalan gambar, dan saya bertanya-tanya apakah saya dapat memasukkan gambar dengan ukuran yang berbeda (meskipun tidak terlalu berbeda). Pada proyek ini: https://github.com/harvardnlp/im2markup Mereka bilang: and group images of similar sizes to facilitate batching Jadi, bahkan setelah preprocessing, gambar masih berukuran berbeda, yang masuk akal …

3
Bagaimana cara memilih metrik terbaik untuk mengukur kalibrasi saya?
Saya memprogram dan melakukan pengembangan berbasis tes. Setelah saya membuat perubahan dalam kode saya, saya menjalankan tes saya. Terkadang mereka berhasil dan terkadang mereka gagal. Sebelum saya menjalankan tes saya menuliskan angka 0,01-0,99 untuk kepercayaan saya bahwa tes akan berhasil. Saya ingin tahu apakah saya membaik dalam memprediksi apakah tes …

1
Dalam situasi apa Wilcoxon Signed-Rank Test lebih disukai daripada t-Test atau Sign Test?
Setelah beberapa diskusi (di bawah), saya sekarang memiliki gambaran yang lebih jelas tentang pertanyaan terfokus, jadi di sini adalah pertanyaan yang direvisi, meskipun beberapa komentar sekarang mungkin tampaknya tidak berhubungan dengan pertanyaan awal. Tampaknya uji-t menyatu dengan cepat untuk distribusi simetris , bahwa tes peringkat-bertanda mengasumsikan simetri , dan bahwa, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.