Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Apakah nilai p yang lebih kecil lebih meyakinkan?
Saya telah membaca tentang nilai- , tingkat kesalahan tipe 1, tingkat signifikansi, perhitungan daya, ukuran efek dan perdebatan Fisher vs Neyman-Pearson. Ini membuat saya agak kewalahan. Saya minta maaf untuk dinding teks, tetapi saya merasa perlu untuk memberikan gambaran tentang pemahaman saya saat ini tentang konsep-konsep ini, sebelum saya pindah …

5
Apa yang dikatakan interval kepercayaan tentang presisi (jika ada)?
Morey et al (2015) berpendapat bahwa interval kepercayaan menyesatkan dan ada beberapa bias terkait dengan pemahaman mereka. Antara lain, mereka menggambarkan kekeliruan presisi sebagai berikut: Kesalahan Presisi Lebar interval kepercayaan menunjukkan ketepatan pengetahuan kita tentang parameter. Interval kepercayaan sempit menunjukkan pengetahuan yang tepat, sementara kesalahan kepercayaan yang luas menunjukkan pengetahuan …


3
Membangun autoencoder di Tensorflow untuk melampaui PCA
Hinton dan Salakhutdinov dalam Mengurangi Dimensi Data dengan Neural Networks, Science 2006 mengusulkan PCA non-linear melalui penggunaan autoencoder yang mendalam. Saya telah mencoba membangun dan melatih autoencoder PCA dengan Tensorflow beberapa kali tetapi saya tidak pernah dapat memperoleh hasil yang lebih baik daripada PCA linier. Bagaimana saya bisa melatih autoencoder …

5
Rekomendasi warna dan ketebalan garis untuk plot garis
Banyak yang telah ditulis tentang pilihan warna ramah buta warna untuk peta, poligon, dan wilayah yang diarsir secara umum (lihat misalnya http://colorbrewer2.org ). Saya belum dapat menemukan rekomendasi untuk warna garis dan ketebalan garis yang bervariasi untuk grafik garis. Sasarannya adalah: mudah membedakan garis bahkan ketika mereka saling terkait garis …


1
Apa sajakah pedoman yang berguna untuk parameter GBM?
Apa saja pedoman yang berguna untuk parameter pengujian (yaitu kedalaman interaksi, anak kecil, laju sampel, dll.) Menggunakan GBM? Katakanlah saya memiliki 70-100 fitur, populasi 200.000 dan saya berniat menguji kedalaman interaksi 3 dan 4. Jelas saya perlu melakukan beberapa pengujian untuk melihat kombinasi parameter apa yang terbaik di luar sampel. …

4
Mengapa nilai p yang lebih rendah tidak lebih banyak bukti terhadap nol? Argumen dari Johansson 2011
Johansson (2011) dalam " Hail the impossible: nilai-p, bukti, dan kemungkinan " (di sini juga terkait dengan jurnal ) menyatakan bahwa nilai- yang lebih rendah sering dianggap sebagai bukti yang lebih kuat terhadap nol. Johansson menyiratkan bahwa orang akan menganggap bukti terhadap nol lebih kuat jika uji statistik mereka menghasilkan …

5
Mendeteksi prediktor signifikan dari banyak variabel independen
Dalam dataset dari dua populasi yang tidak tumpang tindih (pasien & sehat, total ) saya ingin mencari (dari variabel independen) prediktor signifikan untuk variabel dependen berkelanjutan. Ada korelasi antara prediktor. Saya tertarik untuk mencari tahu apakah salah satu prediktor terkait dengan variabel dependen "dalam kenyataan" (daripada memprediksi variabel dependen setepat …

2
Apa perbedaan antara "pembelajaran dalam" dan pemodelan multilevel / hierarkis?
Apakah "pembelajaran mendalam" hanyalah istilah lain untuk pemodelan bertingkat / hierarkis? Saya jauh lebih akrab dengan yang terakhir daripada yang pertama, tetapi dari apa yang bisa saya katakan, perbedaan utama tidak dalam definisi mereka, tetapi bagaimana mereka digunakan dan dievaluasi dalam domain aplikasi mereka. Sepertinya jumlah node dalam aplikasi "pembelajaran …

1
Pengurangan dimensi (SVD atau PCA) pada matriks besar dan jarang
/ edit: Tindak lanjut lebih lanjut sekarang Anda dapat menggunakan irlba :: prcomp_irlba / edit: menindaklanjuti posting saya sendiri. irlbasekarang memiliki argumen "pusat" dan "skala", yang memungkinkan Anda menggunakannya untuk menghitung komponen prinsip, misalnya: pc <- M %*% irlba(M, nv=5, nu=0, center=colMeans(M), right_only=TRUE)$v Saya memiliki banyak Matrixfitur yang ingin saya …


8
Mengganti outlier dengan mean
Pertanyaan ini diajukan oleh teman saya yang tidak mengerti internet. Saya tidak memiliki latar belakang statistik dan saya telah mencari di internet untuk pertanyaan ini. Pertanyaannya adalah: apakah mungkin untuk mengganti outlier dengan nilai rata-rata? jika memungkinkan, apakah ada referensi buku / jurnal untuk mendukung pernyataan ini?

3
Mengapa pemilihan variabel diperlukan?
Prosedur pemilihan variabel berbasis data umum (misalnya, maju, mundur, bertahap, semua himpunan bagian) cenderung menghasilkan model dengan sifat yang tidak diinginkan, termasuk: Koefisien yang bias jauh dari nol. Kesalahan standar yang terlalu kecil dan interval kepercayaan yang terlalu sempit. Uji statistik dan nilai-p yang tidak memiliki makna yang diiklankan. Perkiraan …

3
Bantahan berbasis entropi dari Sharei Bayesian panah mundur paradoks waktu?
Dalam makalah ini , peneliti berbakat Cosma Shalizi berpendapat bahwa untuk sepenuhnya menerima pandangan Bayesian yang subjektif, kita juga harus menerima hasil yang tidak fisik bahwa panah waktu (diberikan oleh aliran entropi) harus benar-benar mundur . Ini terutama merupakan upaya untuk berdebat dengan entropi maksimum / pandangan subjektif sepenuhnya yang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.