Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



2
Menggunakan LASSO hanya untuk pemilihan fitur
Di kelas pembelajaran mesin saya, kami telah belajar tentang bagaimana regresi LASSO sangat baik dalam melakukan pemilihan fitur, karena menggunakan regularisasi .l1l1l_1 Pertanyaan saya: apakah orang biasanya menggunakan model LASSO hanya untuk melakukan pemilihan fitur (dan kemudian melanjutkan untuk membuang fitur-fitur tersebut ke model pembelajaran mesin yang berbeda), atau apakah …


2
Kullback-Leibler Divergence untuk dua sampel
Saya mencoba menerapkan estimasi numerik Kullback-Leibler Divergence untuk dua sampel. Untuk debug implementasi, ambil sampel dari dua distribusi normal dan .N ( 1 , 2 )N(0,1)N(0,1)\mathcal N (0,1)N(1,2)N(1,2)\mathcal N (1,2) Untuk perkiraan sederhana saya menghasilkan dua histogram dan mencoba untuk memperkirakan secara integral numerik. Saya terjebak dengan menangani bagian-bagian histogram …


2
Apakah bias merupakan properti dari estimator, atau estimasi tertentu?
Sebagai contoh, saya sering bertemu siswa yang tahu bahwa Observed adalah penduga yang bias dari Populasi . Kemudian, ketika menulis laporan mereka, mereka mengatakan hal-hal seperti:R 2R2R2R^2R2R2R^2 "Saya menghitung Observed dan Adjusted , dan mereka sangat mirip, menunjukkan hanya sedikit bias dalam nilai Observed kami peroleh."R 2 R 2R2R2R^2R2R2R^2R2R2R^2 Saya …

2
Regresi: mengapa menguji normalitas residual keseluruhan, alih-alih residual bersyarat pada ?
Saya memahami bahwa dalam regresi linier, kesalahan diasumsikan terdistribusi secara normal, tergantung pada nilai prediksi y. Kemudian kita melihat residu sebagai semacam proksi untuk kesalahan. Ini sering direkomendasikan untuk menghasilkan output seperti ini: . Namun, saya tidak mengerti apa gunanya mendapatkan residual untuk setiap titik data dan menumbuknya bersama dalam …

1
Apakah jaringan saraf biasanya membutuhkan waktu untuk “menendang” selama pelatihan?
Saya mencoba untuk melatih jaringan saraf yang mendalam untuk klasifikasi, menggunakan propagasi balik. Secara khusus, saya menggunakan jaringan saraf convolutional untuk klasifikasi gambar, menggunakan perpustakaan Tensor Flow. Selama pelatihan, saya mengalami beberapa perilaku aneh, dan saya hanya ingin tahu apakah ini tipikal, atau apakah saya mungkin melakukan sesuatu yang salah. …

2
distribusi lemak-jari
Pertanyaan singkat: Apakah ada distribusi lemak-jari? Saya yakin jika itu ada, maka ia memiliki nama yang berbeda. Saya tidak tahu bagaimana merumuskannya sebagai fungsi analitik. Bisakah Anda membantu saya menemukan versi yang sudah ada atau mulai merumuskannya dalam sesuatu yang lebih bersih daripada simulasi raksasa? Ini adalah distribusi angka yang …


3
Cohen d untuk uji-t sampel dependen
Pertanyaan singkat: Saya telah melihat Cohen menghitung dua cara berbeda untuk uji-t sampel dependen (misalnya, desain sampel dalam menguji keefektifan obat dengan titik waktu sebelum / sesudah). Menggunakan deviasi standar dari skor perubahan dalam penyebut persamaan untuk Cohen d. Menggunakan standar deviasi skor pretest dalam penyebut persamaan untuk Cohen d. …


1
Mencegah kegagalan pengambilan sampel Pareto smoothed importance (PSIS-LOO)
Saya baru-baru ini mulai menggunakan Pareto smoothed pentingnya pengambilan sampel validasi silang keluar-keluar-keluar (PSIS-LOO), yang dijelaskan dalam makalah ini: Vehtari, A., & Gelman, A. (2015). Pareto memuluskan sampel kepentingan. pracetak arXiv ( tautan ). Vehtari, A., Gelman, A., & Gabry, J. (2016). Evaluasi model Bayesian praktis menggunakan validasi silang tinggalkan-keluar-keluar …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.