Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Melatih vs Kesenjangan Kesalahan Tes dan hubungannya dengan Overfitting: Merekonsiliasi saran yang bertentangan
Tampaknya ada saran yang bertentangan di luar sana tentang bagaimana menangani membandingkan kesalahan kereta vs tes, terutama ketika ada kesenjangan antara keduanya. Tampaknya ada dua aliran pemikiran yang bagi saya, tampaknya bertentangan. Saya ingin memahami cara mendamaikan keduanya (atau memahami apa yang saya lewatkan di sini). Pemikiran # 1: Kesenjangan …

2
Bagaimana Dropout Spatial dalam 2D ​​diterapkan?
Ini dengan merujuk pada kertas Pelokalan Objek Efisien Menggunakan Jaringan Konvolusional , dan dari apa yang saya pahami dropout diimplementasikan dalam 2D. Setelah membaca kode dari Keras tentang bagaimana Dropout 2D Spasial diimplementasikan, pada dasarnya bentuk biner acak [batch_size, 1, 1, num_channels] diimplementasikan. Namun, apa sebenarnya yang dilakukan Dropout 2D …

1
Analisis Sensitivitas dalam Jaringan Saraf Tiruan
Mengikuti pertanyaan yang sudah dijawab ( Mengekstraksi bobot penting dari jaringan umpan-maju Satu-Lapisan ) Saya mencari kesimpulan tentang relevansi input dalam jaringan saraf. Mempertimbangkan jaring yang dalam, di mana merekonstruksi kepentingan input dengan mundur melewati lapisan-lapisan dari simpul keluaran yang menarik mungkin sulit atau memakan waktu, saya bertanya-tanya apakah ada …



3
Mengganti Variabel dengan WoE (Bobot Bukti) dalam Regresi Logistik
Ini adalah pertanyaan mengenai praktik atau metode yang diikuti oleh beberapa rekan saya. Saat membuat model regresi logistik, saya telah melihat orang-orang mengganti variabel kategori (atau variabel kontinu yang dihilangkan) dengan masing-masing Bobot Bukti (WoE) masing-masing. Ini seharusnya dilakukan untuk membangun hubungan monoton antara regressor dan variabel dependen. Sekarang sejauh …

4
Apa perbedaan "mekanis" antara regresi linier berganda dengan jeda waktu dan deret waktu?
Saya lulusan dari bisnis dan ekonomi yang saat ini belajar untuk gelar master dalam bidang teknik data. Saat mempelajari regresi linier (LR) dan kemudian analisis deret waktu (TS), sebuah pertanyaan muncul di benak saya. Mengapa membuat metode yang sama sekali baru, yaitu deret waktu (ARIMA), alih-alih menggunakan regresi linier berganda …

1
Bayesian laso vs spike dan slab
Pertanyaan: Apa keuntungan / kerugian dari menggunakan satu sebelum yang lain untuk pemilihan variabel? Misalkan saya memiliki kemungkinan: di mana saya dapat menempatkan salah satu prior: w i ~ π delta 0 + ( 1 - π ) N ( 0 , 100 )y∼ N( Xw , σ2saya)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I) atau: w …


3
Jaringan saraf - input biner vs diskrit / kontinu
Adakah alasan bagus untuk memilih nilai biner (0/1) daripada nilai diskrit atau dinormalisasi berkelanjutan , misalnya (1; 3), sebagai input untuk jaringan umpan-maju untuk semua node input (dengan atau tanpa backpropagation)? Tentu saja, saya hanya berbicara tentang input yang dapat diubah menjadi bentuk apa pun; misalnya, ketika Anda memiliki variabel …

4
Fitur penskalaan dan normalisasi rata-rata
Saya mengikuti kursus pembelajaran mesin Andrew Ng dan tidak bisa mendapatkan jawaban untuk pertanyaan ini dengan benar setelah beberapa upaya. Mohon bantu selesaikan ini, meskipun saya sudah melewati level. Misalkan siswa telah mengambil beberapa kelas, dan kelas memiliki ujian tengah semester dan ujian akhir. Anda telah mengumpulkan dataset nilai mereka …

4
Mengapa kita mengatakan "Residual standard error"?
Kesalahan standar adalah estimasi standar deviasi dari estimator untuk parameter . θ θσ^( θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta Mengapa estimasi standar deviasi residual disebut "residual standard error" (misalnya, dalam output summary.lmfungsi R ) dan bukan "standar deviasi residual"? Perkiraan parameter apa yang kami lengkapi dengan kesalahan standar di sini? Apakah kita menganggap setiap …

2
Mengapa perbedaan kuadrat begitu umum digunakan?
Sangat sering ketika saya menyelidiki metode dan konsep statistik baru, saya mengalami perbedaan kuadrat (atau rata-rata kesalahan kuadrat, atau kebanyakan julukan lainnya). Sama seperti contoh, r Pearson diputuskan berdasarkan perbedaan kuadrat rata-rata dari garis regresi di mana titik terletak. Untuk ANOVA, Anda melihat jumlah kuadrat, dan sebagainya. Sekarang, saya mengerti …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.