Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana cara membandingkan kinerja pengklasifikasi pembelajaran mesin secara statistik?
Berdasarkan estimasi akurasi klasifikasi, saya ingin menguji apakah satu classifier secara statistik lebih baik pada set dasar daripada classifier lain. Untuk setiap classifier, saya memilih pelatihan dan pengujian sampel secara acak dari set dasar, melatih model, dan menguji model. Saya melakukan ini sepuluh kali untuk setiap classifier. Karena itu saya …

4
Bagaimana Anda Menafsirkan RMSLE (Root Mean Squared Logarithmic Error)?
Saya telah melakukan kompetisi pembelajaran mesin di mana mereka menggunakan RMSLE (Root Mean Squared Logarithmic Error) untuk mengevaluasi kinerja memprediksi harga jual suatu kategori peralatan. Masalahnya adalah saya tidak yakin bagaimana menafsirkan keberhasilan hasil akhir saya. Sebagai contoh jika saya mencapai RMSLE dari bisa saya membesarkannya yang eksponensial kekuatan dan …

3
K-lipat vs. Validasi silang Monte Carlo
Saya mencoba mempelajari berbagai metode validasi silang, terutama dengan maksud untuk diterapkan pada teknik analisis multivariat yang diawasi. Dua yang saya temui adalah teknik validasi silang K-fold dan Monte Carlo. Saya telah membaca bahwa K-fold adalah variasi pada Monte Carlo tetapi saya tidak yakin saya sepenuhnya mengerti apa yang membentuk …

2
Memilih bandwidth untuk penduga kepadatan kernel
Untuk penduga kepadatan kernel (KDE) univariat, saya menggunakan aturan Silverman untuk menghitung :hhh 0.9min(sd,IQR/1.34)×n−0.20.9min(sd,IQR/1.34)×n−0.2\begin{equation} 0.9 \min(sd, IQR/1.34)\times n^{-0.2} \end{equation} Apa aturan standar untuk KDE multivarian (dengan asumsi kernel Normal).

3
R: Random Forest melemparkan NaN / Inf dalam kesalahan "panggilan fungsi asing" meskipun tidak ada dataset NaN [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 2 tahun yang lalu . Saya menggunakan tanda sisipan untuk menjalankan hutan acak lintas divalidasi atas dataset. Variabel Y adalah faktor. Tidak ada NaN, Inf, …





2
Kesalahan "sistem adalah komputasi singular" ketika menjalankan glm
Saya menggunakan paket robustbase untuk menjalankan estimasi glm. Namun ketika saya melakukannya, saya mendapatkan kesalahan berikut: Error in solve.default(crossprod(X, DiagB * X)/nobs, EEq) : system is computationally singular: reciprocal condition number = 1.66807e-16 Apa artinya ini? Dan bagaimana saya bisa men-debug-nya? PS. Jika Anda membutuhkan sesuatu (rumus / spesifikasi atau …

3
Mengapa AUC lebih tinggi untuk pengklasifikasi yang kurang akurat daripada untuk yang lebih akurat?
Saya memiliki dua pengklasifikasi A: jaringan Bayesian yang naif B: tree (terhubung sendiri) jaringan Bayesian Dalam hal akurasi dan langkah-langkah lain, A melakukan relatif lebih buruk daripada B. Namun, ketika saya menggunakan paket R ROCR dan AUC untuk melakukan analisis ROC, ternyata AUC untuk A lebih tinggi daripada AUC untuk …


2
Apakah Statistics.com menerbitkan jawaban yang salah?
Statistics.com menerbitkan masalah minggu ini: Tingkat penipuan asuransi perumahan adalah 10% (satu dari sepuluh klaim adalah penipuan). Seorang konsultan telah mengusulkan sistem pembelajaran mesin untuk meninjau klaim dan mengklasifikasikannya sebagai penipuan atau tidak-penipuan. Sistem ini 90% efektif dalam mendeteksi klaim penipuan, tetapi hanya 80% efektif dalam mengklasifikasikan dengan benar klaim …

2
Apa model statistik di belakang algoritma SVM?
Saya telah belajar bahwa, ketika berhadapan dengan data menggunakan pendekatan berbasis model, langkah pertama adalah memodelkan prosedur data sebagai model statistik. Kemudian langkah selanjutnya adalah mengembangkan algoritma inferensi / pembelajaran yang efisien / cepat berdasarkan pada model statistik ini. Jadi saya ingin bertanya model statistik mana yang berada di belakang …

3
Mengapa campuran dua variabel yang terdistribusi normal hanya bimodal jika artinya berbeda setidaknya dua kali lipat dari standar deviasi?
Di bawah campuran dua distribusi normal: https://en.wikipedia.org/wiki/Multimodal_distribution#Mixture_of_two_normal_distributions "Campuran dari dua distribusi normal memiliki lima parameter untuk diperkirakan: dua rata-rata, dua varian dan parameter pencampuran. Campuran dua distribusi normal dengan standar deviasi yang sama adalah bimodal hanya jika artinya berbeda setidaknya dua kali dari standar deviasi umum. . " Saya mencari …
28 bimodal 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.