Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
R caret dan NAs
Saya sangat suka caret karena kemampuan penyetelan parameter dan antarmuka yang seragam, tetapi saya telah mengamati bahwa selalu membutuhkan set data lengkap (yaitu tanpa NAS) bahkan jika model "telanjang" yang diterapkan memungkinkan NAs. Itu sangat merepotkan, mengingat seseorang harus menerapkan metode imputasi kerja, yang pada awalnya tidak diperlukan. Bagaimana seseorang …

1
Apa notasi klasik dalam statistik, aljabar linier, dan pembelajaran mesin? Dan apa hubungan antara notasi ini?
Ketika kita membaca buku, memahami notasi memainkan peran yang sangat penting dalam memahami konten. Sayangnya, komunitas yang berbeda memiliki konvensi notasi yang berbeda untuk perumusan model dan masalah optimisasi. Bisakah seseorang meringkas beberapa notasi formulasi di sini dan memberikan kemungkinan alasan? Saya akan memberikan contoh di sini: Dalam literatur aljabar …

6
Bagaimana cara memilih antara skor ROC AUC dan F1?
Saya baru-baru ini menyelesaikan kompetisi Kaggle di mana skor roc auc digunakan sesuai persyaratan kompetisi. Sebelum proyek ini, saya biasanya menggunakan skor f1 sebagai metrik untuk mengukur kinerja model. Ke depan, saya bertanya-tanya bagaimana saya harus memilih antara dua metrik ini? Kapan menggunakan yang mana, dan apa pro dan kontra …

1
One-vs-All dan One-vs-One dalam svm?
Apa perbedaan antara SVM satu-vs-semua dan satu-vs-satu? Apakah one-vs-all berarti satu classifier untuk mengklasifikasikan semua tipe / kategori gambar baru dan one-vs-one berarti setiap tipe / kategori gambar baru mengklasifikasikan dengan classifier yang berbeda (masing-masing kategori ditangani oleh classifier khusus)? Misalnya, jika gambar baru akan diklasifikasikan menjadi lingkaran, persegi panjang, …

1
Norma apa dari kesalahan rekonstruksi yang diminimalkan oleh matriks aproksimasi peringkat rendah yang diperoleh dengan PCA?
Mengingat PCA (atau SVD) pendekatan matriks XXX dengan matriks X , kita tahu bahwa X adalah yang terbaik peringkat rendah perkiraan X .X^X^\hat XX^X^\hat XXXX Apakah ini sesuai dengan norma ∥ ⋅ ∥ 2 yang diinduksi∥⋅∥2∥⋅∥2\parallel \cdot \parallel_2 (yaitu norma nilai eigen terbesar) atau menurut norma Frobenius ∥ ⋅ ∥F∥⋅∥F\parallel …

1
Hubungan antara variational Bayes dan EM
Saya membaca di suatu tempat bahwa metode Variational Bayes adalah generalisasi dari algoritma EM. Memang, bagian berulang dari algoritma sangat mirip. Untuk menguji apakah algoritma EM adalah versi khusus dari Variational Bayes, saya mencoba yang berikut: YYY adalah data, adalah kumpulan variabel laten dan adalah parameternya. Dalam Variational Bayes yang …

5
Penjelasan intuitif konvergensi dalam distribusi dan konvergensi dalam probabilitas
Apa perbedaan intuitif antara variabel acak konvergen dalam probabilitas versus variabel acak konvergen dalam distribusi? Saya sudah membaca banyak definisi dan persamaan matematika, tetapi itu tidak terlalu membantu. (Harap diingat, saya mahasiswa sarjana yang belajar ekonometrik.) Bagaimana variabel acak dapat menyatu menjadi satu nomor, tetapi juga menyatu ke suatu distribusi?

7
Pengujian hipotesis distribusi - apa gunanya melakukannya jika Anda tidak bisa "menerima" hipotesis nol Anda?
Berbagai tes hipotesis, seperti tes GOF, Kolmogorov-Smirnov, Anderson-Darling, dll., Ikuti format dasar ini:χ2χ2\chi^{2} H0H0H_0 : Data mengikuti distribusi yang diberikan. H1H1H_1 : Data tidak mengikuti distribusi yang diberikan. Biasanya, seseorang menilai klaim bahwa beberapa data yang diberikan mengikuti beberapa distribusi yang diberikan, dan jika seseorang menolak , data tersebut tidak …


2
Mengapa Python scikit-learn LDA tidak bekerja dengan benar dan bagaimana cara menghitung LDA melalui SVD?
Saya menggunakan Linear Discriminant Analysis (LDA) dari scikit-learnperpustakaan pembelajaran mesin (Python) untuk pengurangan dimensi dan sedikit ingin tahu tentang hasilnya. Sekarang saya bertanya-tanya apa yang dilakukan LDA scikit-learnsehingga hasilnya terlihat berbeda dari, misalnya, pendekatan manual atau LDA yang dilakukan di R. Akan lebih bagus jika seseorang bisa memberi saya wawasan …

2
Apa distribusi dalam regresi linier di bawah hipotesis nol? Mengapa modenya tidak nol ketika ?
Apa distribusi koefisien determinasi, atau R kuadrat, , dalam regresi berganda univariat linier di bawah hipotesis nol ?R2R2R^2H0:β=0H0:β=0H_0:\beta=0 Bagaimana hal itu tergantung pada jumlah prediktor dan jumlah sampel ? Apakah ada ekspresi bentuk tertutup untuk mode distribusi ini?kkkn>kn>kn>k Secara khusus, saya merasa bahwa untuk regresi sederhana (dengan satu prediktor ) …


2
Perkirakan jumlah nilai dalam vektor
Saya memiliki satu set bilangan real. Saya perlu memperkirakan jumlah nomor baru. Apakah ada cara bersih untuk melakukan ini di R? secara umum? Saya harap ini bukan ultra-sepele ;-) Sangat dihargai atas tanggapan Anda. PK
26 r 


3
Bagaimana menemukan centroid berbeda dari menemukan mean?
Saat melakukan pengelompokan hierarkis, seseorang dapat menggunakan banyak metrik untuk mengukur jarak antar cluster. Dua metrik seperti itu menyiratkan perhitungan centroid dan cara titik data dalam kelompok. Apa perbedaan antara mean dan centroid? Bukankah ini titik yang sama di cluster?
26 clustering  mean 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.