Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Validasi silang dan regresi logistik ordinal
Saya mencoba memahami validasi silang untuk regresi logistik ordinal. Tujuan permainan ini adalah untuk memvalidasi model yang digunakan dalam analisis ... Saya pertama kali membuat kumpulan data mainan: set.seed(1) N <- 10000 # predictors x1 <- runif(N) x2 <- runif(N) x3 <- runif(N) # coeffs in the model a <- …

2
Uji statistik untuk nilai yang secara signifikan lebih jauh dari rata-rata populasi: apakah tes-Z atau uji-T?
Seberapa signifikan suatu nilai dibandingkan dengan daftar nilai? Dalam kebanyakan kasus pengujian statistik melibatkan membandingkan set sampel dengan populasi. Dalam kasus saya, sampel dibuat dengan satu nilai dan kami membandingkannya dengan populasi. Saya seorang dilettante dalam pengujian hipotesis statistik dihadapkan dengan mungkin masalah paling mendasar. Bukan hanya satu tes tetapi …

1
Langkah-langkah untuk mencari tahu distribusi posterior ketika mungkin cukup sederhana untuk memiliki bentuk analitik?
Ini juga ditanyakan di Computational Science. Saya mencoba menghitung perkiraan Bayesian dari beberapa koefisien untuk autoregresi, dengan 11 sampel data: mana adalah Gaussian dengan rerata 0 dan varians Distribusi sebelumnya pada vektor adalah Gaussian dengan rerata dan matriks kovarians diagonal dengan entri diagonal sama dengan .Yi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi Y_{i} = \mu + …

1
Memahami tidak ada teorema makan siang gratis di Klasifikasi Pola Duda et al
Saya memiliki beberapa pertanyaan tentang notasi yang digunakan dalam Bagian 9.2. Kurangnya Keunggulan Inheren dari Setiap Klasifikasi di Duda, Hart dan Stork's Pattern Classification . Pertama-tama izinkan saya mengutip beberapa teks yang relevan dari buku ini: Untuk kesederhanaan pertimbangkan masalah dua kategori, di mana set pelatihan terdiri dari pola x …

1
Apakah pelatihan yang jarang dilakukan berdampak buruk pada SVM?
Saya mencoba untuk mengklasifikasikan pesan ke dalam kategori yang berbeda menggunakan SVM. Saya telah menyusun daftar kata / simbol yang diinginkan dari set pelatihan. Untuk setiap vektor, yang mewakili pesan, saya mengatur baris yang sesuai 1jika kata tersebut ada: "corpus" adalah: [mary, little, lamb, star, twinkle] pesan pertama: "mary had …


2
Menerapkan pembelajaran mesin untuk penyaringan DDoS
Dalam kursus Pembelajaran Mesin Stanford, Andrew Ng menyebut penerapan ML di bidang TI. Beberapa waktu kemudian ketika saya mendapat ukuran sedang (sekitar 20k bot) DDoS di situs kami, saya memutuskan untuk melawannya menggunakan classifier Neural Network sederhana. Saya telah menulis skrip python ini dalam waktu sekitar 30 menit: https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos Menggunakan …

2
Menyesuaikan nilai-p untuk analisis sekuensial adaptif (untuk uji chi square)?
Saya ingin tahu literatur statistik apa yang relevan untuk masalah berikut ini, dan mungkin bahkan sebuah ide tentang bagaimana menyelesaikannya. Bayangkan masalah berikut ini: Kami memiliki 4 kemungkinan perawatan untuk beberapa penyakit. Untuk memeriksa perawatan mana yang lebih baik, kami melakukan uji coba khusus. Dalam uji coba, kita mulai dengan …


2
Memprediksi banyak target atau kelas?
Misalkan saya sedang membangun model prediksi di mana saya mencoba untuk memprediksi beberapa peristiwa (misalnya, gulungan dadu dan lemparan koin). Sebagian besar algoritma yang saya kenal bekerja dengan hanya satu target, jadi saya bertanya-tanya apakah ada pendekatan standar untuk hal semacam ini. Saya melihat dua opsi yang memungkinkan. Mungkin pendekatan …



1
Nama analog kesalahan absolut rata-rata dengan skor Brier?
Pertanyaan kemarin Menentukan akurasi model yang memperkirakan probabilitas acara membuat saya ingin tahu tentang penilaian probabilitas. The Brier skor adalah rata-rata kuadrat error ukuran. Apakah pengukuran kinerja kesalahan absolut rata-rata analog punya nama juga?1N∑i=1N(predictioni−referencei)21N∑i=1N(predictioni−referencei)2\frac{1}{N}\sum\limits _{i=1}^{N}(prediction_i - reference_i)^2 1N∑i=1N|predictioni−referencei|1N∑i=1N|predictioni−referencei|\frac{1}{N}\sum\limits _{i=1}^{N}|prediction_i - reference_i|



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.