Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Menganalisis pertandingan sepak bola: pemain serupa dengan DBSCAN dan lintasan serupa dengan TRACLUS
Saya mencoba menganalisis kumpulan data yang berasal dari sensor yang terletak di dekat sepatu pemain dalam pertandingan ( http://www.orgs.ttu.edu/debs2013/index.php?goto=cfchallengedetails ). Saya memutuskan untuk melihat pengelompokan untuk mengidentifikasi: Lintasan pemain yang serupa dalam pertandingan dengan menggunakan algoritma pengelompokan TRACLUS Mirip pemain dengan menghitung beberapa karakteristik seperti bagian yang gagal, umpan silang …


3
Apakah data binning valid sebelum korelasi Pearson?
Apakah dapat diterima untuk menyimpan data, menghitung rata-rata sampah, dan kemudian mendapatkan koefisien korelasi Pearson berdasarkan rata-rata ini? Tampaknya prosedur yang agak mencurigakan bagi saya dalam hal itu (jika Anda menganggap data sebagai sampel populasi) sebaran rata-rata ini akan menjadi kesalahan standar rata-rata dan karenanya sangat ketat jika besar. Jadi …


2
Naif Bayes pada variabel kontinu
Tolong izinkan saya untuk mengajukan pertanyaan dasar. Saya memahami mekanisme Naive Bayes untuk variabel diskrit, dan dapat mengulang perhitungan "dengan tangan". (kode HouseVotes84 semua jalan per di bawah ini). Namun - Saya berjuang untuk melihat bagaimana mekanisme bekerja untuk variabel kontinu (contoh kode per di bawah). Bagaimana paket menghitung probabilitas …
8 r  naive-bayes  bayes 

1
Apakah mungkin untuk memiliki penduga yang tidak bias dan terikat?
Saya punya parameter θθ\theta yang terletak di antara [ 0 , 1 ][0,1][0,1]. Katakanlah saya dapat menjalankan percobaan dan memperolehnya θ^= θ + wθ^=θ+w\hat{\theta} = \theta + wdimana wwwadalah Gaussian standar. Yang saya butuhkan adalah perkiraanθθ\thetayang 1) tidak bias 2) hampir pasti dibatasi. Persyaratan (2) sangat penting bagi saya. Pemikiran …


1
Ubah analisis titik
Bisakah seseorang tolong jelaskan titik perubahan kepada saya. Saya menggunakan paket dalam R, dan saya tidak benar-benar mengerti apa arti metode yang berbeda, pro dan kontra dari masing-masing, dan saya terutama tidak mengerti nilai penalti. Ketika Anda meningkatkan nilai penalti, apa artinya itu dan apa fungsinya? Saya telah melakukan banyak …

1
Bagaimana seseorang dapat melakukan analisis kekuatan binomial dua kelompok tanpa menggunakan perkiraan normal?
Saya ingin melakukan analisis kekuatan untuk uji hipotesis (non-) kesetaraan proporsi di mana proporsinya sangat kecil. Saya ingin melakukannya tanpa menggunakan perkiraan normal (atau Poisson) dari distribusi binomial. Ada beberapa jenis pertanyaan kekuatan yang ingin saya atasi. Pasca-hoc : Diberikan (probabilitas keberhasilan dalam grup 1) dan \ Pr_2 dan N_1 …

2
Ukuran sampel sehubungan dengan prediksi dalam klasifikasi dan regresi
Sehubungan dengan pengujian hipotesis, memperkirakan ukuran sampel dilakukan melalui daya, dan itu intuitif bahwa meningkatkan ukuran yang sama meningkatkan presisi efek yang diperkirakan. Tetapi bagaimana dengan prediksi untuk klasifikasi dan regresi? Aspek apa dari masalah prediksi yang dipengaruhi oleh ukuran sampel selain memperkirakan kesalahan generalisasi atau RMSE untuk regresi. Singkatnya, …

1
Pengkodean Dummy untuk kontras: 0,1 vs 1, -1
Saya mencari bantuan Anda dalam memahami perbedaan antara dua kontras yang berbeda untuk variabel dikotomis. Pada halaman ini: http://www.psychstat.missouristate.edu/multibook/mlt08.htm di bawah "Variabel Prediktor Dichotomous", ada dua cara untuk mengkode prediktor dikotomis: menggunakan kontras 0,1 atau kontras 1, -1 . Saya agak mengerti perbedaannya di sini (0,1 adalah pengkodean dummy dan …

3
Hubungan antara tes omnibus dan beberapa perbandingan?
Wikipedia mengatakan Metode yang mengandalkan tes omnibus sebelum melanjutkan ke beberapa perbandingan . Biasanya metode ini memerlukan uji rentang ANOVA / Tukey yang signifikan sebelum melanjutkan ke beberapa perbandingan. Metode ini memiliki kontrol "lemah" kesalahan Tipe I. Juga Uji-F dalam ANOVA adalah contoh uji omnibus, yang menguji signifikansi keseluruhan model. …

2
Mengapa saya mendapatkan hasil yang sama untuk OLS dan GLS di R?
Ketika saya menjalankan kode ini: require(nlme) a <- matrix(c(1,3,5,7,4,5,6,4,7,8,9)) b <- matrix(c(3,5,6,2,4,6,7,8,7,8,9)) res <- lm(a ~ b) print(summary(res)) res_gls <- gls(a ~ b) print(summary(res_gls)) Saya mendapatkan koefisien yang sama dan signifikansi statistik yang sama pada koefisien: Loading required package: nlme Call: lm(formula = a ~ b) Residuals: Min 1Q Median …


1
Identifikasi kausal dan splines yang dihukum
Saya baru saja mendapat penolakan dari jurnal ekonomi. Di antara alasan yang dikutip untuk penolakan adalah: manfaat menggunakan metode semi-parametrik tidak jelas dibawa keluar dibandingkan dengan teknik-teknik alternatif yang lebih sederhana dengan identifikasi hubungan kausal yang bersih Tentu saja mungkin saya bisa melakukan pekerjaan yang lebih baik untuk memotivasi metodologi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.