Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Metode non-parametrik yang berbeda untuk memperkirakan distribusi probabilitas data
Saya punya beberapa data dan berusaha menyesuaikan kurva yang halus dengannya. Namun, saya tidak ingin menegakkan terlalu banyak kepercayaan sebelumnya atau pra-konsepsi yang terlalu kuat (kecuali yang tersirat oleh sisa pertanyaan saya) di atasnya, atau distribusi tertentu. Saya hanya ingin mencocokkannya dengan beberapa kurva yang halus (atau memiliki perkiraan yang …



1
Bagaimana mengukur keandalan peringkat konsensus (masalah dari buku Kemeny-Snell)
Misalkan ahli masing-masing diminta untuk memberi peringkat satu set objek dalam urutan atau preferensi. Biarkan ikatan dalam peringkat.kkknnn John Kemeny dan Laurie Snell dalam buku 1962 tahun mereka "model matematika dalam Ilmu Sosial" mengusulkan untuk memecahkan masalah berikutnya: PROYEK . Mengembangkan ukuran keandalan peringkat konsensus oleh ahli . Sebagai contoh, …


3
Mana yang lebih baik, stl atau membusuk?
Saya melakukan analisis deret waktu menggunakan R. Saya harus menguraikan data saya menjadi komponen tren, musiman dan acak. Saya memiliki data mingguan selama 3 tahun. Saya telah menemukan dua fungsi di R - stl()dan decompose(). Saya telah membaca bahwa stl()ini tidak baik untuk dekomposisi multiplikasi. Adakah yang bisa memberi tahu …
10 r  time-series 

3
Apakah menghitung "probabilitas cakupan aktual" sama dengan menghitung "interval kredibel"?
Saya sedang membaca buku teks statistik tingkat entri. Dalam bab tentang estimasi kemungkinan maksimum proporsi keberhasilan dalam data dengan distribusi binomial, itu memberikan formula untuk menghitung interval kepercayaan dan kemudian dengan santai disebutkan. Pertimbangkan probabilitas cakupan aktualnya, yaitu probabilitas bahwa metode tersebut menghasilkan interval yang menangkap nilai parameter sebenarnya. Ini …

3
Bagaimana cara mendapatkan nilai-p koefisien dari regresi bootstrap?
Dari Quick-R Robert Kabacoff yang saya miliki # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, …



4
Mengapa KNN tidak “berbasis model”?
ESL bab 2.4 tampaknya mengklasifikasikan regresi linier sebagai "berbasis model", karena mengasumsikan , sedangkan tidak ada perkiraan serupa yang dinyatakan untuk k-tetangga terdekat. Tapi bukankah kedua metode membuat asumsi tentang ?f ( x )f( x ) ≈ x ⋅ βf(x)≈x⋅βf(x) \approx x\cdot\betaf( x )f(x)f(x) Kemudian di 2.4 bahkan dikatakan: Kuadrat …

1
Dapatkah Random Forests melakukan jauh lebih baik daripada 2,8% test error pada MNIST?
Saya belum menemukan literatur tentang penerapan Hutan Acak untuk MNIST, CIFAR, STL-10, dll. Jadi saya pikir saya akan mencobanya sendiri dengan permutasi MNIST invarian . Di R , saya mencoba: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Ini berjalan selama 2 jam dan mendapat 2,8% kesalahan pengujian. Saya juga mencoba scikit-belajar , …


2
Uji independensi vs uji homogenitas
Saya mengajar kursus statistik dasar dan hari ini saya akan membahas uji independensi chi-kuadrat untuk dua kategori dan tes untuk homogenitas. Dua skenario ini secara konseptual berbeda, tetapi dapat menggunakan statistik uji dan distribusi yang sama. Dalam uji homogenitas, total marginal untuk salah satu kategori diasumsikan menjadi bagian dari desain …

2
Klasifikasi hanya untuk satu kelas
Dalam klasifikasi sederhana, kami memiliki dua kelas: kelas-0 dan kelas-1. Dalam beberapa data saya hanya memiliki nilai untuk kelas-1, jadi tidak ada untuk kelas-0. Sekarang saya berpikir untuk membuat model untuk memodelkan data untuk kelas-1. Jadi, ketika data baru datang, model ini diterapkan pada data baru dan menemukan probabilitas yang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.