Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Kapan sebaiknya menggunakan rata-rata untuk imputasi?
Misalkan kita memiliki tes kumpulan data : 1 8 12 14 . . 19 The . Menandakan hilang nilai-nilai. Kapan akan lebih baik menggunakan rata-rata dari nilai yang tidak hilang untuk menentukan nilai yang hilang daripada mengasumsikan bahwa data tersebut berasal dari distribusi normal?

1
Residu dalam regresi poisson
Zuur 2013 Beginners Guide to GLM & GLMM menyarankan validasi regresi Poisson dengan memplot residu Pearsons terhadap nilai yang dipasang. Zuur menyatakan kita seharusnya tidak melihat residu mengembang saat nilai pas meningkat, seperti plot yang dilampirkan (digambar tangan). Tapi saya pikir karakteristik utama dari distribusi Poisson adalah varians meningkat dengan …

1
Evaluasi efisien estimasi kepadatan kernel multidimensi
Saya telah melihat sejumlah literatur yang masuk akal tentang bagaimana memilih kernel dan bandwidth ketika menghitung estimasi kepadatan kernel, tetapi saya saat ini tertarik pada bagaimana meningkatkan waktu yang diperlukan untuk mengevaluasi KDE yang dihasilkan pada jumlah titik yang berubah-ubah. Dalam kasus saya, saya menggunakan kernel Gaussian multidimensi (2D atau …

2
Regresi berganda dalam statistik directional / circular?
Saya mencoba mengembangkan model prediksi untuk variabel dependen sudut (pada menggunakan beberapa pengukuran independen - juga variabel sudut, pada - sebagai prediktor. Setiap prediktor secara signifikan tetapi tidak berkorelasi sangat kuat dengan variabel dependen. Bagaimana saya bisa menggabungkan prediktor untuk menentukan model prediksi untuk variabel dependen yang optimal dalam beberapa …


2
Divergensi Kontrasif Persisten untuk RBM
Saat menggunakan algoritme pembelajaran CD persisten untuk Mesin Bolzmann Terbatas, kami memulai rantai pengambilan sampel Gibbs kami pada iterasi pertama pada titik data, tetapi bertentangan dengan CD normal, dalam mengikuti iterasi kami tidak memulai rantai kami. Alih-alih, kita mulai dari mana rantai sampel Gibbs dalam iterasi sebelumnya berakhir. Dalam algoritma …

2
Dalam meta-analisis, bagaimana seseorang harus menangani studi tidak signifikan yang tidak mengandung data mentah?
Katakanlah saya sedang melakukan meta-analisis, melihat kinerja grup A dan grup B sehubungan dengan konstruk tertentu. Sekarang, beberapa studi yang akan saya temui akan melaporkan bahwa tidak ada perbedaan statistik yang dapat ditemukan antara kedua kelompok tetapi tidak ada statistik uji yang pasti dan / atau data mentah yang akan …

1
Pengujian untuk penyebaran berlebihan dalam regresi logistik
R in Action (Kabacoff, 2011) menyarankan rutinitas berikut untuk menguji penyebaran berlebihan dalam regresi logistik: Fit regresi logistik menggunakan distribusi binomial: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Fit regresi logistik menggunakan distribusi quasibinomial: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Gunakan chi-squared untuk menguji penyebaran berlebihan: pchisq(summary(model_overdispersed)$dispersion * model_binom$df.residual, …


2
Bagaimana bukti Sampling Penolakan masuk akal?
Saya mengambil kursus tentang metode Monte Carlo dan kami belajar metode Sampling Penolakan (atau Sampling Terima-Tolak) dalam kuliah terakhir. Ada banyak sumber daya di web yang menunjukkan bukti metode ini, tetapi entah bagaimana saya tidak yakin dengan mereka. Jadi, dalam Sampel Penolakan, kami memiliki distribusi f( x )f(x)f(x)yang sulit untuk …

4
Mengevaluasi model regresi
Untuk masalah klasifikasi saya telah menggunakan Neural Networks dan mengukur kesalahan Tipe I dan II menggunakan matriks kebingungan dan ukurannya sesuai sumber daya ini ( mirror ), yang cukup mudah. Ketika dihadapkan dengan masalah estimasi, bagaimana seseorang menilai kinerja model? Dengan asumsi bahwa tidak ada kelas dan output ditafsirkan dalam …


4
Varians proporsi sampel menurun dengan n tetapi jumlah bertambah dengan n - mengapa?
Saya memiliki blok intuitif dengan ini. Untuk masalah binomial, standar deviasi hitungan adalahn p ( 1 - p )--------√nhal(1-hal)\sqrt{np(1-p)}. Sebaliknya, standar deviasi proporsi sampel menurun dengan meningkatnyannn dan p ( 1 - p )n-----√hal(1-hal)n\sqrt{\frac{p(1-p)}{n}}. Saya dapat melakukan pembagian dengannnn tapi saya tidak punya perasaan mengapa standar deviasi bergerak berlawanan arah.

1
Apa arti intuitif di balik tujuan dan mekanisme Statistik yang Memadai?
Definisi statistik yang memadai adalah: Biarkan X1,...,XnX1,...,XnX_1,...,X_n menjadi sampel acak dari distribusi yang diindeks oleh parameter θθ\theta. MembiarkanTTTmenjadi statistik. Misalkan, untuk setiapθθ\theta dan setiap nilai yang mungkin ttt dari TTT, distribusi bersama bersyarat dari X1,...,XnX1,...,XnX_1,...,X_n mengingat bahwa T=tT=tT=t hanya bergantung pada ttt tapi tidak menyala θθ\theta. Kemudian,TTT adalah statistik yang …

1
Mencoba memahami Proses Gaussian
Saya membaca buku GPML dan dalam Bab 2 (halaman 15) , buku ini menceritakan cara melakukan regresi menggunakan Proses Gaussian (GP), tetapi saya mengalami kesulitan mencari cara kerjanya. Dalam inferensi Bayesian untuk model parametrik, pertama-tama kita memilih prior pada parameter model θθ\theta, itu adalah p(θ)p(θ)p(\theta); kedua, diberikan data pelatihanDDD, kami …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.