Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Desain survei chi square
Adakah yang tahu metode untuk membandingkan dua variabel dengan uji chi square jika variabelnya dari survei yang berbeda dengan svydesign()pernyataan yang berbeda ? Saya mencari untuk menguji perbedaan dalam distribusi variabel di dua gelombang survei, tetapi svychisq()pernyataan tersebut terbatas pada satu objek desain. Apakah sah untuk menumpuk kedua variabel dalam …
8 r  chi-squared  survey 

7
Merencanakan bilah interval kepercayaan dari statistik ringkasan
Agak seperti plot kotak. Maksud saya belum tentu interval kepercayaan atas standar, interval kepercayaan rendah, rata-rata, dan plot kotak penampil rentang data, tapi maksud saya seperti plot kotak dengan hanya tiga potong data: interval kepercayaan 95% dan rata-rata . Ini adalah tangkapan layar dari artikel jurnal yang memiliki persis apa …

3
Memilih antara transformasi dalam regresi logistik
Dalam regresi linier, transformasi variabel penjelas dilakukan untuk memiliki korelasi maksimum dengan variabel dependen. Apa ukuran terbaik untuk memilih antara beberapa transformasi dalam regresi logistik karena variabel dependen adalah biner dan tidak kontinu? Tujuan akhirnya adalah untuk memaksimalkan daya angkat (daya prediksi) dari model.


2
Bobot dalam regresi kuantil untuk survei kompleks di R
Saya ingin memasukkan bobot sampel ke model regresi kuantil saya, tetapi saya tidak yakin bagaimana melakukan ini. Saya sudah menentukan berat badan saya, yang merupakan replikasi bobot yang sudah diberikan dalam dataset survei (dihitung dalam paket survei): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") dan model rq saya adalah: rq(y~x,tau=c(.1,.2,.3,.4,.5,.6,.7,.8,.9),data=my.data)) Saya mencoba menggunakan …

1
Pas model campuran gaussian menggunakan keturunan gradien stokastik
Saya sedang mengerjakan model pembelajaran kategori online yang menggunakan penurunan gradien stokastik agar sesuai dengan model campuran Gauss. Model ini didasarkan pada model pembelajaran online yang digunakan dalam Toscano & McMurray (2010). Sementara gradient descent kelihatannya bekerja cukup baik untuk memperkirakan rata-rata dan frekuensi / kemungkinan pencampuran kategori, saya mengalami …

1
Jarak mahalanobis pada data tidak normal
Jarak mahalanobis, ketika digunakan untuk tujuan klasifikasi, biasanya mengasumsikan distribusi normal multivariat, dan jarak dari centroid kemudian harus mengikuti (dengan derajat kebebasan sama dengan jumlah dimensi / fitur). Kita dapat menghitung probabilitas bahwa titik data baru milik set menggunakan jarak Mahalanobis-nya.χ2χ2\chi^2ddd Saya memiliki kumpulan data yang tidak mengikuti distribusi normal …

2
Non-normalitas dalam residu
Saya merujuk pada posting ini yang tampaknya mempertanyakan pentingnya distribusi normal residu, dengan alasan bahwa ini bersama dengan heteroskedastisitas berpotensi dapat dihindari dengan menggunakan kesalahan standar yang kuat. Saya telah mempertimbangkan berbagai transformasi - root, log dll - dan semuanya terbukti tidak berguna dalam menyelesaikan masalah sepenuhnya. Ini adalah plot …

2
Bagaimana cara menggabungkan beberapa dataset imputed?
Saya memerlukan satu set data imputed (misalnya untuk membuat dummy grup negara dari data pendapatan per kapita negara imputed). R menawarkan paket paket untuk membuat beberapa data imputasi (misalnya Amelia) dan menggabungkan hasil dari beberapa dataset (seperti dalam MItools). Kekhawatiran saya adalah jika saya dapat rata-rata semua data yang dimasukkan …

1
Stasioneritas - asumsi dan pemeriksaan
Saya sedang memeriksa tangkapan tikus di enam jerat perangkap tikus permanen berukuran 150 x 150 meter dan terdiri dari 121 stasiun perangkap yang berjarak 15 meter. Ada enam kisi perangkap seperti itu di lokasi penelitian yang berukuran <1000 hektar. Saya ingin menginterpolasi data penangkapan untuk membuat permukaan aktivitas tikus yang …

2
Apakah secara teknis “valid” sesuai dengan regresi logistik dengan variabel dependen yang proporsional?
Beberapa posting (di sini dan di sini ) menunjukkan bahwa regresi beta lebih tepat ketika variabel dependen secara alami dibatasi antara 0 dan 1. Pertanyaan saya adalah, mengesampingkan kesesuaian, apakah secara teknis tidak tepat untuk memasukkan regresi logistik ke variabel respons proporsional? R akan memberikan peringatan tetapi masih membuahkan hasil. …

1
Bagaimana model linear umum menggeneralisasi model linear umum?
Dari Wikipedia General linear model (GLM) adalah model linear statistik. Ini dapat ditulis sebagai 1 mana adalah matriks dengan serangkaian pengukuran multivariat, adalah matriks yang mungkin merupakan matriks desain , adalah matriks yang berisi parameter yang biasanya diperkirakan dan adalah matriks yang mengandung kesalahan atau noise. Kesalahan biasanya diasumsikan mengikuti …

1
Memilih prior yang tidak informatif
Saya sedang mengerjakan model yang mengandalkan fungsi parametrized jelek yang berfungsi sebagai fungsi kalibrasi pada bagian model. Menggunakan pengaturan Bayesian, saya perlu mendapatkan prior non-informatif untuk parameter yang menggambarkan fungsi saya. Saya tahu bahwa idealnya, saya harus mengambil referensi atau setidaknya Jeffreys priors tetapi fungsinya sangat jelek, memiliki banyak parameter …

2
Cara menerapkan beberapa pengujian koreksi untuk daftar gen yang tumpang tindih menggunakan R
Saya memiliki 2 penelitian yang mengamati respons pasien terhadap obat yang sama. Studi 1 menemukan 10.000 gen yang diekspresikan di atas latar belakang dan 500 di antaranya diekspresikan secara berbeda dan disebut sebagai tanda respon obat. Studi 2 menemukan 1.000 gen yang mewakili tanda tangan respons obat. Tumpang tindih antara …

2
Regresi Cox skala besar dengan R (Big Data)
Saya mencoba menjalankan regresi Cox pada dataset 2.000.000 sampel baris sebagai berikut hanya menggunakan R. Ini adalah terjemahan langsung dari PHREG di SAS. Sampel tersebut mewakili struktur dataset asli. ## library(survival) ### Replace 100000 by 2,000,000 test <- data.frame(start=runif(100000,1,100), stop=runif(100000,101,300), censor=round(runif(100000,0,1)), testfactor=round(runif(100000,1,11))) test$testfactorf <- as.factor(test$testfactor) summ <- coxph(Surv(start,stop,censor) ~ relevel(testfactorf, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.