Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Grafik Kurva Probabilitas untuk Model Logit Dengan Banyak Prediktor
Saya memiliki fungsi probabilitas berikut: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} dimana z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Model saya terlihat seperti Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} Ini divisualisasikan melalui kurva probabilitas yang terlihat seperti yang di bawah ini. Saya sedang mempertimbangkan menambahkan beberapa variabel ke …

2
Analisis residu regresi logistik
Pertanyaan ini agak umum dan bertele-tele, tapi tolong tahan dengan saya. Dalam aplikasi saya, saya memiliki banyak dataset, masing-masing terdiri dari ~ 20.000 titik data dengan ~ 50 fitur dan satu variabel biner yang tergantung. Saya mencoba untuk memodelkan dataset menggunakan regresi logistik teratur (paket R glmnet ) Sebagai bagian …

1
Bagaimana saya bisa mengoptimalkan efisiensi komputasi ketika memasang model yang kompleks ke kumpulan data besar berulang kali?
Saya mengalami masalah kinerja menggunakan MCMCglmmpaket di R untuk menjalankan model efek campuran. Kode ini terlihat seperti ini: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) Ada sekitar 20.000 pengamatan dalam data dan mereka terkelompok di sekitar 200 sekolah. Saya telah membuang semua variabel yang tidak digunakan dari …


2
Bagaimana cara mensimulasikan data fungsional?
Saya mencoba menguji berbagai pendekatan analisis data fungsional. Idealnya, saya ingin menguji panel pendekatan yang saya miliki pada data fungsional yang disimulasikan. Saya sudah mencoba untuk menghasilkan FD simulasi menggunakan pendekatan berdasarkan pada penjumlahan Gaussian noise (kode di bawah), tetapi kurva yang dihasilkan terlihat terlalu kasar dibandingkan dengan yang asli …

2
Bagaimana cara mengatasi efek plafon akibat alat ukur?
Saya telah mengumpulkan data psikofisiologis yang mengukur kemampuan subyek (dua kelompok) untuk merasakan getaran. Probe bergetar bergerak melawan kulit pada perpindahan yang lebih kecil dan lebih kecil, dan subjek mengindikasikan kapan mereka merasakan getaran. Sayangnya, pada frekuensi tinggi, probe hanya bisa bergerak jarak pendek, dan kadang-kadang jarak terbesar yang bisa …

2
Secara otomatis menentukan distribusi probabilitas yang diberikan satu set data
Diberikan dataset: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Saya ingin menentukan distribusi probabilitas yang paling pas (gamma, beta, normal, eksponensial, poisson, chi-square, dll) dengan estimasi parameter. Saya sudah mengetahui pertanyaan pada tautan berikut, di mana solusi disediakan menggunakan R: /programming/2661402/given-a-set-of-random-number-drawn-from-a- continuous-univariate-distribution-f solusi terbaik yang diusulkan adalah sebagai berikut: > library(MASS) > fitdistr(x, …

3
Tentukan apakah proses distribusi ekor berat telah meningkat secara signifikan
Saya mengamati waktu pemrosesan suatu proses sebelum dan sesudah perubahan untuk mengetahui, apakah proses tersebut telah membaik oleh perubahan tersebut. Proses telah meningkat, jika waktu pemrosesan berkurang. Distribusi waktu pemrosesan adalah berekor gemuk, jadi membandingkan berdasarkan rata-rata tidaklah masuk akal. Sebaliknya saya ingin tahu apakah probabilitas untuk mengamati waktu pemrosesan …

1
Bagaimana cara menghasilkan prediksi dengan rjags?
Saya telah menggunakan rjags untuk menjalankan MCMC pada model, yang ditentukan dalam bahasa JAGS. Apakah ada cara yang baik untuk mengekstrak model itu dan melakukan prediksi dengannya (menggunakan distribusi posterior parameter saya)? Saya dapat menentukan kembali model dalam R dan menyambungkan mode posteriors parameter saya; Saya hanya ingin tahu apakah …
12 r  jags 

1
Apakah ada hubungan antara Bayes empiris dan efek acak?
Saya baru-baru ini kebetulan membaca tentang Bayes empiris (Casella, 1985, Pengantar analisis data Bayes empiris) dan itu sangat mirip dengan model efek acak; karena keduanya memiliki estimasi yang menyusut menjadi rata-rata global. Tapi saya belum membacanya secara menyeluruh ... Adakah yang punya wawasan tentang persamaan dan perbedaan di antara mereka?

1
Perbedaan antara PROC Mixed dan lme / lmer dalam R - derajat kebebasan
Catatan: pertanyaan ini adalah repost, karena pertanyaan saya sebelumnya harus dihapus karena alasan hukum. Sambil membandingkan PROC CAMPURAN dari SAS dengan fungsi lmedari nlmepaket di R, saya menemukan beberapa perbedaan yang agak membingungkan. Lebih khusus lagi, derajat kebebasan dalam berbagai tes berbeda antara PROC MIXEDdan lme, dan saya bertanya-tanya mengapa. …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 

2
Bagaimana Anda menjelaskan perbedaan antara risiko relatif dan risiko absolut?
Suatu hari saya berkonsultasi dengan ahli epidemiologi. Dia adalah MD dengan gelar kesehatan masyarakat dalam epidemiologi dan memiliki banyak pengetahuan statistik. Dia membimbing rekan penelitian dan penghuninya dan membantu mereka dengan masalah statistik. Dia memahami pengujian hipotesis dengan cukup baik. Dia memiliki masalah khas membandingkan dua kelompok untuk melihat apakah …


1
Mengurai distribusi normal
Apakah ada distribusi hanya positif sehingga perbedaan dari dua sampel independen dari distribusi ini terdistribusi secara normal? Jika demikian, apakah itu memiliki bentuk yang sederhana?

1
Mengapa kuadrat
Ini mungkin pertanyaan dasar, tapi saya bertanya-tanya mengapa nilai dalam model regresi dapat dikuadratkan untuk memberikan gambaran varian yang dijelaskan?RRR Saya mengerti bahwa koefisien dapat memberikan kekuatan suatu hubungan, tetapi saya tidak mengerti bagaimana hanya mengkuadratkan nilai ini memberikan ukuran perbedaan yang dijelaskan.RRR Adakah penjelasan mudah tentang ini? Terima kasih …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.