Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Mengapa model statistik cocok jika diberi set data yang sangat besar?
Proyek saya saat ini mungkin mengharuskan saya untuk membuat model untuk memprediksi perilaku sekelompok orang tertentu. set data pelatihan hanya berisi 6 variabel (id hanya untuk tujuan identifikasi): id, age, income, gender, job category, monthly spend di mana monthly spendadalah variabel respon. Tetapi dataset pelatihan berisi sekitar 3 juta baris, …
8 modeling  large-data  overfitting  clustering  algorithms  error  spatial  r  regression  predictive-models  linear-model  average  measurement-error  weighted-mean  error-propagation  python  standard-error  weighted-regression  hypothesis-testing  time-series  machine-learning  self-study  arima  regression  correlation  anova  statistical-significance  excel  r  regression  distributions  statistical-significance  contingency-tables  regression  optimization  measurement-error  loss-functions  image-processing  java  panel-data  probability  conditional-probability  r  lme4-nlme  model-comparison  time-series  probability  probability  conditional-probability  logistic  multiple-regression  model-selection  r  regression  model-based-clustering  svm  feature-selection  feature-construction  time-series  forecasting  stationarity  r  distributions  bootstrap  r  distributions  estimation  maximum-likelihood  garch  references  probability  conditional-probability  regression  logistic  regression-coefficients  model-comparison  confidence-interval  r  regression  r  generalized-linear-model  outliers  robust  regression  classification  categorical-data  r  association-rules  machine-learning  distributions  posterior  likelihood  r  hypothesis-testing  normality-assumption  missing-data  convergence  expectation-maximization  regression  self-study  categorical-data  regression  simulation  regression  self-study  self-study  gamma-distribution  modeling  microarray  synthetic-data 





1
Non-konjugat sebelumnya
Dapatkah seseorang menjelaskan mengapa integral dalam kerapatan posterior mungkin tidak "dapat ditelusuri secara analitik" jika sebelumnya yang kita pilih adalah non-konjugat?
8 bayesian 

2
Geometri Aljabar untuk Statistik
Saya telah mendengar tentang penggunaan Geometri Aljabar dalam Statistik dan Pembelajaran Mesin. Saya ingin mencoba belajar sedikit tentang topik ini. Saya hampir tidak tahu apa-apa tentang Aljabar Geometri, tetapi saya memiliki latar belakang dalam matematika, dan saya tahu tentang teori kelompok dasar, bidang cincin dan beberapa aljabar komutatif. Pertanyaan saya …

1
Validasi kuesioner dalam populasi baru
Saya memiliki 400 tanggapan terhadap 20 item kuesioner yang dimaksudkan untuk mengukur konstitusi sikap pada mahasiswa kedokteran. Instrumen ini divalidasi di AS selama satu tahun mahasiswa kedokteran dan data yang dipublikasikan sangat "bersih" - semua nilai ritc> 0,3, alpha 0,84, PCA dengan struktur empat faktor yang stabil dll. Dalam sampel …

1
Regresi monotonik yang kuat dalam R
Saya memiliki tabel berikut ini di R df <- structure(list(x = structure(c(12458, 12633, 12692, 12830, 13369, 13455, 13458, 13515), class = "Date"), y = c(6080, 6949, 7076, 7818, 0, 0, 10765, 11153)), .Names = c("x", "y"), row.names = c("1", "2", "3", "4", "5", "6", "8", "9"), class = "data.frame") > …

3
Untuk variabel acak kontinu, mengapa
Buku teks saya menempatkan ini di sidebox dengan tajuk "Note" dan tidak menjelaskan alasannya. Bisakah Anda memberi tahu saya mengapa pernyataan ini berlaku? P(a&lt;Z&lt;b)=P(a≤Z&lt;b)=P(a&lt;Z≤b)=P(a≤Z≤b)P(a&lt;Z&lt;b)=P(a≤Z&lt;b)=P(a&lt;Z≤b)=P(a≤Z≤b)P(a < Z < b) = P(a \leq Z < b) = P(a < Z \leq b) = P(a \leq Z \leq b)

2
Gridsearch untuk estimasi parameter SVM
Saat ini saya sedang bereksperimen dengan gridsearch untuk melatih mesin vektor dukungan. Saya mengerti bahwa, jika saya memiliki parameter gamma dan C, fungsi R tune.svm melakukan validasi silang 10 kali lipat untuk semua kombinasi dari 2 parameter ini. Karena saya tidak tahu bagaimana memulainya, saya mencoba untuk mendapatkan beberapa informasi …
8 svm 


1
Star Coordinates vs. analisis komponen utama
Saat ini saya sedang mempersiapkan presentasi untuk kursus universitas di "Analisis Data Visual". Dan salah satu topik saya adalah visualisasi "Koordinat Bintang". Koordinat Bintang Ketika Star Coordinates melakukan transformasi data dimensi tinggi, dan teknik PCA yang terkenal juga melakukannya, saya bertanya-tanya apakah PCA dapat ditiru oleh Star Coordinates? Saya pikir …

3
Jalan acak: raja di papan catur
Saya punya pertanyaan tentang jalan acak dua raja di papan catur 3 × 3. Setiap raja bergerak secara acak dengan probabilitas yang sama di papan catur ini - secara vertikal, horizontal dan diagonal. Kedua raja bergerak secara independen dari satu sama lain dalam papan catur yang sama. Keduanya mulai di …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.