Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Mengapa ada rekomendasi yang menentang penggunaan Jeffreys atau prior berdasarkan entropi untuk MCMC sampler?
Di halaman wiki mereka , pengembang status Stan: Beberapa prinsip yang tidak kita sukai: invarian, Jeffreys, entropi Sebagai gantinya, saya melihat banyak rekomendasi distribusi normal. Sejauh ini saya menggunakan metode Bayesian yang tidak bergantung pada pengambilan sampel, dan agak senang telah memahami mengapa adalah pilihan yang baik untuk kemungkinan binomial.θ …
11 bayesian  mcmc  prior  pymc  stan 

3
Strategi Augmentasi Data untuk Peramalan Time Series
Saya sedang mempertimbangkan dua strategi untuk melakukan "augmentasi data" pada peramalan seri waktu. Pertama, sedikit latar belakang. Prediktor untuk meramalkan langkah selanjutnya dari rangkaian waktu adalah fungsi yang biasanya bergantung pada dua hal, seri waktu yang menyatakan masa lalu, tetapi juga keadaan masa lampau sang prediktor:PPP{Ai}{Ai}\lbrace A_i\rbrace P({Ai≤t−1},PSt−1)P({Ai≤t−1},PSt−1)P(\lbrace A_{i\leq t-1}\rbrace,P_{S_{t-1}}) …

1
Mengapa salah menafsirkan SVM sebagai probabilitas klasifikasi?
Pemahaman saya tentang SVM adalah bahwa hal itu sangat mirip dengan regresi logistik (LR), yaitu sejumlah fitur tertimbang dilewatkan ke fungsi sigmoid untuk mendapatkan kemungkinan memiliki kelas, tetapi alih-alih kehilangan cross-entropy (logistik) fungsi, pelatihan dilakukan menggunakan engsel yang hilang. Manfaat menggunakan kehilangan engsel adalah bahwa seseorang dapat melakukan berbagai trik …

3
Menghentikan kriteria untuk Nelder Mead
Saya mencoba menerapkan algoritma Nelder-Mead untuk mengoptimalkan fungsi. The wikipedia Halaman tentang Nelder-Mead adalah mengejutkan jelas tentang seluruh algoritma, kecuali untuk kriteria penghentian. Di sana dikatakan dengan sedih: Periksa konvergensi [klarifikasi diperlukan] . Saya mencoba dan menguji beberapa kriteria sendiri: Berhenti jika mana kecil dan di mana adalah th titik …

2
Mengapa pohon kantong / pohon hutan acak memiliki bias yang lebih tinggi daripada pohon keputusan tunggal?
Jika kita mempertimbangkan pohon keputusan yang tumbuh penuh (yaitu pohon keputusan yang tidak ditandai), ia memiliki varian yang tinggi dan bias yang rendah. Hutan Bagging dan Random menggunakan model varians tinggi ini dan menggabungkannya untuk mengurangi varians dan dengan demikian meningkatkan akurasi prediksi. Baik Hutan Bagging dan Acak menggunakan sampling …

1
Panah variabel yang mendasarinya dalam PCA biplot di R
Dengan risiko membuat pertanyaan khusus perangkat lunak, dan dengan alasan di mana-mana dan keistimewaannya, saya ingin bertanya tentang fungsi biplot()dalam R, dan, lebih khusus, tentang perhitungan dan perencanaan default, panah merah yang dilapiskan, sesuai ke variabel yang mendasarinya. [Untuk memahami beberapa komentar, plot yang semula diposkan memiliki masalah kelangkaan minat …
11 r  pca  biplot 

5
Kapan harus menggunakan model efek campuran?
Model Efek Campuran Linier adalah Perpanjangan model Regresi Linier untuk data yang dikumpulkan dan dirangkum dalam kelompok. Keuntungan utama adalah koefisien dapat bervariasi sehubungan dengan satu atau lebih variabel grup. Namun, saya kesulitan dengan kapan harus menggunakan model efek campuran? Saya akan menguraikan pertanyaan saya dengan menggunakan contoh mainan dengan …


3
Bagaimana didefinisikan ketika
Katakanlah YYY adalah variabel acak kontinu, dan XXX adalah variabel diskrit. Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} Seperti yang kita ketahui, Pr(Y=y)=0Pr(Y=y)=0\Pr(Y=y) = 0 karena YYY adalah variabel acak kontinu. Dan berdasarkan ini, saya tergoda untuk menyimpulkan bahwa probabilitas Pr(X=x|Y=y)Pr(X=x|Y=y)\Pr(X=x|Y=y) tidak terdefinisi. Namun, Wikipedia mengklaim di sini bahwa sebenarnya didefinisikan sebagai berikut: …


1
XGBoost dapat menangani data yang hilang pada fase perkiraan
Baru-baru ini saya telah meninjau algoritma XGBoost dan saya perhatikan bahwa algoritma ini dapat menangani data yang hilang (tanpa memerlukan imputasi) dalam fase pelatihan. Saya bertanya-tanya apakah XGboost dapat menangani data yang hilang (tanpa memerlukan imputasi) ketika digunakan untuk meramalkan pengamatan baru atau perlu untuk menyalahkan data yang hilang. Terima …

1
Mengapa non-negatif penting untuk sistem penyaringan / rekomendasi kolaboratif?
Dalam semua sistem rekomendasi modern yang telah saya lihat yang mengandalkan faktorisasi matriks, faktorisasi matriks non-negatif dilakukan pada matriks pengguna-film. Saya bisa mengerti mengapa non-negatif itu penting untuk interpretabilitas dan / atau jika Anda ingin faktor jarang. Tetapi jika Anda hanya peduli dengan kinerja prediksi, seperti dalam kompetisi hadiah Netflix …

1
R / mgcv: Mengapa produk tensor () dan ti () menghasilkan permukaan yang berbeda?
The mgcvpaket untuk Rmemiliki dua fungsi untuk pas interaksi produk tensor: te()dan ti(). Saya memahami pembagian kerja dasar antara keduanya (menyesuaikan interaksi non-linear vs menguraikan interaksi ini menjadi efek utama dan interaksi). Yang tidak saya mengerti adalah mengapa te(x1, x2)dan ti(x1) + ti(x2) + ti(x1, x2)mungkin menghasilkan (sedikit) hasil yang …
11 r  gam  mgcv  conditional-probability  mixed-model  references  bayesian  estimation  conditional-probability  machine-learning  optimization  gradient-descent  r  hypothesis-testing  wilcoxon-mann-whitney  time-series  bayesian  inference  change-point  time-series  anova  repeated-measures  statistical-significance  bayesian  contingency-tables  regression  prediction  quantiles  classification  auc  k-means  scikit-learn  regression  spatial  circular-statistics  t-test  effect-size  cohens-d  r  cross-validation  feature-selection  caret  machine-learning  modeling  python  optimization  frequentist  correlation  sample-size  normalization  group-differences  heteroscedasticity  independence  generalized-least-squares  lme4-nlme  references  mcmc  metropolis-hastings  optimization  r  logistic  feature-selection  separation  clustering  k-means  normal-distribution  gaussian-mixture  kullback-leibler  java  spark-mllib  data-visualization  categorical-data  barplot  hypothesis-testing  statistical-significance  chi-squared  type-i-and-ii-errors  pca  scikit-learn  conditional-expectation  statistical-significance  meta-analysis  intuition  r  time-series  multivariate-analysis  garch  machine-learning  classification  data-mining  missing-data  cart  regression  cross-validation  matrix-decomposition  categorical-data  repeated-measures  chi-squared  assumptions  contingency-tables  prediction  binary-data  trend  test-for-trend  matrix-inverse  anova  categorical-data  regression-coefficients  standard-error  r  distributions  exponential  interarrival-time  copula  log-likelihood  time-series  forecasting  prediction-interval  mean  standard-error  meta-analysis  meta-regression  network-meta-analysis  systematic-review  normal-distribution  multiple-regression  generalized-linear-model  poisson-distribution  poisson-regression  r  sas  cohens-kappa 


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.