Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Model hierarkis untuk perbandingan multipel - konteks hasil berganda
Saya baru saja (kembali) membaca Gelman's Why kita (biasanya) tidak perlu khawatir tentang beberapa perbandingan . Khususnya bagian "Berbagai hasil dan tantangan lain" menyebutkan menggunakan model hierarkis untuk situasi ketika ada beberapa tindakan terkait dari orang / unit yang sama pada waktu / kondisi yang berbeda. Tampaknya memiliki sejumlah properti …

2
Bisakah saya menggunakan bootstrap, mengapa atau mengapa tidak?
Saat ini saya sedang mengerjakan estimasi biomassa menggunakan citra satelit. Saya akan dengan cepat menentukan latar belakang pertanyaan saya, dan kemudian menjelaskan pertanyaan statistik yang saya kerjakan. Latar Belakang Masalah Saya mencoba memperkirakan biomassa di suatu daerah di Perancis. Tanggapan saya adalah kepadatan volume kayu bakar (dalam ), yang lebih …
10 bootstrap 


2
Mengapa distribusi penting?
Ini mungkin juga turun sebagai pertanyaan paling konyol yang pernah diajukan di forum ini, tetapi setelah menerima jawaban yang masuk akal dan bermakna untuk pertanyaan sebelumnya, saya pikir saya akan merentangkan keberuntungan saya lagi. Saya telah sangat bingung selama beberapa waktu tentang pentingnya distribusi statistik terutama karena berkaitan dengan pengembalian …

1
Saran tes statistik
Saya perlu menemukan tes statistik yang sesuai (uji rasio kemungkinan, uji-t, dll.) Pada hal-hal berikut: Biarkan menjadi sampel pertama dari vektor acak dan asumsikan ~ . Hipotesisnya adalah: ; { Xsaya; Ysaya}ni = 1{Xi;Yi}i=1n\{X_i;Y_i\}^n_{i=1}( Y X ) N [ ( μ 1 μ 2 ) , ( 1 .5 .5 …


1
Bagaimana cara menghadapi kematian dalam analisis kelangsungan hidup bebas penyakit?
Jika saya memiliki data kelangsungan hidup bebas penyakit (didefinisikan sebagai apakah atau tidak penyakit tertentu telah didiagnosis atau tidak bersamaan dengan waktu kejadian atau kehilangan untuk ditindaklanjuti) dan juga data kelangsungan hidup secara keseluruhan, bagaimana cara saya menangani kematian yang terjadi tanpa acara penyakit? Apakah ini disensor atau haruskah saya …

2
Apakah mungkin untuk memiliki variabel yang bertindak sebagai pengubah efek dan perancu?
Apakah mungkin untuk memiliki variabel yang bertindak sebagai pengubah efek (pengukuran) dan perancu untuk pasangan asosiasi risiko-hasil tertentu? Saya masih sedikit tidak yakin dengan perbedaan itu. Saya telah melihat notasi grafis untuk membantu saya memahami perbedaannya tetapi perbedaan dalam notasi membingungkan. Penjelasan grafis / visual dari keduanya dan kapan mereka …


1
Mengapa Anova () dan drop1 () memberikan jawaban berbeda untuk GLMM?
Saya memiliki GLMM formulir: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Ketika saya menggunakan drop1(model, test="Chi"), saya mendapatkan hasil yang berbeda daripada jika saya menggunakan Anova(model, type="III")dari paket mobil atau summary(model). Dua yang terakhir ini memberikan jawaban yang sama. Menggunakan banyak data yang …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

2
Mengevaluasi kelompok rantai Markov orde pertama
Saya mengelompokkan dataset saya dari beberapa ribu rantai Markov orde pertama menjadi sekitar 10 cluster. Apakah ada beberapa cara yang direkomendasikan bagaimana saya dapat mengevaluasi kluster ini dan mencari tahu item apa yang ada di kluster dan bagaimana mereka berbeda dari kluster lain? Jadi saya dapat membuat pernyataan seperti "Proses …

2
Bagaimana cara menghasilkan angka sesuai dengan distribusi Soliton?
The distribusi Soliton adalah distribusi probabilitas diskrit melalui serangkaian dengan fungsi massa probabilitas{1,…,N}{1,…,N}\{1,\dots, N\} p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Saya ingin menggunakannya sebagai bagian dari implementasi kode LT , idealnya dalam Python di mana generator nomor acak seragam tersedia.

3
Dari mana datangnya istilah “belajar model”
Seringkali saya pernah mendengar data penambang di sini menggunakan istilah ini. Sebagai ahli statistik yang telah mengerjakan masalah klasifikasi, saya akrab dengan istilah "latihlah pengklasifikasi" dan saya menganggap "mempelajari model" berarti hal yang sama. Saya tidak keberatan dengan istilah "train a classifier". Itu tampaknya menggambarkan ide pemasangan model karena data …

1
Bayes faktor dengan prior yang tidak tepat
Saya punya pertanyaan tentang perbandingan model menggunakan faktor Bayes. Dalam banyak kasus, ahli statistik tertarik untuk menggunakan pendekatan Bayesian dengan prior yang tidak tepat (misalnya beberapa prior Jeffreys dan prior reference). Pertanyaan saya adalah, dalam kasus-kasus di mana distribusi posterior parameter model didefinisikan dengan baik, apakah valid untuk membandingkan model …

1
Mengoreksi untuk keputusan jam didistribusikan secara normal
Saya memiliki percobaan yang dijalankan pada ratusan komputer yang didistribusikan di seluruh dunia yang mengukur kejadian peristiwa tertentu. Peristiwa masing-masing bergantung satu sama lain sehingga saya dapat memesannya dalam urutan yang meningkat dan kemudian menghitung perbedaan waktu. Peristiwa harus didistribusikan secara eksponensial tetapi ketika merencanakan histogram inilah yang saya dapatkan: …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.