Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


5
Bagaimana cara melakukan imputasi nilai dalam jumlah poin data yang sangat besar?
Saya memiliki dataset yang sangat besar dan sekitar 5% nilai acak hilang. Variabel-variabel ini berkorelasi satu sama lain. Contoh berikut dataset R hanyalah contoh mainan dengan data berkorelasi dummy. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", 1:10000, …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 

1
Model Lmer gagal untuk bertemu
Data saya dijelaskan di sini Apa yang dapat menyebabkan "Error () model singular error" di aov saat memasang ANOVA tindakan berulang? Saya mencoba untuk melihat efek dari interaksi menggunakan lmersehingga kasus dasar saya adalah: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), …
12 r  lme4-nlme 



2
Mengapa distribusi seragam ini?
Kami sedang menyelidiki uji statistik Bayesian, dan menemukan fenomena aneh (bagi saya setidaknya). Pertimbangkan kasus berikut: kami tertarik untuk mengukur populasi mana, A atau B, yang memiliki tingkat konversi yang lebih tinggi. Untuk pemeriksaan kewarasan, kami menetapkan , yaitu probabilitas konversi sama di kedua grup. Kami menghasilkan data buatan menggunakan …

1
Melaporkan hasil model efek campuran linier
Model efek campuran linier tidak umum digunakan di sudut biologi saya, dan saya perlu melaporkan uji statistik yang saya gunakan dalam makalah yang saya coba tulis. Saya tahu bahwa kesadaran pemodelan multilevel mulai muncul di beberapa bidang biosains ( Solusi untuk ketergantungan: menggunakan analisis multilevel untuk mengakomodasi data bersarang ), …

2
Interpretasi matriks varians-kovarian
Asumsikan kita memiliki model linier Model1dan vcov(Model1)memberikan matriks berikut: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Untuk contoh ini, apa yang sebenarnya ditampilkan oleh matriks ini? Asumsi apa yang dapat kita buat dengan …

2
Penilaian Kuadrat Intelijen dan Penentuan Pemenang
Ada podcast NPR yang disebut Intelligence Squared. Setiap episode adalah penyiaran debat langsung pada beberapa pernyataan kontroversial seperti "Amandemen ke-2 tidak lagi relevan" atau "Tindakan afirmatif di kampus tidak lebih berbahaya daripada kebaikan". Empat perwakilan berdebat - dua untuk mosi dan dua menentang. Untuk menentukan pihak mana yang menang, audiens …
12 bayesian  rating 


3
Apakah lebih baik untuk memilih distribusi berdasarkan teori, kecocokan atau sesuatu yang lain?
Ini berbatasan dengan pertanyaan filosofis, tetapi saya tertarik pada bagaimana orang lain dengan pengalaman lebih banyak berpikir tentang pemilihan distribusi. Dalam beberapa kasus tampak jelas bahwa teori mungkin paling berhasil (panjang ekor tikus mungkin terdistribusi normal). Dalam banyak kasus, mungkin tidak ada teori untuk mendeskripsikan sekumpulan data, jadi Anda hanya …

2
Memeriksa residual untuk normalitas dalam model linier umum
Makalah ini menggunakan model linier umum (distribusi kesalahan binomial dan negatif binomial) untuk menganalisis data. Tetapi kemudian di bagian analisis statistik metode, ada pernyataan ini: ... dan yang kedua dengan memodelkan data keberadaan menggunakan Model Regresi Logistik, dan data waktu pencarian makan menggunakan Generalized Linear Model (GLM). Distribusi binomial negatif …

1
Bagaimana saya melatih HMM untuk klasifikasi?
Jadi saya mengerti bahwa ketika Anda melatih HMM untuk klasifikasi, pendekatan standarnya adalah: Pisahkan set data Anda ke dalam set data untuk setiap kelas Latih satu HMM per kelas Pada set tes, bandingkan kemungkinan masing-masing model untuk mengklasifikasikan setiap jendela Tapi bagaimana cara melatih HMM di setiap kelas? Apakah saya …

3
Kurangi varian dari boxplot
Saya bertanya-tanya bagaimana cara menyimpulkan varians dari variabel menggunakan boxplot. Apakah paling tidak mungkin untuk menyimpulkan jika dua variabel memiliki varians yang sama mengamati boxplot mereka?
12 variance  boxplot 

1
Jika distribusi statistik uji adalah bimodal, apakah nilai-p bermakna?
Nilai-P didefinisikan sebagai probabilitas untuk memperoleh uji-statistik paling tidak sama ekstrim dengan apa yang diamati, dengan asumsi hipotesis nol adalah benar. Dengan kata lain, Tetapi bagaimana jika uji-statistik bimodal dalam distribusi? Apakah nilai-p berarti dalam konteks ini? Sebagai contoh, saya akan mensimulasikan beberapa data bimodal di R:P(X≥t|H0)P(X≥t|H0)P( X \ge t …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.