Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Mengapa dalam kotak latin baris, perawatan dan kolom dikatakan orthogonal
Saya selalu mendengar "orthogonal" di bidang geometri (juga harap dicatat saya bukan penutur asli bahasa Inggris). Saya tidak mengerti yang berikut ini untuk kotak latin (kutipan dari buku teks): Setiap perawatan (ABCD) muncul sekali di setiap baris. Karenanya perawatan dan barisnya orthogonal. ... Baris dan kolom ortogonal untuk perawatan. 12341ABCD2BCDA3CDAB4DABC12341ABCD2BCDA3CDAB4DABC\begin{matrix}\,&1&2&3&4\\1&A&B&C&D\\2&B&C&D&A\\3&C&D&A&B\\4&D&A&B&C\end{matrix} …

4
Mengapa fakta bahwa 1 median lebih rendah dari median lain, berarti bahwa sebagian besar di grup 1 kurang dari kebanyakan di grup 2?
Saya percaya bahwa plot kotak di bawah ini dapat diartikan sebagai "kebanyakan pria lebih cepat daripada kebanyakan wanita" (dalam dataset ini), terutama karena waktu rata-rata pria lebih rendah daripada waktu rata-rata wanita. Tapi tentu saja EDX pada R dan statistik kuis mengatakan kepada saya bahwa tidak benar. Tolong bantu saya …

1
Prinsip P-nilai dan kemungkinan
Pertanyaan ini muncul di kelas: Jika kita menggunakan nilai-p untuk mengevaluasi hipotesis pada percobaan, bagian mana dari Prinsip Kemungkinan yang tidak kita patuhi: Kecukupan atau Persyaratan ? Intuisi saya akan mengatakan Kecukupan , karena menghitung nilai-p bergantung pada hasil percobaan yang tidak teramati, dan Kecukupan tampaknya lebih banyak berurusan dengan …



2
Membalikkan masalah ulang tahun dengan banyak tabrakan
Asumsikan Anda memiliki tahun alien dengan panjang yang tidak diketahui N. Jika Anda memiliki sampel acak alien tersebut dan beberapa dari mereka berbagi ulang tahun, dapatkah Anda menggunakan data ini untuk memperkirakan panjang tahun? Misalnya, dalam sampel 100, Anda dapat memiliki dua kembar tiga (mis. Dua ulang tahun masing-masing dibagi …

3
Pemilihan model Bayesian dan interval yang kredibel
Saya memiliki dataset dengan tiga variabel, di mana semua variabel kuantitatif. Sebut saja yyy , x1x1x_1 dan x2x2x_2 . Saya menyesuaikan model regresi dalam perspektif Bayesian via MCMC denganrjags Saya melakukan analisis eksplorasi dan sebar y×x2y×x2y\times x_2 menunjukkan bahwa istilah kuadrat harus digunakan. Lalu saya memasang dua model (1) y=β0+β1∗x1+β2∗x2y=β0+β1∗x1+β2∗x2y=\beta_0+\beta_1*x_1+\beta_2*x_2 …

2
Berapa distribusi probabilitas jumlah acak variabel Bernoulli non-iid ini?
Saya mencoba untuk menemukan distribusi probabilitas dari jumlah variabel acak yang tidak terdistribusi secara identik. Ini sebuah contoh: John bekerja di pusat panggilan layanan pelanggan. Dia menerima panggilan dengan masalah dan mencoba menyelesaikannya. Yang tidak bisa dia pecahkan, dia meneruskannya ke atasannya. Mari kita asumsikan bahwa jumlah panggilan yang didapatnya …

1
Kapan menggunakan regresi Deming
Saat ini saya sedang berupaya untuk mengubah dua nilai tes fosfor yang berbeda menjadi satu sama lain. Latar Belakang Ada banyak (ekstraksi) metode untuk mengukur fosfor tersedia tanaman di tanah. Negara yang berbeda menerapkan metode yang berbeda, maka untuk membandingkan kesuburan P di seluruh negara, perlu untuk menghitung nilai uji-P …

1
Model pembelajaran dalam mana yang dapat mengklasifikasikan kategori yang tidak eksklusif satu sama lain
Contoh: Saya memiliki kalimat dalam deskripsi pekerjaan: "Java senior engineer in UK". Saya ingin menggunakan model pembelajaran yang mendalam untuk memperkirakannya sebagai 2 kategori: English dan IT jobs. Jika saya menggunakan model klasifikasi tradisional, hanya dapat memprediksi 1 label dengan softmaxfungsi di lapisan terakhir. Dengan demikian, saya dapat menggunakan 2 …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 



6
Menggunakan p-value untuk menghitung probabilitas hipotesis benar; apa lagi yang dibutuhkan?
Pertanyaan: Satu kesalahpahaman umum dari nilai-p adalah bahwa mereka mewakili probabilitas hipotesis nol menjadi benar. Saya tahu itu tidak benar dan saya tahu bahwa nilai-p hanya mewakili probabilitas menemukan sampel yang ekstrim seperti ini, mengingat bahwa hipotesis nol itu benar. Namun, secara intuitif, seseorang harus dapat memperoleh yang pertama dari …

1
Apakah Naive Bayes menjadi lebih populer? Mengapa?
Ini adalah hasil tren google yang diperoleh untuk frasa "Naive Bayes" dari Jan 2004-April 2017 ( tautan ). Menurut angka ini, rasio pencarian untuk "Naive Bayes" pada bulan April 2017 adalah sekitar% 25 lebih tinggi dari maksimum dalam periode waktu keseluruhan. Apakah ini menyiratkan bahwa metode lama dan sederhana ini …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.