Pertanyaan yang diberi tag «binning»

Binning berarti mengelompokkan variabel kontinu ke dalam kategori diskrit. Ini terutama digunakan untuk mengacu pada histogram, tetapi juga dapat digunakan secara lebih umum dalam arti kasar.


7
Apa manfaat memecah variabel prediktor kontinu?
Saya bertanya-tanya apa nilainya dalam mengambil variabel prediktor kontinu dan memecahnya (misalnya, menjadi kuintil), sebelum menggunakannya dalam model. Sepertinya saya bahwa dengan binning variabel kita kehilangan informasi. Apakah ini hanya agar kita dapat memodelkan efek non-linear? Jika kita menyimpan variabel kontinu dan itu bukan hubungan linear yang lurus, apakah kita …

3
Manfaat menggunakan plot QQ dibandingkan histogram
Dalam komentar ini , Nick Cox menulis: Masuk ke kelas adalah metode kuno. Sementara histogram dapat berguna, perangkat lunak statistik modern membuatnya mudah dan disarankan untuk menyesuaikan distribusi dengan data mentah. Binning hanya membuang detail yang sangat penting dalam menentukan distribusi mana yang masuk akal. Konteks komentar ini menyarankan menggunakan …

2
Kapan kita harus discretize / bin variabel independen terus menerus / fitur dan kapan tidak?
Kapan kita harus discretize / bin variabel independen / fitur dan kapan tidak? Upaya saya untuk menjawab pertanyaan: Secara umum, kita tidak boleh bin, karena binning akan kehilangan informasi. Binning sebenarnya meningkatkan derajat kebebasan model, jadi, dimungkinkan untuk menyebabkan over-fitting setelah binning. Jika kita memiliki model "bias tinggi", binning mungkin …

2
Dampak batas bin berbasis data pada uji kelayakan chi-square?
Mengesampingkan masalah yang jelas dari rendahnya daya chi-square dalam keadaan seperti ini, bayangkan melakukan uji kebaikan chi-square untuk beberapa kepadatan dengan parameter yang tidak ditentukan, dengan mengelompokkan data. Untuk konkret, katakanlah distribusi eksponensial dengan rata-rata tidak diketahui dan ukuran sampel katakanlah 100. Untuk mendapatkan jumlah yang wajar dari pengamatan yang …


2
Binning Optimal sehubungan dengan variabel respons yang diberikan
Saya sedang mencari metode binning optimal (diskritisasi) dari variabel kontinu sehubungan dengan respon yang diberikan (target) variabel biner dan dengan jumlah interval maksimum sebagai parameter. contoh: Saya memiliki satu set pengamatan orang dengan variabel "tinggi" (angka kontinu) dan "has_back_pains" (biner). Saya ingin melakukan diskritisasi tinggi menjadi 3 interval (kelompok) paling …

5
Interpretasi Bayes Theorem diterapkan untuk hasil mamografi positif
Saya mencoba untuk membungkus kepala saya di sekitar hasil Bayes Theorem yang diterapkan pada contoh mammogram klasik, dengan twist mammogram menjadi sempurna. Itu adalah, Timbulnya kanker:.01.01.01 Kemungkinan mammogram positif, mengingat pasien menderita kanker:111 Probabilitas mammogram positif, mengingat pasien tidak memiliki kanker:.01.01.01 By Bayes: P (kanker | mammogram +) =1 ⋅ …




1
Nilai variabel tersembunyi regresi linear R "bernilai"
Ini hanya contoh yang saya temui beberapa kali, jadi saya tidak punya data sampel. Menjalankan model regresi linier di R: a.lm = lm(Y ~ x1 + x2) x1adalah variabel kontinu. x2bersifat kategorikal dan memiliki tiga nilai, mis. "Rendah", "Sedang" dan "Tinggi". Namun output yang diberikan oleh R akan menjadi seperti: …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

2
Formula Doane untuk binning histogram
Saya menerapkan berbagai algoritme untuk memperkirakan jumlah sampah terbaik yang digunakan untuk histogram. Sebagian besar yang saya laksanakan dijelaskan pada halaman "Histogram" Wikipedia di bagian " Jumlah sampah dan lebar " *. Saya terjebak pada masalah dengan rumus Doane: 1 + log(n) + log(1 + kurtosis(data) * sqrt(n / 6.)) …


2
Apa pembenaran untuk diskritisasi variabel kontinu tanpa pengawasan?
Sejumlah sumber menunjukkan bahwa ada banyak konsekuensi negatif dari diskritisasi (kategorisasi) variabel kontinu sebelum analisis statistik (sampel referensi [1] - [4] di bawah). Sebaliknya [5] menunjukkan bahwa beberapa teknik pembelajaran mesin diketahui menghasilkan hasil yang lebih baik ketika variabel kontinyu didiskritisasi (juga mencatat bahwa metode diskritisasi yang diawasi berperforma lebih …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.