Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Interval kepercayaan sekitar rasio dua proporsi
Saya memiliki dua proporsi (mis., Rasio klik-tayang (RKT) pada tautan dalam tata letak kontrol, dan RKT pada tautan dalam tata letak eksperimental), dan saya ingin menghitung interval kepercayaan 95% di sekitar rasio proporsi ini. Bagaimana saya melakukan ini? Saya tahu saya bisa menggunakan metode delta untuk menghitung varian dari rasio …

2
Apakah AdaBoost kurang atau lebih rentan terhadap overfitting?
Saya telah membaca berbagai (tampaknya) pernyataan yang bertentangan apakah AdaBoost (atau teknik meningkatkan lainnya) kurang atau lebih cenderung overfitting dibandingkan dengan metode pembelajaran lainnya. Apakah ada alasan bagus untuk memercayai yang satu atau yang lain? Jika itu tergantung, apa itu tergantung? Apa alasan bahwa AdaBoost kurang / lebih rentan terhadap …

2
Apa pembenaran keputusan-teoretis untuk prosedur interval Bayesian yang kredibel?
(Untuk mengetahui mengapa saya menulis ini, periksa komentar di bawah jawaban saya untuk pertanyaan ini .) Tipe III kesalahan dan teori keputusan statistik Memberikan jawaban yang benar untuk pertanyaan yang salah kadang-kadang disebut kesalahan Tipe III. Teori keputusan statistik adalah formalisasi pengambilan keputusan di bawah ketidakpastian; ini menyediakan kerangka kerja …


3
Menggabungkan model pembelajaran mesin
Saya agak baru dalam pendataan / pembelajaran mesin / dll. dan telah membaca tentang beberapa cara untuk menggabungkan beberapa model dan menjalankan model yang sama untuk meningkatkan prediksi. Kesan saya dari membaca beberapa makalah (yang sering menarik dan hebat dalam teori dan huruf Yunani tetapi kekurangan kode dan contoh aktual) …

2
Metode pengambilan sampel caret
Saya menggunakan perpustakaan caretdi R untuk menguji berbagai prosedur pemodelan. The trainControlobjek memungkinkan seseorang untuk menentukan metode re-sampel. Metode dijelaskan dalam dokumentasi bagian 2.3 dan meliputi: boot, boot632, cv, LOOCV, LGOCV, repeatedcvdan oob. Meskipun beberapa di antaranya mudah disimpulkan, tidak semua metode ini didefinisikan dengan jelas. Apa prosedur yang sesuai …
20 r  resampling  caret 

5
Apa itu blok dalam desain eksperimental?
Saya punya dua pertanyaan tentang gagasan blok dalam desain eksperimental: (1) Apa perbedaan antara blok dan faktor? (2) Saya mencoba membaca beberapa buku tetapi ada sesuatu yang tidak jelas: sepertinya penulis selalu berasumsi bahwa tidak ada interaksi antara "faktor blok" dan faktor lainnya. Apakah benar, dan jika ya, mengapa?

6
Kapan harus menjatuhkan istilah dari model regresi?
Adakah yang bisa menyarankan jika hal berikut ini masuk akal: Saya berurusan dengan model linier biasa dengan 4 prediktor. Saya dalam dua pikiran apakah akan menjatuhkan istilah yang paling tidak signifikan. Nilai- sedikit di atas 0,05. Saya berpendapat mendukung menjatuhkannya di bawah ini: Mengalikan estimasi istilah ini dengan (misalnya) rentang …

8
Gagasan untuk perangkat lunak "lab notebook"?
Jadi ini cocok aneh, meskipun sebenarnya saya pikir ini cocok aneh untuk situs mana pun, jadi saya pikir saya akan mencobanya di sini, di antara saudara-saudara saya yang data-crunching-nya. Saya datang ke epidemiologi dan biostatistik dari biologi, dan masih memiliki kebiasaan dari bidang itu. Salah satunya adalah menyimpan buku catatan …


2
Perbandingan model campuran efek yang diperbolehkan (terutama efek acak)
Saya telah melihat pemodelan efek campuran menggunakan paket lme4 di R. Saya terutama menggunakan lmerperintah jadi saya akan mengajukan pertanyaan saya melalui kode yang menggunakan sintaks itu. Saya kira pertanyaan umum yang mudah mungkin, apakah boleh untuk membandingkan dua model yang dibangun dalam lmermenggunakan rasio kemungkinan berdasarkan pada dataset identik? …



2
Apa perbedaan antara regresi binomial dan regresi logistik?
Saya selalu menganggap regresi logistik hanya sebagai kasus khusus regresi binomial di mana fungsi tautan adalah fungsi logistik (alih-alih, katakanlah, fungsi probit). Dari membaca jawaban atas pertanyaan lain yang saya miliki, sepertinya saya mungkin bingung, dan ada perbedaan antara regresi logistik dan regresi binomial dengan tautan logistik. Apa bedanya?

3
Menguji signifikansi puncak dalam kepadatan spektral
Kami terkadang menggunakan plot kerapatan spektral untuk menganalisis periodisitas dalam deret waktu. Biasanya kami menganalisis plot dengan inspeksi visual dan kemudian mencoba menarik kesimpulan tentang periodisitas. Tetapi apakah ahli statistik telah mengembangkan tes untuk memeriksa apakah ada lonjakan dalam plot secara statistik berbeda dari white noise? Sudahkah para ahli R …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.