Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



2
Apa "parameter komponen varians" dalam model efek campuran?
Pada halaman 12 buku Bates tentang model efek campuran , ia menggambarkan model itu sebagai berikut: Menjelang akhir tangkapan layar, ia menyebutkan faktor kovarians relatif , tergantung pada parameter komponen varians ,ΛθΛθ\Lambda_{\theta}θθ\theta tanpa menjelaskan apa sebenarnya hubungan itu. Katakanlah kita diberi , bagaimana kita memperoleh darinya?Λ θθθ\thetaΛθΛθ\Lambda_{\theta} Pada catatan terkait, …

1
Paket metafor: diagnostik bias dan sensitivitas
Saya sedang melakukan meta-analisis multi-level yang mencakup beberapa artikel dengan banyak hasil. Karena itu saya menggunakan rma.mv()fungsinya. Kode contoh: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) Saya punya dua pertanyaan: Saya membaca dalam kueri sebelumnya bahwa saat menggunakan rma.mv(), ranktest()bukan tes yang dapat diandalkan untuk asimetri plot corong. Namun, …

2
Skema pembobotan alternatif untuk meta analisis efek acak: tidak ada standar deviasi
Saya sedang mengerjakan meta-analisis efek acak yang mencakup sejumlah studi yang tidak melaporkan penyimpangan standar; semua penelitian melaporkan ukuran sampel. Saya tidak percaya mungkin untuk memperkirakan atau menyalahkan data SD yang hilang. Bagaimana seharusnya meta-analisis yang menggunakan perbedaan rata-rata mentah (tidak standar) sebagai ukuran efek ditimbang ketika standar deviasi tidak …


1
Mengapa skor komponen utama tidak berkorelasi?
Anggaplah adalah matriks data yang berpusat pada rata-rata. Matriks S = cov ( A ) adalah m × m , memiliki m nilai eigen yang berbeda, dan vektor eigen s 1 , s 2 ... s m , yang ortogonal.SEBUAHSEBUAH\mathbf AS =cov( A )S=cov(SEBUAH)\mathbf S=\text{cov}(\mathbf A)m × mm×mm\times mmmms1s1\mathbf s_1s2s2\mathbf …


1
Bagaimana cara menggunakan anova untuk perbandingan dua model?
Bagaimana saya harus memahami anovahasilnya ketika membandingkan dua model? Contoh: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** Manual tersebut menyatakan: "Hitung analisis varians (atau penyimpangan) tabel untuk satu atau lebih objek model pas." Namun, profesor luar menyebutkan bahwa …
9 r  regression  anova 

1
Merekonsiliasi boosted regression trees (BRT), generalized boosted model (GBM), dan gradient boosting machine (GBM)
Pertanyaan: Apa perbedaan antara pohon regresi yang dikuatkan (BRT) dan model yang dikembangkan secara umum (GBM)? Bisakah mereka digunakan secara bergantian? Apakah satu bentuk khusus dari yang lain? Mengapa Ridgeway menggunakan frasa "Generalized Boosted Regression Models" (GBM), untuk menggambarkan apa yang sebelumnya diusulkan Friedman sebagai "Gradient Boosting Machine" (GBM)? Kedua …

2
Pengujian ulang atau validasi silang ketika proses pembuatan model bersifat interaktif
Saya memiliki beberapa model prediktif yang kinerjanya ingin saya uji kembali (yaitu, ambil dataset saya, "putar kembali" ke titik waktu sebelumnya, dan lihat bagaimana model tersebut akan tampil secara prospektif). Masalahnya adalah bahwa beberapa model saya dibangun melalui proses interaktif. Misalnya, mengikuti saran dalam Strategi Pemodelan Regresi Frank Harrell , …

1
Mengingat dua rantai Markov menyerap, berapa probabilitas bahwa satu akan berakhir sebelum yang lain?
Saya memiliki dua rantai Markov yang berbeda, masing-masing dengan satu negara menyerap dan posisi awal yang diketahui. Saya ingin menentukan probabilitas bahwa rantai 1 akan mencapai kondisi menyerap dalam beberapa langkah lebih sedikit daripada rantai 2. Saya pikir saya bisa menghitung probabilitas mencapai keadaan menyerap dalam rantai tertentu setelah n …

2
Perkiraan kesalahan out-of-bag untuk meningkatkan?
Dalam Random Forest, masing-masing pohon ditanam secara paralel pada sampel pendamping data yang unik. Karena setiap sampel boostrap diharapkan mengandung sekitar 63% dari pengamatan unik, ini menyisakan sekitar 37% dari pengamatan, yang dapat digunakan untuk menguji pohon. Sekarang, tampaknya dalam Stochastic Gradient Boosting, ada juga perkiraan serupa dengan yang ada …


1
Bagaimana cara mencari dan mengevaluasi diskritisasi optimal untuk variabel kontinu dengan kriteria ?
Saya memiliki kumpulan data dengan variabel kontinu dan variabel target biner (0 dan 1). Saya perlu menentukan variabel kontinu (untuk regresi logistik) sehubungan dengan variabel target dan dengan batasan bahwa frekuensi pengamatan dalam setiap interval harus seimbang. Saya mencoba algoritma pembelajaran mesin seperti Chi Merge, pohon keputusan. Chi merge memberi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.