Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Bagaimana seharusnya kesalahan standar untuk estimasi model efek campuran dihitung?
Secara khusus, bagaimana kesalahan standar efek tetap dalam model efek campuran linier harus dihitung (dalam arti frequentist)? Saya telah memimpin untuk percaya bahwa perkiraan tipikal ( ), seperti yang disajikan dalam Laird dan Ware [1982] akan memberikan SE ukurannya diremehkan karena estimasi komponen varians diperlakukan seolah-olah mereka adalah nilai sebenarnya.Var(β^)=(X′VX)-1Var(β^)=(X′VX)-1{\rm …


5
Klasifikasi teks skala besar
Saya ingin melakukan klasifikasi pada data teks saya. Saya punya 300 classes, 200 dokumen pelatihan per kelas (jadi 60000 documents in total) dan ini cenderung menghasilkan data dimensi yang sangat tinggi (kita mungkin melihat lebih dari 1 juta dimensi ). Saya ingin melakukan langkah-langkah berikut dalam pipa (hanya untuk memberi …



4
Bagaimana kerangka bayesian lebih baik dalam interpretasi ketika kita biasanya menggunakan prior tidak informatif atau subjektif?
Sering diperdebatkan bahwa kerangka bayesian memiliki keuntungan besar dalam interpretasi (lebih sering), karena ia menghitung probabilitas parameter yang diberikan data - daripada seperti pada kerangka kerja frequentist. Sejauh ini baik.p(θ|x)p(θ|x)p(\theta|x)p(x|θ)p(x|θ)p(x|\theta) Tapi, seluruh persamaan itu didasarkan pada: p(θ|x)=p(x|θ).p(θ)p(x)p(θ|x)=p(x|θ).p(θ)p(x)p(\theta|x) = {p(x|\theta) . p(\theta) \over p(x)} menurut saya sedikit mencurigakan karena 2 alasan: …




3
Komputasi peringkat persentil dalam R [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Tutup 3 tahun yang lalu . Bagaimana saya bisa menambahkan variabel baru ke dalam kerangka data yang akan menjadi peringkat persentil dari salah satu variabel? Saya …
18 r  quantiles 

5
Paket R untuk pemodelan persamaan struktural bertingkat?
Saya ingin menguji model jalur multi-tahap (misalnya, A memprediksi B, B memprediksi C, C memprediksi D) di mana semua variabel saya adalah pengamatan individu yang bersarang dalam kelompok. Sejauh ini saya sudah melakukan ini melalui beberapa analisis multilevel unik di R. Saya lebih suka menggunakan teknik seperti SEM yang memungkinkan …

1
Bonferroni atau Tukey? Kapan jumlah perbandingan menjadi besar?
Membaca Statistik Statistik Fielding Menggunakan SPSS (Edisi ke-3) Saya sedikit terkejut dengan tes post-hoc di ANOVA. Bagi mereka yang ingin mengendalikan tingkat kesalahan Tipe I ia menyarankan Bonferroni atau Tukey dan mengatakan (hal. 374): Bonferroni memiliki kekuatan lebih ketika jumlah perbandingan kecil, sedangkan Tukey lebih kuat ketika menguji sejumlah besar …

4
Mengubah hipotesis nol dalam regresi linier
Saya memiliki beberapa data yang sangat berkorelasi. Jika saya menjalankan regresi linier, saya mendapatkan garis regresi dengan kemiringan mendekati satu (= 0,93). Yang ingin saya lakukan adalah menguji apakah kemiringan ini sangat berbeda dari 1,0. Harapan saya adalah tidak. Dengan kata lain, saya ingin mengubah hipotesis nol dari regresi linier …

1
Merencanakan grafik mini di R
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Saya ingin menggunakan R untuk merencanakan sesuatu seperti ini: Tampaknya mungkin tetapi sangat kompleks untuk melacak koordinat, lebar, tinggi, dll. Secara intuitif tampaknya akan lebih baik …

4
Menentukan fungsi pemasangan kurva fitting terbaik dari fungsi linier, eksponensial, dan logaritmik
Konteks: Dari pertanyaan tentang Pertukaran Matematika Stack (Dapatkah saya membangun program) , seseorang memiliki satu set poin , dan ingin menyesuaikan kurva untuk itu, linier, eksponensial atau logaritmik. Metode yang biasa adalah memulai dengan memilih salah satu dari ini (yang menentukan model), dan kemudian melakukan perhitungan statistik.x - yx-yx-y Tetapi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.