Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

6
Bagaimana cara group-center / standardisasi variabel dalam R?
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Fungsi Aku akrab dengan menyertakan skala dari basis R, rescale dari ARM. Mungkin cara terbaik adalah menggunakan beberapa varian berlaku, menentukan satu atau lebih variabel untuk …

3
Bagaimana saya bisa mensimulasikan sensus mikrodata untuk wilayah kecil menggunakan sampel mikrodata 1% pada skala besar dan statistik agregat pada skala area kecil?
Saya ingin melakukan analisis multivariat tingkat individu pada tingkat kecil agregasi geografis (distrik pengumpulan sensus Australia). Jelas, sensus tidak tersedia pada tingkat agregasi kecil ini untuk alasan privasi jadi saya sedang menyelidiki alternatif lain. Hampir semua variabel yang menarik bersifat kategorikal. Saya memiliki dua set data yang saya miliki: Sampel …

1
Bagaimana menafsirkan nilai-p 0 atau 1?
Saya menjalankan temuan ANOVA misalnya interaksi antara jenis kelamin dan kelas daripada yang saya ingin tahu dalam apa nilai anak laki-laki dan perempuan berbeda, tetapi dalam banyak kasus saya menemukan (disesuaikan) nilai-p 0 dan 1. Bagaimana / mengapa ini mungkin? Sepertinya tidak benar ... as.factor(gender) 1 16 16.2 2.6377 0.104396 …
9 r 

3
Bisakah efek acak hanya berlaku untuk variabel kategori?
Pertanyaan ini mungkin terdengar bodoh, tetapi ... apakah benar bahwa efek acak hanya dapat berlaku untuk variabel kategori (seperti id individu, id populasi, ...), misalkan katakanlah adalah variabel kategori:xsayaxix_i ysayayiy_i ~βxsayaβxi\beta_{x_i} βxsayaβxi\beta_{x_i} ~No r m ( μ , δ2)Norm(μ,δ2)Norm(\mu, \delta^2) tetapi dari prinsipnya efek acak tidak dapat berlaku untuk variabel …



1
Haruskah perbedaan antara kontrol dan pengobatan dimodelkan secara eksplisit atau implisit?
Diberikan pengaturan eksperimental berikut: Banyak sampel diambil dari subjek dan setiap sampel diperlakukan dengan berbagai cara (termasuk perlakuan kontrol). Yang paling menarik adalah perbedaan antara kontrol dan masing-masing perlakuan. Saya dapat memikirkan dua model sederhana untuk data ini. Dengan sampel , pengobatan , pengobatan 0 menjadi kontrol, biarkan menjadi data, …



2
Regresi logistik berbobot kasus
Saya sedang melihat beberapa masalah regresi logistik. ("reguler" dan "bersyarat"). Idealnya, saya ingin memberi bobot pada masing-masing kasus masukan sehingga GLM akan lebih fokus pada memprediksi kasing yang lebih tinggi dengan benar dengan mengorbankan kemungkinan kesalahan klasifikasi pada kasing yang lebih rendah. Tentunya ini sudah dilakukan sebelumnya. Adakah yang bisa …
9 logistic 

2
Apakah distribusi ini memiliki nama? Atau apakah proses stokastik yang dapat menghasilkannya?
Distribusi diskrit dengan fungsi massa p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k) = \frac{k}{(x+k)(x+k-1)},\quad x = 1,2,\ldots muncul di halaman 9 tulisan ini . Untuk ini adalah distribusi Yule-Simon dengan , tapi saya belum menemukan contoh lain.k=1k=1k=1ρ=1ρ=1\rho=1 Apakah itu mempunyai nama? Apakah itu muncul dalam konteks lain? Apakah ada proses stokastik sederhana yang mungkin menghasilkannya?

1
Inferensi dalam model linier dengan heteroskedastisitas bersyarat
Misalkan saya mengamati vektor variabel independen dan dan variabel dependen . Saya ingin mencocokkan model formulir: mana adalah beberapa fungsi bernilai positif yang dapat dua kali, adalah parameter penskalaan yang tidak diketahui, dan adalah variabel rata-rata, varians unit Gaussian variabel acak (diasumsikan independen dari dan ). Ini pada dasarnya adalah …

2
Apakah jarak harus menjadi "metrik" agar pengelompokan hierarkis valid?
Mari kita katakan bahwa kita mendefinisikan jarak, yang bukan metrik , antara N item. Berdasarkan jarak ini kami kemudian menggunakan pengelompokan hierarki Agglomerative . Bisakah kita menggunakan masing-masing algoritma yang dikenal (tautan tunggal / maksimum / rata-rata dll), untuk mendapatkan hasil yang bermakna? Atau dengan kata lain, apa masalah dengan …

2
Distribusi deviasi standar
Pertanyaan ini membahas distribusi normal, tetapi saya bertanya-tanya apa yang diketahui tentang distribusi standar deviasi sampel ukuran n yang diambil dari distribusi sewenang-wenang. Secara khusus, apa standar deviasi dari standar deviasi? Untuk distribusi normal, sd dari sd adalah . Apakah ini kira-kira berlaku untuk distribusi sewenang-wenang sebagai ?σ2n√σ2n\sigma \over{\sqrt{2n}}n→∞n→∞n \rightarrow …

2
Memahami hasil regresi ridge
Saya baru mengenal ridge regression. Ketika saya menerapkan regresi linear ridge, saya mendapat hasil berikut: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.