Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

5
Mengapa regressor yang tidak relevan menjadi signifikan secara statistik dalam sampel besar?
Saya mencoba untuk lebih memahami signifikansi statistik, ukuran efek dan sejenisnya. Saya memiliki persepsi (mungkin itu salah) bahwa bahkan regresi yang tidak relevan sering menjadi signifikan secara statistik dalam sampel besar . Dengan tidak relevan saya berarti bahwa tidak ada penjelasan pokok permasalahan mengapa regressor harus berhubungan dengan variabel dependen. …

1
Bekerja dengan sampel bootstrap vs sampel asli
Pertimbangkan contoh bilangan real. Katakanlah kita ingin memperkirakan kecenderungan sentral populasi dan memahami ketidakpastian kita tentang estimasi ini. Mari kita singkirkan asumsi tentang distribusi populasi sejenak, dan pertimbangkan dua pendekatan berikut. Dapatkan sampel bootstrap dari sampel input. Yaitu, sampel dengan penggantian (mis. Dapatkan 100 sampel ulang) dan hitung rata-rata untuk …

2
Menghitung nilai-p secara manual untuk uji-t: Cara menghindari nilai yang lebih besar dari
Dua metode ini untuk menghitung nilai p harus setara: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) Masalah dengan metode kedua adalah bahwa ada risiko mendapatkan nilai lebih besar dari 111 (sebenarnya hingga 222): 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 Ini tentu saja bisa diperbaiki oleh 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Pertanyaan saya Jelas algoritma fungsi t-test cukup cerdas untuk membedakan …
8 r  t-test  p-value 

1
Tinjau kertas pada filter partikel
Saya telah menemukan daring makalah ulasan yang sangat bagus oleh Zhe Chen berjudul "Bayesian Filtering: Dari Kalman Filter ke Particle Filter, and Beyond". Menurut Google Cendekia, kutipan untuk versi yang diterbitkan adalah "Statistics 182 (1), 1-69, 2003" tetapi jurnal yang saya temukan dengan nama itu (ISSN: 0233-1888) tidak memiliki kertas; …

2
Visualisasi dan Overplotting: Alternatif untuk pencar
Saya memiliki satu set besar data negara yang penuh sesak (seperti yang Anda lihat di bawah), tapi saya perlu label dan outlier - Saya juga punya banyak grafik, jadi akan membosankan untuk mengatur ulang jendela dan menambahkan datapoint palsu untuk outlier. Apakah ada alternatif yang baik untuk sebaran yang mungkin …


1
Mendapat algoritma K-means sebagai batas Maksimalisasi Ekspektasi untuk Campuran Gaussian
Christopher Bishop mendefinisikan nilai yang diharapkan dari fungsi kemungkinan log data lengkap (yaitu dengan asumsi bahwa kita diberikan data yang dapat diamati X serta data laten Z) sebagai berikut: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[ln⁡p(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){ln⁡πk+ln⁡N(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln \pi_k + \ln \mathcal{N}(\textbf{x}_n \mid \ \boldsymbol{\mu}_k, \boldsymbol{\Sigma}_k)\} …

1
Formula Schuette – Nesbitt
Saya membaca artikel tentang formula Schuette-Nesbitt , yang digambarkan sebagai "generalisasi dari prinsip inklusi-pengecualian" , yang memiliki versi kombinatorial dan probabilistik. Situs web lain memberikan bukti untuk acara dependen (unduhan pdf) , dan menemukan yang ketiga membandingkannya dengan Waring's Theorem (pdf) Namun, saya masih bingung. Saya mencoba menemukan contoh yang …

1
Apa topik penelitian panas untuk disertasi PhD dalam Biostatistik?
Saya sudah memikirkan memilih topik penelitian untuk disertasi PhD dalam Biostatistik. Saya ingin mengetahui beberapa topik penelitian panas dalam beberapa tahun terakhir. Sejauh yang saya tahu, beberapa topik penelitian panas adalah: Analisis data dimensi tinggi; inferensial kausal dalam eksperimen dan studi observasional; pencocokan skor kecenderungan; Statistik Bayesian. Seri waktu; Pemilihan …

1
Istilah kesalahan vs Inovasi
Saya memperhatikan bahwa kadang-kadang kita menyebut istilah kesalahan sebagai "inovasi". Saya tidak mengerti apakah ini dalam situasi khusus atau jika istilah ini dapat digunakan satu sama lain. Lalu, pertanyaan lain adalah "mengapa kita menyebut istilah kesalahan" inovasi "? Terima kasih

3
Konversi rasio bahaya ke rasio odds
Dalam meta-analisis: Bagaimana kita mengubah rasio bahaya dalam beberapa penelitian menjadi rasio odds? Ada studi kasus kontrol dan kohort untuk dimasukkan dan beberapa dari mereka melaporkan rasio bahaya. Data mentah tidak dilaporkan dengan cara menghitung odds ratio.


2
Distribusi miring untuk Regresi Logistik
Saya telah mengembangkan model regresi logistik berdasarkan data retrospektif dari database trauma nasional cedera kepala di Inggris. Hasil utama adalah kematian 30 hari (dilambangkan sebagai Outcome30ukuran). Langkah-langkah lain di seluruh database dengan bukti yang dipublikasikan yang berpengaruh signifikan terhadap hasil dalam penelitian sebelumnya termasuk: Yeardecimal - Date of procedure = …

1
Independensi linier vs independensi statistik (PCA dan ICA)
Saya membaca makalah yang menarik ini tentang penerapan ICA untuk data ekspresi gen. Penulis menulis: [T] di sini tidak ada persyaratan untuk komponen PCA harus independen secara statistik. Itu benar, tetapi PC itu ortogonal, bukan? Saya agak tidak jelas tentang apa hubungan antara kecenderungan statistik dan ortogonalitas atau independensi linear. …
8 pca  independence  ica 

1
Mengapa saya ingin melakukan bootstrap ketika menghitung uji-t sampel independen? (bagaimana menjustifikasi, menafsirkan, dan melaporkan uji-t bootstrap)
Katakanlah saya memiliki dua kondisi, dan ukuran sampel saya untuk kedua kondisi sangat rendah. Katakanlah saya hanya memiliki 14 pengamatan pada kondisi pertama dan 11 pengamatan lainnya. Saya ingin menggunakan uji-t untuk menguji apakah perbedaan rata-rata secara signifikan berbeda satu sama lain. Pertama, saya agak bingung tentang asumsi normal dari …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.