Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Uji coba "pragmatis": apa itu?
Di twitter, seorang uji coba Stuart Nicholls mengkritik penelitian yang baru-baru ini diterbitkan dengan mengatakan: Selanjutnya ke kertas yang sangat menarik oleh Dal-Re mereka menandai beberapa contoh yang mempertanyakan penggunaan istilah pragmatis. Bisakah percobaan fase 3, multisite, double-blind, dikontrol plasebo, paralel-lengan, dosis acak benar-benar disebut 'pragmatis'? Artikel penelitian yang dimaksud …


2
UMVUE dari sementara sampel dari populasi
Biarkan menjadi sampel acak dari kerapatan(X1,X2,…,Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n)fθ(x)=θxθ−110<x<1,θ>0fθ(x)=θxθ−110<x<1,θ>0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 Saya mencoba menemukan UMVUE dari .θ1+θθ1+θ\frac{\theta}{1+\theta} Kepadatan bersama adalah(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n) fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110<x1,…,xn<1=exp[(θ−1)∑i=1nlnxi+nlnθ+ln(10<x1,…,xn<1)],θ>0fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110<x1,…,xn<1=exp⁡[(θ−1)∑i=1nln⁡xi+nln⁡θ+ln⁡(10<x1,…,xn<1)],θ>0\begin{align} f_{\theta}(x_1,\cdots,x_n)&=\theta^n\left(\prod_{i=1}^n x_i\right)^{\theta-1}\mathbf1_{00 \end{align} Karena populasi pdf milik keluarga eksponensial satu-parameter, ini menunjukkan bahwa statistik yang cukup lengkap untuk \ theta adalah T (X_1, \ ldots, X_n) = \ sum_ {i = 1} ^ …

2
Pengambilan Sampel yang Tepat dari Campuran yang Tidak Benar
Misalkan saya ingin mengambil sampel dari distribusi berkelanjutan . Jika saya memiliki ekspresi dalam formulirpp(x)p(x)p(x)ppp p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) di mana , dan f_i adalah distribusi yang dapat dengan mudah diambil sampelnya, maka saya dapat dengan mudah menghasilkan sampel dari p dengan:ai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1fifif_ippp Mengambil sampel …

2
Justifikasi untuk model efek-tetap vs efek-acak dalam meta-analisis
Saya telah membaca beberapa publikasi yang mencoba membenarkan penggunaan model efek tetap dengan pernyataan di sepanjang baris "model efek tetap dipilih karena heterogenitasnya rendah". Namun, saya khawatir ini mungkin masih menjadi pendekatan yang tidak tepat untuk analisis data. Adakah alasan atau publikasi yang membahas apakah dan mengapa ini bisa menjadi …



1
Hubungan LASSO antara dan
Pemahaman saya tentang regresi LASSO adalah bahwa koefisien regresi dipilih untuk menyelesaikan masalah minimalisasi: minβ∥y−Xβ∥22 s.t.∥β∥1≤tminβ‖y−Xβ‖22 s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t Dalam praktiknya ini dilakukan dengan menggunakan pengali Lagrange, membuat masalah untuk dipecahkan minβ∥y−Xβ∥22+λ∥β∥1minβ‖y−Xβ‖22+λ‖β‖1\min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 Apa hubungan antara λλ\lambda …

1
Kapan tidak menggunakan validasi silang?
Ketika saya membaca situs ini sebagian besar jawaban menyarankan bahwa validasi silang harus dilakukan dalam algoritma pembelajaran mesin. Namun ketika saya membaca buku "Memahami Pembelajaran Mesin" saya melihat ada latihan yang terkadang lebih baik untuk tidak menggunakan validasi silang. Saya sangat bingung. Kapan algoritma pelatihan pada seluruh data lebih baik …

6
Contoh dunia nyata sederhana untuk mengajar statistik Bayesian?
Saya ingin menemukan beberapa "contoh dunia nyata" untuk mengajarkan statistik Bayesian. Statistik Bayesian memungkinkan seseorang untuk secara resmi memasukkan pengetahuan sebelumnya ke dalam analisis. Saya ingin memberi siswa beberapa contoh dunia nyata sederhana dari para peneliti yang memasukkan pengetahuan sebelumnya ke dalam analisis mereka sehingga siswa dapat lebih memahami motivasi …

7
Apakah sensitivitas atau spesifisitas merupakan fungsi dari prevalensi?
Pengajaran standar mengatakan bahwa sensitivitas dan spesifisitas adalah sifat dari tes ini dan tidak tergantung pada prevalensi. Tapi bukankah ini hanya asumsi? Prinsip Harrison tentang penyakit dalam 19 ed mengatakan Telah lama dinyatakan bahwa sensitivitas dan spesifisitas merupakan parameter yang tidak tergantung pada prevalensi dari akurasi tes, dan banyak teks …

4
Bagaimana saya bisa mengambil nilai secara acak dari perkiraan kepadatan kernel?
Saya memiliki beberapa pengamatan, dan saya ingin meniru sampel berdasarkan pengamatan ini. Di sini saya mempertimbangkan model non-parametrik, khususnya, saya menggunakan kernel smoothing untuk memperkirakan CDF dari pengamatan terbatas. Kemudian saya menggambar nilai secara acak dari CDF yang diperoleh. Berikut ini adalah kode saya, (idenya adalah mendapatkan kumulatif secara acak …

2
Jika jumlah probabilitas kejadian sama dengan probabilitas penyatuan mereka, apakah itu menyiratkan bahwa kejadian tersebut terpisah?
Secara aksiomatis, probabilitas adalah fungsi yang memberikan bilangan real P ( A ) untuk setiap peristiwa A jika memenuhi tiga asumsi mendasar (asumsi Kolmogorov):PPPP( A )P(SEBUAH)P(A)SEBUAHSEBUAHA P(A)≥0 for everyAP(A)≥0 for everyAP(A) \geq 0 \ \text{for every} A P(Ω)=1P(Ω)=1P(\Omega) = 1 If A1,A2,⋯are disjoint, thenP(⋃∞i=1Ai)=∑i=1∞P(Ai)If A1,A2,⋯are disjoint, thenP(⋃i=1∞Ai)=∑i=1∞P(Ai)\text{If} \ A_1, A_2, …

3
Apakah asumsi linearitas dalam regresi linier hanyalah definisi ?
Saya merevisi regresi linier. Buku teks oleh Greene menyatakan: Sekarang, tentu saja akan ada asumsi lain pada model regresi linier, seperti . Asumsi ini dikombinasikan dengan asumsi linearitas (yang pada dasarnya mendefinisikan ), menempatkan struktur pada model.ϵE(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0ϵϵ\epsilon Namun, asumsi linearitas dengan sendirinya tidak menempatkan struktur apa pun pada model kami, …

2
Mengapa estimator dianggap sebagai variabel acak?
Pemahaman saya tentang apa yang merupakan taksiran dan taksiran adalah: Penaksir: Aturan untuk menghitung taksiran Taksiran: Nilai dihitung dari sekumpulan data berdasarkan penaksir Di antara kedua istilah ini, jika saya diminta untuk menunjukkan variabel acak, saya akan mengatakan perkiraan adalah variabel acak karena nilainya akan berubah secara acak berdasarkan sampel …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.