Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Istilah varians dalam dekomposisi bias-varians dari regresi linier
Dalam 'The Elements of statistik Learning', ekspresi bias-variance dekomposisi linier model diberikan sebagai mana f ( x 0 )Er r ( x0) = σ2ϵ+ E[ f( x0) - Ef^( x0) ]2+ | | h ( x0) | |2σ2ϵ,Err(x0)=σϵ2+E[f(x0)−Ef^(x0)]2+||h(x0)||2σϵ2,Err(x_0)=\sigma_\epsilon^2+E[f(x_0)-E\hat f(x_0)]^2+||h(x_0)||^2\sigma_\epsilon^2,f( x0)f(x0)f(x_0)adalah fungsi target yang sebenarnya, adalah varian dari kesalahan acak dalam …


2
Apakah properti invarian dari estimator ML tidak masuk akal dari perspektif Bayesian?
Casella dan Berger menyatakan properti invarian penaksir ML sebagai berikut: Namun, bagi saya tampaknya mereka mendefinisikan "kemungkinan" dari dalam cara yang sepenuhnya ad hoc dan tidak masuk akal:ηη\eta Jika saya menerapkan aturan dasar teori probabilitas pada kasus sederhana apakah , saya malah mendapatkan yang berikut: Sekarang menerapkan teorema Bayes, dan …

2
Ekspektasi akar kuadrat dari jumlah variabel acak seragam kuadrat independen
Biarkan menjadi independen dan terdistribusi secara acak, variabel acak seragam standar.X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1) Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] Harapan mudah:YnYnY_n E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} Sekarang untuk bagian yang membosankan. Untuk menerapkan LOTUS, saya …

1
Dimensi tinggi, data berkorelasi dan fitur / kovariat teratas ditemukan; pengujian hipotesis berganda?
Saya memiliki dataset dengan sekitar 5.000 fitur / kovariat yang sering berkorelasi dan respons biner. Data itu diberikan kepada saya, saya tidak mengumpulkannya. Saya menggunakan Lasso dan meningkatkan gradien untuk membangun model. Saya menggunakan iterasi, validasi cross bersarang. Saya melaporkan 40 koefisien terbesar (absolut) Lasso dan 40 fitur terpenting dalam …

4
Apakah mungkin untuk menguraikan residu yang sudah terpasang menjadi bias dan varians, setelah memasang model linier?
Saya ingin mengklasifikasikan poin data sebagai membutuhkan model yang lebih kompleks, atau tidak membutuhkan model yang lebih kompleks. Pemikiran saya saat ini adalah untuk mencocokkan semua data ke model linier sederhana, dan mengamati ukuran residu untuk membuat klasifikasi ini. Saya kemudian melakukan beberapa bacaan tentang kontribusi bias dan varians terhadap …


1
Membantu menafsirkan data jumlah GLMM menggunakan lme4 glmer dan glmer.nb - Binomial negatif versus Poisson
Saya punya beberapa pertanyaan tentang spesifikasi dan interpretasi GLMM. 3 pertanyaan pasti statistik dan 2 lebih spesifik tentang R. Saya posting di sini karena pada akhirnya saya pikir masalahnya adalah interpretasi hasil GLMM. Saat ini saya mencoba untuk menyesuaikan GLMM. Saya menggunakan data sensus AS dari Longitudinal Tract Database . …



1
GAM adaptif memuluskan dalam mgcv
Buku Simon Wood tentang GAM dan paket R terkait mgcv keduanya sangat terperinci dan informatif dalam hal teori GAM dan penyesuaian model dengan data nyata dan disimulasikan. Untuk smooths 1D, benar-benar tidak ada yang perlu dikhawatirkan, kecuali untuk memutuskan apakah akan mengimplementasikan fungsi basis siklik vs adaptif, yang dapat memberikan …
9 r  mgcv 

2
GAMM dengan data nol-inflasi
Apakah mungkin untuk mencocokkan GAMM (Generalized Additive Mixed Model) untuk data nol-inflasi di R? Jika tidak, apakah mungkin untuk mencocokkan GAM (Generalized Additive Model) untuk data tanpa inflasi dengan distribusi binomial negatif atau kuasi Poisson di R? (Saya menemukan COZIGAM :: zigam dan mgcv: fungsi ziP untuk distribusi Poisson)

2
Apakah korelasi yang paling banyak diterbitkan dalam ilmu sosial tidak dapat dipercaya dan apa yang harus dilakukan tentang hal itu? [Tutup]
Ditutup . Pertanyaan ini didasarkan pada pendapat . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga dapat dijawab dengan fakta dan kutipan dengan mengedit posting ini . Ditutup 2 tahun yang lalu . Meskipun upaya-upaya "gotcha" yang penting tetapi dilakukan oleh individu untuk mengungkap praktik jurnal …

1
Bisakah kita menyimpulkan dari bahwa independen?
Yah, kita tidak bisa, lihat misalnya https://en.wikipedia.org/wiki/Subindependence untuk counterexample yang menarik. Tetapi pertanyaan sebenarnya adalah: Apakah ada cara untuk memperkuat kondisi sehingga kemerdekaan mengikuti? Misalnya, apakah ada beberapa rangkaian fungsi sehingga jika untuk semua maka independensi mengikuti? Dan, seberapa besar seperangkat fungsi itu, tak terbatas?E g i ( X ) …

2
Investigasi perbedaan antar populasi
Katakanlah kita memiliki sampel dari dua populasi: Adan B. Mari kita asumsikan populasi ini terbuat dari individu dan kami memilih untuk menggambarkan individu dalam hal fitur. Beberapa fitur ini bersifat kategorikal (misalnya apakah mereka mengemudi untuk bekerja?) Dan beberapa bersifat numerik (mis. Tingginya). Sebut saja fitur-fitur ini: . Kami mengumpulkan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.