Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Regresi linier dengan kesalahan Laplace
Pertimbangkan model regresi linier: mana \ varepsilon _i \ sim \ mathcal L (0, b) , yaitu , Distribusi Laplace dengan 0 mean dan parameter skala b , semuanya saling independen. Pertimbangkan estimasi kemungkinan maksimum untuk parameter yang tidak diketahui \ boldsymbol \ beta : - \ log p (\ …

1
Pemilihan model asli (?) Dengan k-fold CV
Ketika menggunakan k-fold CV untuk memilih di antara model regresi, saya biasanya menghitung kesalahan CV secara terpisah untuk masing-masing model, bersama dengan kesalahan standar SE, dan saya memilih model paling sederhana dalam 1 SE dari model dengan kesalahan CV terendah (1 aturan kesalahan standar, lihat misalnya di sini ). Namun, …


3
Set variabel tidak berkorelasi tetapi linear tergantung
Apakah mungkin untuk memiliki seperangkat variabel yang tidak berkorelasi tetapi bergantung secara linear?KKK yaitu dan∑c o r ( xsaya, xj) = 0cor(xi,xj)=0cor(x_i, x_j)=0∑Ki = 1Sebuahsayaxsaya= 0∑i=1Kaixi=0 \sum_{i=1}^K a_ix_i=0 Jika ya, bisakah Anda menulis contoh? EDIT: Dari jawaban berikut bahwa itu tidak mungkin. Apakah paling tidak mungkin mana adalah estimasi koefisien …

3
Putar komponen PCA untuk menyamakan varians di setiap komponen
Saya mencoba mengurangi dimensi dan derau dataset dengan melakukan PCA pada dataset dan membuang beberapa PC terakhir. Setelah itu, saya ingin menggunakan beberapa algoritma pembelajaran mesin pada PC yang tersisa, dan karena itu saya ingin menormalkan data dengan menyamakan varians PC untuk membuat algoritma bekerja lebih baik. Satu cara sederhana …

1
Tidak dapat membuat jaringan autoencoder ini berfungsi dengan baik (dengan lapisan convolutional dan maxpool)
Jaringan Autoencoder tampaknya jauh lebih rumit daripada jaringan MLP classifier normal. Setelah beberapa upaya menggunakan Lasagne semua yang saya dapatkan dalam output yang direkonstruksi adalah sesuatu yang menyerupai yang terbaik, rata-rata buram dari semua gambar dari database MNIST tanpa perbedaan pada apa digit input sebenarnya. Struktur jaringan yang saya pilih …

1
Bagaimana cara menghitung probabilitas hasil dari mekanik dadu bergulir yang berbelit-belit ini?
Pertanyaan ini menanyakan tentang kemungkinan keberhasilan dalam Permainan Bermain Peran. Namun, pertanyaannya, dan jawabannya tidak mencakup beberapa kompleksitas mekanika dadu. Secara khusus, itu tidak mencakup kerusakan (satu kemungkinan hasil) sama sekali. Seorang pemain memiliki kolam dadu, berdasarkan pada beberapa mekanik dalam permainan yang tidak relevan dengan pertanyaan ini. Kolam dadu …
9 dice 

1
Mengapa koefisien regresi linier dan logistik tidak dapat diperkirakan menggunakan metode yang sama?
Saya membaca dalam buku pembelajaran mesin bahwa parameter regresi linier dapat diperkirakan (antara metode lain) dengan gradient descent, sedangkan parameter regresi logistik biasanya diestimasi dengan estimasi kemungkinan maksimum. Apakah mungkin untuk menjelaskan kepada seorang pemula (saya) mengapa kita memerlukan metode yang berbeda untuk regresi linier / logistik. alias mengapa tidak …


1
Memperbarui faktor Bayes
Faktor A Bayes didefinisikan dalam Bayesian pengujian hipotesis dan Bayesian pemilihan model dengan rasio dua likelihood marginal: diberikan sampel iid (x1,…,xn)(x1,…,xn)(x_1,\ldots,x_n) dan kepadatan masing-masing sampling f1(x|θ)f1(x|θ)f_1(x|\theta) dan f2(x|η)f2(x|η)f_2(x|\eta) , dengan prior yang sesuai π1π1\pi_1 dan π2π2\pi_2 , faktor Bayes untuk membandingkan kedua model adalah B12(x1,…,xn)=defm1(x1,…,xn)m2(x1,…,xn)=def∫∏ni=1f1(xi|θ)π1(dθ)∫∏ni=1f2(xi|η)π2(dη)B12(x1,…,xn)=defm1(x1,…,xn)m2(x1,…,xn)=def∫∏i=1nf1(xi|θ)π1(dθ)∫∏i=1nf2(xi|η)π2(dη)\mathfrak{B}_{12}(x_1,\ldots,x_n)\stackrel{\text{def}}{=}\frac{m_1(x_1,\ldots,x_n)}{m_2(x_1,\ldots,x_n)}\stackrel{\text{def}}{=}\frac{\int \prod_{i=1}^n f_1(x_i|\theta)\pi_1(\text{d}\theta)}{\int \prod_{i=1}^n f_2(x_i|\eta)\pi_2(\text{d}\eta)} Sebuahbuku …

1
Bisakah kita selalu menulis ulang distribusi miring yang benar dalam hal komposisi distribusi yang sewenang-wenang dan simetris?
Pertimbangkan distribusi yang dua kali dapat dibedakan dan simetris . Sekarang pertimbangkan distribusi berdiferensiasi dua kali kedua condong dalam arti bahwa:F ZFXFX\mathcal{F}_XFZFZ\mathcal{F}_Z (1)FX⪯cFZ.(1)FX⪯cFZ.(1)\quad\mathcal{F}_X\preceq_c\mathcal{F}_Z. di mana adalah pemesanan cembung van Zwet [0] sehingga setara dengan: ( 1 )⪯c⪯c\preceq_c(1)(1)(1) (2)F−1ZFX(x) is convex ∀x∈R.(2)FZ−1FX(x) is convex ∀x∈R.(2)\quad F^{-1}_ZF_X(x)\text{ is convex $\forall x\in\mathbb{R}.$} Pertimbangkan …

1
Berapa banyak sisi yang dimiliki die? Kesimpulan Bayesian dalam JAGS
Masalah Saya ingin melakukan beberapa kesimpulan tentang sistem analog dengan mati dengan jumlah sisi yang tidak diketahui. Die digulung beberapa kali, setelah itu saya ingin menyimpulkan distribusi probabilitas atas parameter yang sesuai dengan jumlah sisi yang dimiliki die, θ. Intuisi Jika setelah 40 gulungan Anda telah mengamati 10 merah, 10 …

3
Bagaimana saya bisa tahu bahwa tidak ada pola dalam hasil PCA?
Saya memiliki 1000+ dataset sampel dari 19 variabel. Tujuan saya adalah untuk memprediksi variabel biner berdasarkan 18 variabel lainnya (biner dan kontinu). Saya cukup yakin bahwa 6 dari variabel prediksi terkait dengan respons biner, namun, saya ingin menganalisis lebih lanjut dataset dan mencari asosiasi atau struktur lain yang mungkin saya …
9 pca 

1
Cara mengatur kontras khusus dengan lmer di R
Saya menggunakan lmer di R untuk memeriksa efek kondisi ( cond) pada beberapa hasil. Berikut adalah beberapa data yang dibuat, di mana s adalah pengidentifikasi subjek dan a, bdan ckondisi. library("tidyr") library("dplyr") set.seed(123) temp <- data.frame(s = paste0("S", 1:30), a = rnorm(30, -2, 1), b = rnorm(30, -3, 1), c …

2
Bagaimana menafsirkan dan melakukan peramalan menggunakan paket tsoutliers dan auto.arima
Saya sudah mendapatkan data bulanan dari tahun 1993 hingga 2015 dan ingin melakukan perkiraan data ini. Saya menggunakan paket tsoutliers untuk mendeteksi outliers, tetapi saya tidak tahu bagaimana cara melanjutkan perkiraan dengan set data saya. Ini kode saya: product.outlier<-tso(product,types=c("AO","LS","TC")) plot(product.outlier) Ini adalah output saya dari paket tsoutliers ARIMA(0,1,0)(0,0,1)[12] Coefficients: sma1 …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.