Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data




2
The -test vs -test untuk membandingkan kemungkinan menangkap dingin di 2 kelompok
Saya baru saja membaca di majalah sains (populer) yang agak dihormati (PM Jerman, 02/2013, hal.36) tentang percobaan yang menarik (tanpa sumber, sayangnya). Itu menarik perhatian saya karena secara intuitif saya meragukan signifikansi hasilnya, tetapi informasi yang diberikan cukup untuk mereproduksi pengujian statistik. Para peneliti bertanya-tanya apakah menjadi dingin dalam cuaca …

5
Algoritma kuadrat terkecil teratur rekursif (online)
Adakah yang bisa mengarahkan saya ke arah algoritma online (rekursif) untuk Regulasi Tikhonov (kuadrat terkecil yang diatur)? Dalam pengaturan offline, saya akan menghitung β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY menggunakan set data asli saya di mana λλλ ditemukan menggunakan validasi silang n-fold. Nilai y baru yyydapat diprediksi untuk x yang diberikan xxxmenggunakan y=xTβ^y=xTβ^y=x^T\hat\beta . Dalam …


1
Rasio probabilitas vs rasio PDF
Saya menggunakan Bayes untuk memecahkan masalah pengelompokan. Setelah melakukan beberapa perhitungan saya berakhir dengan kebutuhan untuk mendapatkan rasio dua probabilitas: P(A)/P(B)P(A)/P(B)P(A)/P(B) untuk dapat memperoleh . Probabilitas ini diperoleh dengan mengintegrasikan dua KDE multivarian 2D berbeda seperti yang dijelaskan dalam jawaban ini :P(H|D)P(H|D)P(H|D) P(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A) = \iint_{x, y : \hat{f}(x, y) < …

3
Alasan intuitif mengapa Fisher Information of Binomial berbanding terbalik dengan
Ini membingungkan / mengejutkan saya bahwa Binomial memiliki varian yang sebanding dengan . Secara setara, informasi Fisher sebanding dengan 1p(1−p)p(1−p)p(1-p) . Apa alasannya? Mengapa Informasi Fisher diminimalkan padap=0,5? Artinya, mengapa inferensi paling sulit padap=0,5?1p(1−p)1p(1−p)\frac{1}{p(1-p)}p=0.5p=0.5p=0.5p=0.5p=0.5p=0.5 Konteks: Saya sedang mengerjakan kalkulator ukuran sampel, dan rumus untuk , ukuran sampel yang dibutuhkan, adalah …

10
Kata-kata umum yang memiliki arti statistik tertentu
Saya bukan ahli statistik tetapi pekerjaan penelitian saya melibatkan statistik (menganalisis data, membaca literatur, dll.). Saya diingatkan kembali dari komentar pada salah satu pertanyaan saya yang diposting di sini bahwa ada beberapa kata umum yang memiliki makna atau konotasi khusus bagi mereka yang terlatih baik dalam bidang statistik. Akan sangat …

2
Apakah MLE selalu berarti kita mengetahui PDF yang mendasari data kita, dan apakah EM berarti kita tidak tahu?
Saya memiliki beberapa pertanyaan konseptual sederhana yang ingin saya klarifikasi mengenai MLE (Estimasi Kemungkinan Maksimum), dan tautan apa yang dimilikinya, jika ada, ke EM (Ekspektasi Maksimalisasi). Seperti yang saya pahami, jika seseorang berkata "Kami menggunakan MLE", apakah itu secara otomatis berarti bahwa mereka memiliki model eksplisit dari data PDF mereka? …

2
Intuisi di balik fungsi kepadatan distribusi-t
Saya sedang mempelajari tentang distribusi-t Student dan saya mulai bertanya-tanya, bagaimana cara mendapatkan fungsi kepadatan distribusi-t (dari wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} di mana adalah derajat kebebasan dan Γ adalah fungsi gamma. Apa intuisi dari fungsi ini? Maksudku, jika aku melihat fungsi massa probabilitas distribusi binomial, masuk akal …


2
Bagaimana saya bisa menyatukan nilai-p bootstrap di seluruh set data yang dilipatgandakan?
Saya prihatin dengan masalah yang ingin saya bootstrap nilai-p untuk estimasi dari data multiply imputed (MI), tetapi tidak jelas bagi saya bagaimana menggabungkan nilai-p di seluruh set MI.θθ\theta Untuk set data MI, pendekatan standar untuk mendapatkan total varian estimasi menggunakan aturan Rubin. Lihat di sini untuk ulasan tentang kumpulan data …

2
Mengapa beberapa orang menguji asumsi model seperti regresi pada data mentah mereka dan orang lain mengujinya pada residu?
Saya seorang mahasiswa Phd dalam psikologi eksperimental dan saya berusaha keras untuk meningkatkan keterampilan dan pengetahuan saya tentang bagaimana menganalisis data saya. Sampai tahun ke 5 saya di Psikologi, saya berpikir bahwa model seperti regresi (misalnya, ANOVA) mengasumsikan hal-hal berikut: normalitas data homogenitas varians untuk data dan sebagainya Program sarjana …

1
Log-linked Gamma GLM vs log-linked Gaussian GLM vs log-transformed LM
Dari hasil saya, tampak bahwa GLM Gamma memenuhi sebagian besar asumsi, tetapi apakah ini merupakan peningkatan yang berharga atas LM yang ditransformasikan log? Kebanyakan literatur yang saya temukan berhubungan dengan Poisson atau Binomial GLMs. Saya menemukan artikel EVALUASI ASUMSI MODEL LINEAR UMUM MENGGUNAKAN RANDOMISASI sangat berguna, tetapi tidak memiliki plot …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.