Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Regresi melalui asal
Kami memiliki poin-poin berikut: Bagaimana kita dapat menemukan garis pemasangan terbaik melalui titik-titik? Kalkulator saya memiliki opsi untuk menemukan jalur pemasangan terbaik melalui titik-titik ini, yaitu:( 0 , 0 ) ( 1 , 51.8 ) ( 1.9 , 101.3 ) ( 2.8 , 148.4 ) ( 3.7 , 201.5 ) …


1
Apa yang dimaksud dengan "level" dari deret waktu?
Dalam banyak literatur yang saya pelajari itu adalah salah satu istilah yang sering terjadi namun tanpa definisi yang ketat dapat ditemukan. Secara khusus, saya diberitahu: Untuk variabel acak terindeks waktu (RVs) , model dekomposisi aditif diberikan sebagai{Xt}{Xt}\{X_t\} Xt= l l (Xt - 1,Xt - 2, ... ) + fc (Xt …

1
Apa perbedaan antara Memaksimalkan Kemungkinan Bersyarat (Log) atau Kemungkinan Gabungan (Log) saat memperkirakan parameter model?
Pertimbangkan respon y dan data matriks X . Misalkan saya membuat model formulir - y ~ g (X, )θθ\theta (g () bisa berupa fungsi X dan )θθ\theta Sekarang, untuk memperkirakan menggunakan metode Maximum Likelihood (ML), saya bisa melanjutkan dengan Conditional ML (dengan asumsi saya tahu bentuk kepadatan bersyarat f (y …


1
Jarak antar variabel acak diskrit seragam
Misalkan menjadi iid diskrit variabel seragam seragam pada (0,1) dan statistik pesanannya adalah .U1, ... ,UnU1,...,UnU_1, \ldots, U_nnnnU( 1 ), ... ,U( n )U(1),...,U(n)U_{(1)}, \ldots, U_{(n)} Tentukan untuk dengan .Dsaya=U( i )-U( saya - 1 )Dsaya=U(saya)-U(saya-1)D_i=U_{(i)}-U_{(i-1)}i = 1 , … , nsaya=1,...,ni=1, \ldots, nU0= 0U0=0U_0=0 Saya mencoba mencari tahu distribusi …

5
Bootstrap data hierarkis / multilevel (resampling cluster)
Saya memproduksi skrip untuk membuat sampel bootstrap dari catsdataset (dari -MASS-paket). Mengikuti buku teks Davidson dan Hinkley [1] Saya menjalankan regresi linier sederhana dan mengadopsi prosedur dasar non-parametrik untuk bootstrap dari pengamatan awal, yaitu pemasangan kembali pasangan . Sampel asli dalam bentuk: Bwt Hwt 2.0 7.0 2.1 7.2 ... 1.9 …

3
Saat menggunakan glmnet bagaimana melaporkan nilai-p signifikansi untuk mengklaim signifikansi prediktor?
Saya memiliki sejumlah besar prediktor (lebih dari 43.000) untuk memprediksi variabel dependen yang dapat mengambil 2 nilai (0 atau 1). Jumlah pengamatan lebih dari 45.000. Sebagian besar prediktor adalah unigrams, bigrams, dan trigram kata-kata, sehingga ada tingkat kolinearitas yang tinggi di antara mereka. Ada banyak sparsity di dataset saya juga. …

1
Distribusi Posterior untuk Regresi Linier Bayesian
Saya telah meneliti penggunaan regresi linier Bayesian, tetapi saya telah sampai pada contoh yang saya bingung. Diberikan model: y=βX+ϵy=βX+ϵ{\bf y} = {\bf \beta}{\bf X} + \bf{\epsilon} Anggap saja dan ,ϵ∼N(0,ϕI)ϵ∼N(0,ϕI){\bf \epsilon} \sim N(0, \phi I)p(β,ϕ)∝1ϕp(β,ϕ)∝1ϕp(\beta, \phi) \propto \frac{1}{\phi} Bagaimana cara mencapai ?p(β|ϕ,y)p(β|ϕ,y)p(\beta|\phi, {\bf y}) Di mana: .p(β|ϕ,y)∼N(XTX)−1XTy,ϕ(XTX)−1)p(β|ϕ,y)∼N(XTX)−1XTy,ϕ(XTX)−1)p(\beta|\phi, {\bf y}) \sim …


1
Kebingungan terkait dengan teknik mengantongi
Saya mengalami sedikit kebingungan. Saya sedang membaca makalah ini di mana dijelaskan bahwa teknik mengantongi sangat mengurangi varians dan hanya sedikit meningkatkan bias. Saya tidak mengerti mengapa mengurangi varians. Saya tahu perbedaan dan biasnya. Bias adalah ketidakmampuan model untuk mempelajari data. Varians adalah sesuatu yang mirip dengan overfitting. Saya hanya …

2
Dari mana fungsi Gaussian berasal?
Saya telah membaca banyak halaman di google dan tidak dapat menemukan jawaban yang memuaskan. Saya juga membaca http://castatistics.wikispaces.com/file/view/normal+der..pdf , tapi saya ragu itu adalah motivasi asli untuk fungsi Gaussian. Saat ini saya seorang sarjana dan buku teks saya hanya memberi tahu saya fungsi f (x) = ae - (x - …

3
Bagaimana saya bisa menjelaskan intuisi di balik ANOVA?
Saya perlu menjelaskan intuisi di balik apa yang dilakukan ANOVA kepada orang non-teknis. Apakah ada visual yang menjelaskan ide itu? Visual yang menggambarkan ide kunci dalam konteks ANOVA satu arah dengan level 3 faktor mungkin mungkin membantu? Mari kita anggap bahwa orang tersebut telah mengambil beberapa kursus statistik sebagai siswa …

1
Distribusi Hyperprior untuk parameter (skala matriks dan derajat kebebasan) dari wishart sebelum matriks kovarians terbalik
Saya memperkirakan beberapa matriks kovarians terbalik dari serangkaian pengukuran di berbagai subpopulasi menggunakan wishart sebelum di jags / rjags / R. Alih-alih menentukan matriks skala dan derajat kebebasan pada matriks kovarians terbalik sebelumnya (distribusi wishart), saya ingin menggunakan hyperprior pada matriks skala dan derajat kebebasan, sehingga mereka dapat diperkirakan dari …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.