Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Mengapa kesalahan yang didistribusikan secara tidak normal mengganggu validitas pernyataan signifikansi kami?
Ada asumsi normal ketika datang untuk mempertimbangkan model OLS dan itu adalah bahwa kesalahan didistribusikan secara normal. Saya telah menelusuri Cross Validated dan sepertinya Y dan X tidak harus normal agar kesalahan normal. Pertanyaan saya adalah mengapa ketika kita memiliki kesalahan yang tidak terdistribusi secara normal, apakah validitas pernyataan signifikansi …

1
Bagaimana saya harus menginterpretasikan statistik GAP?
Saya menggunakan statistik GAP untuk memperkirakan k cluster di R. Namun saya tidak yakin apakah saya menafsirkannya dengan baik. Dari plot di atas saya berasumsi bahwa saya harus menggunakan 3 cluster. Dari plot kedua saya harus memilih 6 cluster. Benarkah interpretasi statistik GAP? Saya akan berterima kasih atas penjelasan apa …
10 clustering 

1
Varians faktor inflasi untuk model aditif umum
Dalam perhitungan VIF biasa untuk regresi linier, setiap variabel bebas / jelas diperlakukan sebagai variabel dependen dalam regresi kuadrat terkecil biasa. yaituXjXjX_j Xj=β0+∑i=1,i≠jnβiXiXj=β0+∑i=1,i≠jnβiXi X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i The nilai disimpan untuk setiap regresi dan VIF ditentukan oleh nR2R2R^2nnn VsayaFj= 11 - R2jVIFj=11−Rj2 VIF_j = …

1
Fit a GARCH (1,1) - model dengan kovariat di R
Saya memiliki beberapa pengalaman dengan pemodelan deret waktu, dalam bentuk model ARIMA sederhana dan sebagainya. Sekarang saya memiliki beberapa data yang menunjukkan pengelompokan volatilitas, dan saya ingin mencoba memulai dengan memasang model GARCH (1,1) pada data. Saya memiliki serangkaian data dan sejumlah variabel yang saya pikir mempengaruhinya. Jadi dalam istilah …
10 r  regression  garch 

3
Kapan harus mengakhiri tes Bayesian A / B?
Saya mencoba untuk melakukan pengujian A / B dengan cara Bayesian, seperti dalam Probabilistic Programming for Hackers dan Bayesian A / B tes . Kedua artikel berasumsi bahwa pembuat keputusan memutuskan varian mana yang lebih baik hanya berdasarkan probabilitas beberapa kriteria, misalnya , oleh karena itu, lebih baik. Probabilitas ini …


2
Sama atau berbeda? Cara Bayesian
Katakanlah saya memiliki model berikut: Poisson ( λ ) ∼ { λ1λ2jika t < τjika t ≥ τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} Dan saya menyimpulkan posisi untuk dan λ 2 ditunjukkan di bawah ini …

2
Dapatkah iterasi MCMC setelah terbakar digunakan untuk estimasi kepadatan?
Setelah burn-in, bisakah kita langsung menggunakan iterasi MCMC untuk estimasi kepadatan, seperti dengan memplot histogram, atau estimasi kepadatan kernel? Kekhawatiran saya adalah bahwa iterasi MCMC belum tentu independen, meskipun paling banyak didistribusikan secara identik. Bagaimana jika kita menerapkan penjarangan lebih lanjut pada iterasi MCMC? Kekhawatiran saya adalah bahwa iterasi MCMC …


1
Memvisualisasikan banyak distribusi miring ke kiri
Saya memiliki serangkaian distribusi miring kiri / berat yang ingin saya perlihatkan. Ada 42 distribusi di tiga faktor (diberi label A, Bdan di Cbawah). Juga, variasi menyusut antar faktor B. Masalah yang saya miliki adalah bahwa distribusinya sulit dibedakan berdasarkan skala hasil (rasio atau lipat-perubahan): Loging data tampaknya terlalu menekankan …

1
Notasi untuk pemodelan bertingkat
Formula yang perlu ditentukan untuk pelatihan model bertingkat (menggunakan lmerdari lme4 Rperpustakaan) selalu membuat saya. Saya telah membaca banyak buku pelajaran dan tutorial, tetapi tidak pernah memahaminya dengan baik. Jadi, inilah contoh dari tutorial ini yang ingin saya lihat dirumuskan dalam persamaan. Kami mencoba memodelkan frekuensi suara sebagai fungsi gender …

2
Keunggulan LASSO dibandingkan seleksi maju / eliminasi mundur dalam hal kesalahan prediksi validasi silang model
Saya mendapatkan tiga model tereduksi dari model full asli yang menggunakan seleksi ke depan eliminasi mundur Teknik hukuman L1 (LASSO) Untuk model yang diperoleh dengan menggunakan seleksi maju / eliminasi mundur, saya memperoleh estimasi kesalahan prediksi prediksi yang digunakan CVlmdalam paket yang DAAGtersedia di R. Untuk model yang dipilih melalui …


1
Rumus estimator regresi kuantitatif
Saya telah melihat dua representasi yang berbeda dari penduga regresi regresi yang Q ( βq) = ∑i : ysaya≥ x′sayaβnq∣ ysaya- x′sayaβq∣ + ∑i : ysaya&lt; x′sayaβn( 1 - q) ∣ ysaya- x′sayaβq∣Q(βq)=∑saya:ysaya≥xsaya′βnq∣ysaya-xsaya′βq∣+∑saya:ysaya&lt;xsaya′βn(1-q)∣ysaya-xsaya′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.