Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Skor Kecocokan Pencocokan dengan perawatan yang bervariasi waktu
Prosedur pencocokan skor kecenderungan dasar bekerja dengan data penampang (yaitu dikumpulkan pada titik waktu tertentu). Perintah psmatch2 populer menggunakan variabel dummy yang menunjukkan bahwa pengamatan milik kelompok perlakuan atau kontrol. Namun, dalam dataset saya, fungsi indikator ini beragam waktu. Data terlihat sebagai berikut: Saya mengidentifikasi individu dan melacak mereka selama …

1
K-means sebagai batas kasus algoritma EM untuk campuran Gaussian dengan kovarian akan
Tujuan saya adalah untuk melihat bahwa algoritma K-means sebenarnya adalah algoritma Ekspektasi-Maksimalisasi untuk campuran Gaussian di mana semua komponen memiliki kovarian dalam batas sebagai .σ2Iσ2I\sigma^2 Ilimσ→0limσ→0\lim_{\sigma \to 0} Misalkan kita memiliki kumpulan data {x1,…,xN}{x1,…,xN}\{x_1, \dots ,x_N\} pengamatan dari variabel acak XXX . Fungsi objektif untuk M-means diberikan oleh: J=∑n=1N∑k=1Krnk||xn−μk||2J=∑n=1N∑k=1Krnk||xn−μk||2J = …


2
Mengapa
Kedua jawaban di utas ini, satu dan dua menyatakan bahwa harus ditransformasikan sebelum menerapkan transformasi lain pada prediktor. Memang bab Weisberg tentang transformasi lebih fokus pada DV daripada prediktor, dan begitu juga halaman manual paket mobil R PowerTransform ().YYY Namun, kita tahu bahwa normalitas distribusi DV bukanlah persyaratan dalam OLS …

2
Membuktikan Teorema TERLAMBAT dari Angrist dan Imbens 1994
Asumsikan kita memiliki instrumen biner ZiZiZ_i yang dapat digunakan untuk memperkirakan efek dari variabel endogen DiDiD_ipada hasil . Misalkan instrumen memiliki tahap pertama yang signifikan, itu ditetapkan secara acak, memenuhi batasan eksklusi, dan memenuhi monotonitas sebagaimana diuraikan dalam Angrist dan Imbens (1994). http://www.jstor.org/discover/10.2307/2951620?uid=3738032&uid=2&uid=4&sid=21104754800073YiYiY_i Mereka menyatakan bahwa probabilitas menjadi kompiler ( …

1
Mengapa probabilitas kesalahan tipe 1 dan 2 yang dapat diterima berbeda?
Pertanyaan ini diajukan oleh penyelia saya dan saya tidak tahu bagaimana menjelaskannya. Biasanya tingkat kepercayaan yang diterima adalah 0,95 yang berarti bahwa probabilitas kesalahan tipe 1 adalah 5%. Tetapi kekuatan yang biasanya diterima adalah 0,8 (Cohen, 1988) yang berarti bahwa probabilitas kesalahan tipe 2 adalah 20%. Mengapa kita dapat menerima …

1
Bagaimana cara membandingkan metode peramalan?
Saya memiliki beberapa data intermiten. Berdasarkan data tersebut, saya ingin membandingkan beberapa metode peramalan (Penghalusan Eksponensial, Moving Average, Croston, dan Syntetos-Boylan), dan memutuskan apakah Croston atau Syntetos Boylan lebih baik daripada SES atau MA untuk data berselang atau tidak. Ukuran yang ingin saya bandingkan adalah Mean Absolute Rate atau Mean …


2
Goodness of fit untuk model nonlinear
Kami telah dilengkapi fungsi nonlinier untuk data yang diamati. Langkah selanjutnya adalah penilaian kebaikan kesesuaian fungsi ini (seperti untuk model linier).R2R2R^2 Apa cara yang biasa untuk mengukur ini? Edit 1: Pemasangan dilakukan sebagai berikut: Lakukan regresi linier dengan variabel bebas A dan B . Hitung parameter distribusi dari parameter regresi. …

1
Menggunakan kata-kata topik yang dihasilkan oleh LDA untuk mewakili dokumen
Saya ingin melakukan klasifikasi dokumen dengan mewakili setiap dokumen sebagai serangkaian fitur. Saya tahu bahwa ada banyak cara: BOW, TFIDF, ... Saya ingin menggunakan Latent Dirichlet Allocation (LDA) untuk mengekstrak kata kunci topik dokumen EACH TUNGGAL. dokumen diwakili oleh kata-kata topik ini. Tapi saya tidak tahu apakah itu masuk akal …


2
Lebar bin optimal untuk histogram dua dimensi
Ada banyak aturan untuk memilih lebar nampan optimal dalam histogram 1D (lihat misalnya ) Saya mencari aturan yang menerapkan pemilihan lebar bin sama optimal pada histogram dua dimensi . Apakah ada aturan seperti itu? Mungkin salah satu aturan terkenal untuk histogram 1D dapat dengan mudah diadaptasi, jika demikian, dapatkah Anda …

1
Turunkan kepadatan posterior untuk kemungkinan lognormal dan sebelumnya Jeffreys
Fungsi likelihood dari distribusi lognormal adalah: f(x;μ,σ)∝∏ni11σxiexp(−(lnxi−μ)22σ2)f(x;μ,σ)∝∏i1n1σxiexp⁡(−(ln⁡xi−μ)22σ2)f(x; \mu, \sigma) \propto \prod_{i_1}^n \frac{1}{\sigma x_i} \exp \left ( - \frac{(\ln{x_i} - \mu)^2}{2 \sigma^2} \right ) dan Prioritas Jeffreys adalah: p(μ,σ)∝1σ2p(μ,σ)∝1σ2p(\mu,\sigma) \propto \frac{1}{\sigma^2} jadi menggabungkan keduanya memberi: f(μ,σ2|x)=∏ni11σxiexp(−(lnxi−μ)22σ2)⋅σ−2f(μ,σ2|x)=∏i1n1σxiexp⁡(−(ln⁡xi−μ)22σ2)⋅σ−2f(\mu,\sigma^2|x)= \prod_{i_1}^n \frac{1}{\sigma x_i} \exp \left ( - \frac{(\ln{x_i} - \mu)^2}{2 \sigma^2} \right ) \cdot \sigma^{-2} …

1
Nilai kuadrat R yang sangat besar dalam regresi meta (metafor)
Saya menggunakan paket metafor di R. Saya telah cocok dengan model efek acak dengan prediktor kontinu sebagai berikut SIZE=rma(yi=Ds,sei=SE,data=VPPOOLed,mods=~SIZE) Yang menghasilkan output: R^2 (amount of heterogeneity accounted for): 63.62% Test of Moderators (coefficient(s) 2): QM(df = 1) = 9.3255, p-val = 0.0023 Model Results: se zval pval ci.lb ci.ub intrcpt …

1
Apakah rstan atau perkiraan kisi saya salah: memutuskan antara taksiran kuantil yang saling bertentangan dalam inferensi Bayesian
Saya memiliki model untuk mencapai perkiraan Bayesian ukuran populasi dan probabilitas deteksi dalam distribusi binomial semata-mata berdasarkan pada jumlah obyek yang diamati yang diamati : untuk . Untuk kesederhanaan, kita asumsikan bahwa N ditetapkan pada nilai yang sama dan tidak diketahui untuk setiap y_i . Dalam contoh ini, y = …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.