Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
ATT vs ATE dalam pencocokan skor kecenderungan saat menggunakan estimasi DiD
Menurut Lee dan Little 2017 , ketika menggunakan metode skor kecenderungan (PS), pembobotan berdasarkan peluang akan menghasilkan Efek Perlakuan Rata-rata pada Orang yang Diperlakukan (ATT), sementara menggunakan subklasifikasi dan pembobotan dengan inverse probability of treatment (IPTW) akan menghasilkan efek yang diukur pada Efek Perawatan Rata-rata pada seluruh sampel (ATE). Saya …

1
Apakah ada nama yang diterima untuk metrik kesalahan ini?
Saya menemukan metrik kesalahan yang digunakan untuk menghitung kesalahan rekonstruksi model: mana adalah titik data ke- , adalah estimasi model dari titik data ke- , dan adalah rata-rata dari semua titik data. Pembilangnya adalah total kuadrat kesalahan model, dan penyebutnya adalah deviasi kuadrat dari rata-rata data.ε=∑i(yi−mi)2∑i(yi−y¯)2ε=∑i(yi−mi)2∑i(yi−y¯)2 \varepsilon = \frac{\sum_i{\left(y_i-m_i\right)^2}}{\sum_i{\left(y_i-\bar{y}\right)^2}} yiyiy_iiiimimim_iiiiy¯y¯\bar{y} …

2
Kebijakan dan kondisi konvergensi algoritma iterasi nilai
Algoritme kebijakan dan nilai iterasi dapat digunakan untuk menyelesaikan masalah proses keputusan Markov. Saya mengalami kesulitan memahami kondisi yang diperlukan untuk konvergensi. Jika kebijakan optimal tidak berubah selama dua langkah (yaitu selama iterasi i dan i +1 ), dapatkah disimpulkan bahwa algoritma telah konvergen? Jika tidak, lalu kapan?

2
Tindakan berulang ANOVA vs. ANOVA faktorial dengan faktor subjek: memahami "kesalahan strata" dan istilah Kesalahan () dalam aov
Pertimbangkan tindakan berulang ANOVA (RM-ANOVA) dengan satu faktor dalam subjek Adan beberapa pengukuran per subjek untuk setiap level A. Ini terkait erat dengan ANOVA dua arah dengan dua faktor: Adan subject. Mereka menggunakan dekomposisi identik jumlah kuadrat menjadi empat bagian: A, subject, A⋅subject, dan residual. Namun, ANOVA dua arah menguji …


1
Kegunaan praktis dari konvergensi pointwise tanpa konvergensi seragam
Motivasi Dalam konteks inferensi pasca-model-seleksi, Leeb & Pötscher (2005) menulis: Meskipun telah lama diketahui bahwa keseragaman (setidaknya secara lokal) dengan parameter adalah masalah penting dalam analisis asimptotik, pelajaran ini sering dilupakan dalam praktik sehari-hari teori ekonometrik dan statistik di mana kita sering puas untuk membuktikan hasil asimptotik secara langsung ( …


1
Mengapa jumlah autokorelasi sampel dari seri stasioner sama dengan -1/2?
Saya tidak dapat memahami kepala saya tentang properti seri stasioner ini dan fungsi autokorelasi. Saya harus membuktikannya ∑h=1n−1ρ^(h)=−12∑h=1n−1ρ^(h)=−12\begin{align} \sum_{h=1}^{n-1}\hat\rho(h)=-\frac{1}{2} \end{align} Di mana dan adalah fungsi autokovarianρ^(h)=γ^(h)γ^(0)ρ^(h)=γ^(h)γ^(0)\hat\rho(h)=\displaystyle\frac{\hat\gamma(h)}{\hat\gamma(0)}γ^(h)γ^(h)\hat\gamma(h) γ^(h)=1n∑t=1n−h(Xt−X¯)(Xt+h−X¯)γ^(h)=1n∑t=1n−h(Xt−X¯)(Xt+h−X¯)\begin{align} \hat\gamma(h) = \frac{1}{n}\sum_{t=1}^{n-h}(X_t-\bar{X})(X_{t+h}-\bar{X}) \end{align} Semoga seseorang dapat membantu saya dengan bukti, atau setidaknya mengarahkan saya ke arah yang benar.

2
Apakah saya tetap bisa meninggalkan pengamatan yang hilang?
Saya memiliki dataset yang melihat aplikasi imigrasi dan penerimaan visa (pemberian visa). Tarif dihitung untuk aplikasi visa yang "diterima" dan "ditolak". Namun, dataset juga memiliki nilai untuk kasus yang ditutup. Biasanya ini adalah ketika imigran berhenti muncul untuk janji, bermigrasi ke tempat lain, atau meninggal. Karena angka-angka ini tidak digunakan …

3
Apakah artikel NYT ini salah mengasumsikan kenaikan independen?
Artikel ini memplot untuk setiap 100 wanita yang menggunakan metode kontrasepsi jenis tertentu dari jumlah kehamilan yang tidak direncanakan dari waktu ke waktu. https://www.nytimes.com/interactive/2014/09/14/sunday-review/unplanned-pregnancies.html?_r=0 Khususnya di akhir artikel mereka mengatakan: Jumlahnya dihitung sebagai berikut: P(Not pregnant after year N)=P(Not pregnant after year 1)NP(Not pregnant after year N)=P(Not pregnant after year …

1
Sebelum Jeffreys untuk distribusi Beta
Jika kemungkinan saya memiliki bentuk distribusi beta, dan saya ingin menggunakan Jeffreys 'sebelumnya untuk parameternya, seperti apa bentuk sebelumnya? Untuk beberapa distribusi cukup mudah untuk menghitung. misalnya, dalam kasus binomial, ekspektasi turunan kedua jelas memberi Anda . Tetapi jika kemungkinan itu sendiri sudah memiliki bentuk beta, saya tersesat saat mencoba …

1
L2-regularisasi vs penyusutan efek acak
Sifat mendasar dari regresi efek-acak adalah bahwa estimasi intersep acak "menyusut" terhadap rata-rata keseluruhan respons sebagai fungsi dari varian relatif masing-masing estimasi. U^j=ρjy¯j+(1−ρj)y¯U^j=ρjy¯j+(1−ρj)y¯\hat{U}_j = \rho_j \bar{y}_j + (1-\rho_j)\bar{y} manaρj=τ2/(τ2+σ2/nj).ρj=τ2/(τ2+σ2/nj).\rho_j = \tau^2 / (\tau^2 + \sigma^2/n_j). Ini juga kasus dengan model campuran linier umum (GLMMs) seperti regresi logistik. Bagaimana susut itu …


3
Dalam regresi Ridge dan LASSO, mengapa lebih kecil
Adakah yang bisa memberikan pandangan intuitif tentang mengapa lebih baik memiliki beta yang lebih kecil? Untuk LASSO saya bisa mengerti itu, ada komponen pemilihan fitur di sini. Lebih sedikit fitur membuat model lebih sederhana dan karena itu lebih kecil kemungkinannya untuk pas. Namun, untuk punggungan, semua fitur (faktor) disimpan. Hanya …

2
Apakah teknik meningkatkan menggunakan suara seperti metode ansambel lainnya?
Bisakah kita menggeneralisasi semua metode ansambel dengan menggunakan voting? Apakah metode peningkatan juga menggunakan pemungutan suara untuk memasukkan siswa yang lemah ke dalam model akhir? Pemahaman saya tentang teknik ini: Boosting: Terus menambahkan pelajar yang lemah untuk meningkatkan poin data yang tidak diklasifikasikan dengan benar. Teknik ensemble: Menggunakan banyak pelajar …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.