Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Hutan Acak dalam pengaturan Big Data
Saya memiliki dataset dengan 5.818.446 baris dan 51 kolom, di mana 50 di antaranya adalah prediktor. Respons saya kuantitatif, jadi saya tertarik dengan model regresi. Saya mencoba menyesuaikan hutan acak dengan data saya menggunakan paket tanda sisipan. Namun, saya tidak memiliki cukup RAM untuk melakukannya. Saya sudah mencari solusi untuk …

1
Menafsirkan koefisien regresi berdasarkan metode penskalaan Andrew Gelman
Saya memiliki dua prediktor dalam model regresi logistik biner: Satu biner dan satu kontinu. Tujuan utama saya adalah membandingkan koefisien dua prediktor dalam model yang sama. Saya telah menemukan saran Andrew Gelman untuk membakukan variabel input regresi berkelanjutan: I) Usulan awal (2008): bagi prediktor kontinu dengan 2 SD Original manuscript: …

2
Secara adaptif memilih jumlah replikasi bootstrap
Seperti kebanyakan metode Monte Carlo, aturan untuk bootstrap adalah bahwa semakin besar jumlah ulangan, semakin rendah kesalahan Monte Carlo. Tetapi ada pengembalian yang semakin berkurang, jadi tidak masuk akal untuk menjalankan sebanyak mungkin ulangan yang Anda bisa. Misalkan Anda ingin memastikan bahwa perkiraan Anda θ^θ^\hat θ dari jumlah tertentu θθθ …
8 bootstrap 

2
Bagaimana cara mewakili variabel perbedaan dengan benar di DAG?
Jika saya tertarik pada efek sebab akibat dari perubahan dalam suatu variabel (EEE) pada beberapa hasil (OOO), bagaimana saya menyatakan bahwa dalam grafik asiklik terarah (DAG)? Seharusnya ΔE2=E2−E1ΔE2=E2−E1\Delta E_2 = E_2 - E_1dimana E1E1E_1 & E2E2E_2 terjadi pada waktu 1 & 2, apakah DAG yang benar adalah: 1. Dengan asumsi …

1
Mesin dukungan vektor (SVM) adalah batas suhu nol dari regresi logistik?
Baru-baru ini saya berdiskusi singkat dengan seorang teman yang berpengetahuan luas yang menyebutkan bahwa SVM adalah batas suhu nol dari regresi logistik. Alasannya melibatkan polytopes marginal dan dualitas fenchel. Saya tidak bisa mengikuti. Apakah pernyataan tentang SVM ini sebagai batas suhu nol dari regresi logistik benar? Dan jika demikian, dapatkah …


1
Interval prediksi untuk hasil regresi logistik dengan respons binomial
Misalkan kita memiliki model regresi logistik: P(y=1|x)log(p1−p)=p= β xP(y=1|x)=halcatatan⁡(hal1-hal)=βx\begin{align} P(y=1\vert\mathbf{x}) &= p \\ \log\left(\frac{p}{1-p}\right) &= \boldsymbol{\beta}\mathbf{x} \end{align} Diberikan sampel acak D = { X,y}D={X,y}D=\{\mathbf{X},\mathbf{y}\} dengan ukuran NNN , kita dapat menghitung interval kepercayaan untuk ββ\boldsymbol{\beta} dan interval prediksi yang sesuai untuk phalp , dengan nilai tertentu x∗x∗\mathbf{x}^* dari vektor prediktor. …

1
Distribusi
Saya sedang mengerjakan masalah berikut: Biarkan dan menjadi variabel acak independen dengan kerapatan bersama mana . Biarkan U = \ min (X, Y) dan V = \ maks (X, Y) . Cari kepadatan bersama (U, V) dan karenanya menemukan pdf dari U + V .XXXYYYf(x)=αβ−αxα−110&lt;x&lt;βf(x)=αβ−αxα−110&lt;x&lt;βf(x)=\alpha\beta^{-\alpha}x^{\alpha-1}\mathbf1_{0<x<\beta}α⩾1α⩾1\alpha\geqslant1U=min(X,Y)U=min(X,Y)U=\min(X,Y)V=max(X,Y)V=max(X,Y)V=\max(X,Y)(U,V)(U,V)(U,V)U+VU+VU+V Sebagai U+V=X+YU+V=X+YU+V=X+Y , saya hanya …


1
Jarak minimum yang diharapkan dari suatu titik dengan kepadatan yang bervariasi
Saya melihat bagaimana jarak Euclidean minimum yang diharapkan antara titik-titik seragam acak dan titik asal berubah saat kami meningkatkan kepadatan titik-titik acak ( titik per unit persegi ) di sekitar titik asal. Saya telah berhasil menemukan hubungan antara keduanya yang digambarkan sebagai berikut: Expected Min Distance=12Density−−−−−−√Expected Min Distance=12Massa jenis\text{Expected Min …

3
Apa hal terburuk yang dapat terjadi ketika asumsi homoscedasticity dilanggar di ANOVA?
Ini adalah pertanyaan tindak lanjut yang saya miliki setelah meninjau posting ini: Perbedaan dalam uji statistik rata-rata untuk data heteroscedastic yang tidak normal? Untuk lebih jelasnya, saya meminta dari perspektif pragmatis (bukan untuk menyarankan bahwa tanggapan teoritis tidak diterima). Ketika normalitas antara kelompok-kelompok yang hadir (yang berbeda dari judul pertanyaan …

2
Bisakah lebih besar dari 1?
The Wikipedia halaman di R2 kata dapat mengambil lebih besar nilai dari 1. Saya tidak melihat bagaimana hal ini mungkin.R2R2R^2 Nilai luar rentang 0 hingga 1 dapat terjadi di mana ia digunakan untuk mengukur kesepakatan antara nilai yang diamati dan yang dimodelkan dan di mana nilai "yang dimodelkan" tidak diperoleh …


2
Poin teknis tentang konvergensi dengan harapan bersyarat
Saya memiliki urutan variabel non-negatif seperti: XnXnX_nE(Xn|Cn)=Cnn2E(Xn|Cn)=Cnn2E(X_n|C_n)=\frac{C_n}{n^2} di mana adalah urutan variabel acak yang konvergen hampir pasti ke .CnCnC_n111 Bisakah saya menyimpulkan cenderung ke 0 hampir pasti?XnXnX_n Catatan: Anda dapat mengganti dengan urutan apa pun dengan jumlah terbatas. Pertanyaannya pada dasarnya tetap sama dan jawaban yang diberikan oleh Jason sama …

1
Mengapa MAP bertemu dengan MLE?
Dalam "pembelajaran mesin Kevin Murphy: Perspektif probabilistik", bab 3.2, penulis menunjukkan pembelajaran konsep Bayesian pada contoh yang disebut "permainan angka": Setelah mengamati NNN sampel dari {1,...,100}{1,...,100}\{1,...,100\}, kami ingin memilih hipotesis hhhyang paling menggambarkan aturan yang menghasilkan sampel. Misalnya "bilangan genap" atau "bilangan prima". Estimasi a-posteriori maksimum dan kemungkinan maksimum didefinisikan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.