Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Apa dimensi VC dari pohon keputusan?
Apa dimensi VC dari pohon keputusan dengan k terbagi dalam dua dimensi? Katakanlah modelnya adalah CART dan satu-satunya pemisahan yang dibiarkan sejajar dengan sumbu. Jadi untuk satu split kita dapat memesan 3 poin dalam segitiga dan kemudian untuk setiap pelabelan poin kita bisa mendapatkan prediksi sempurna (yaitu: poin hancur) Tapi …

1
mensimulasikan sampel acak dengan MLE yang diberikan
Pertanyaan yang Divalidasi Lintas ini menanyakan tentang mensimulasikan sampel dengan syarat jumlah tetap mengingatkan saya pada masalah yang dibuat oleh George Casella . f(x|θ)f(x|θ)f(x|\theta)(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θθ\thetaθ^(x1,…,xn)=argmin∑i=1nlogf(xi|θ)θ^(x1,…,xn)=arg⁡min∑i=1nlog⁡f(xi|θ)\hat{\theta}(x_1,\ldots,x_n)=\arg\min \sum_{i=1}^n \log f(x_i|\theta)θθ\theta θ (X1,...,Xn)(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θ^(X1,…,Xn)θ^(X1,…,Xn)\hat{\theta}(X_1,\ldots,X_n) Misalnya, ambil distribusi , dengan parameter lokasi , yang densitasnya adalah Jika bagaimana kita bisa mensimulasikan tergantung pada \ hat {\ …



1
Bagaimana memperlakukan prediktor kategoris di LASSO
Saya menjalankan LASSO yang memiliki beberapa prediktor variabel variabel dan beberapa yang kontinu. Saya punya pertanyaan tentang variabel kategori. Langkah pertama yang saya mengerti adalah memecah mereka masing-masing menjadi boneka, membakukan mereka untuk hukuman yang adil, dan kemudian mundur. Beberapa opsi muncul untuk merawat variabel dummy: Masukkan semua kecuali satu …

2
Apa hubungan di balik Jeffreys Priors dan transformasi penstabilan varian?
Saya membaca tentang Jeffreys sebelum di wikipedia: Jeffreys Prior dan melihat bahwa setelah setiap contoh, ini menggambarkan bagaimana transformasi penstabilan varian mengubah Jeffrey sebelum menjadi seragam sebelumnya. Sebagai contoh, untuk kasus Bernoulli, menyatakan bahwa untuk koin yang kepala dengan probabilitas γ∈[0,1]γ∈[0,1]\gamma \in [0,1] , Bernoulli Model uji coba hasil bahwa …

1
Apakah BIC mencoba menemukan model yang benar?
Pertanyaan ini adalah tindak lanjut atau upaya untuk menjernihkan kemungkinan kebingungan mengenai topik yang saya dan banyak orang lain temukan agak sulit, mengenai perbedaan antara AIC dan BIC. Dalam jawaban yang sangat bagus oleh @Dave Kellen tentang topik ini ( /stats//a/767/30589 ) kita membaca: Pertanyaan Anda menyiratkan bahwa AIC dan …


3
Algoritma optimisasi mana yang digunakan dalam fungsi glm di R?
Seseorang dapat melakukan regresi logit di R menggunakan kode seperti: > library(MASS) > data(menarche) > glm.out = glm(cbind(Menarche, Total-Menarche) ~ Age, + family=binomial(logit), data=menarche) > coefficients(glm.out) (Intercept) Age -21.226395 1.631968 Sepertinya algoritme pengoptimalan telah terkonvergensi - ada informasi tentang jumlah langkah algoritme penilaian skor: Call: glm(formula = cbind(Menarche, Total - …

1
Memperbarui dekomposisi SVD setelah menambahkan satu baris baru ke matriks
Misalkan saya memiliki matriks padat AA \textbf{A} dari m×nm×nm \times n ukuran, dengan SVD dekomposisiDalam Aku dapat menghitung SVD sebagai berikut: .A=USV⊤.A=USV⊤.\mathbf{A}=\mathbf{USV}^\top.Rsvd(A) Jika baris baru ditambahkan ke , dapatkah seseorang menghitung dekomposisi SVD baru berdasarkan yang lama (yaitu dengan menggunakan , , dan ), tanpa menghitung ulang SVD dari awal?A …

2
Masalah estimasi yang mustahil?
Pertanyaan Varian dari distribusi binomial negatif (NB) selalu lebih besar dari rata-rata. Ketika rata-rata sampel lebih besar dari variansnya, mencoba menyesuaikan parameter NB dengan kemungkinan maksimum atau dengan estimasi momen akan gagal (tidak ada solusi dengan parameter hingga). Namun, ada kemungkinan bahwa sampel yang diambil dari distribusi NB memiliki rata-rata …

2
Clustering - Intuisi di balik Teorema Imposibilitas Kleinberg
Saya sudah berpikir tentang menulis posting blog tentang analisis yang menarik ini oleh Kleinberg (2002) yang mengeksplorasi kesulitan pengelompokan. Kleinberg menguraikan tiga desiderata yang tampaknya intuitif untuk fungsi pengelompokan dan kemudian membuktikan bahwa tidak ada fungsi tersebut. Ada banyak algoritma pengelompokan yang memuaskan dua dari tiga kriteria; Namun, tidak ada …

2
Mengapa CDF sampel terdistribusi secara seragam
Saya membaca di sini bahwa diberi sampel dari distribusi kontinu dengan cdf , sampel yang sesuai dengan mengikuti distribusi seragam standar.F X U i = F X ( X i )X1,X2,...,XnX1,X2,...,Xn X_1,X_2,...,X_n FXFX F_X Ui=FX(Xi)Ui=FX(Xi) U_i = F_X(X_i) Saya telah memverifikasi ini menggunakan simulasi kualitatif dengan Python, dan saya dengan …
17 pdf  uniform  cdf  intuition 


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.