Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Mengapa tidak bekerja CLT untuk
Jadi kita tahu bahwa jumlah nnn poissons dengan parameter λλ\lambda sendiri merupakan poisson dengan nλnλn\lambda . Jadi hipotetis, salah satu bisa mengambil x∼poisson(λ=1)x∼poisson(λ=1)x \sim poisson(\lambda = 1) dan mengatakan itu sebenarnya ∑n1xi∼poisson(λ=1)∑1nxi∼poisson(λ=1)\sum_1^n x_i \sim poisson(\lambda = 1) di mana setiap xixix_i adalah: xi∼poisson(λ=1/n)xi∼poisson(λ=1/n)x_i \sim poisson(\lambda = 1/n) , dan mengambil …



2
Keadaan seni secara umum belajar dari data di '69
Saya mencoba memahami konteks buku Minsky dan Papert yang terkenal "Perceptrons" dari tahun 1969, sangat penting untuk jaringan saraf. Sejauh yang saya tahu, belum ada algoritma pembelajaran terawasi generik lainnya kecuali untuk perceptron: pohon keputusan mulai menjadi benar-benar berguna hanya pada akhir 70-an, hutan acak dan SVM adalah 90-an. Tampaknya …

1
Caret - Validasi silang K-fold berulang vs Validasi silang K-fold bersarang, berulang kali n-kali
The tanda sisipan paket perpustakaan R brilian untuk membangun beberapa model pembelajaran mesin, dan memiliki beberapa fungsi untuk model bangunan dan evaluasi. Untuk pengaturan parameter dan pelatihan model, paket caret menawarkan 'repeatcv' sebagai salah satu metode. Sebagai praktik yang baik, penyetelan parameter dapat dilakukan menggunakan validasi silang K-fold bersarang yang …

1
Haruskah validasi silang berulang digunakan untuk menilai model prediksi?
Saya menemukan artikel 2012 ini oleh Gitte Vanwinckelen dan Hendrik Blockeel yang mempertanyakan kegunaan berulang cross-validation, yang telah menjadi teknik populer untuk mengurangi varian cross-validation. Para penulis menunjukkan bahwa sementara validasi silang berulang mengurangi variasi prediksi model, karena dataset sampel yang sama sedang di-resampling, rata-rata estimasi validasi silang yang di-resvergen …

2
Mengapa itu disebut "standar" penyimpangan?
Saya punya pertanyaan sederhana - dan mungkin jelas sepele: mengapa standar deviasi disebut " standar "? Apakah ini karena ia menstandarkan perbandingan set dan hasil data sehubungan dengan penyebarannya? Pencarian di Stack Exchange tidak muncul pertanyaan ini, juga pencarian Google pada etimologi dari istilah menghasilkan banyak nilai.

2
Mengapa regresi ridge tidak menyusutkan beberapa koefisien menjadi nol seperti laso?
Saat menjelaskan regresi LASSO, diagram berlian dan lingkaran sering digunakan. Dikatakan bahwa karena bentuk kendala dalam LASSO adalah berlian, solusi kuadrat terkecil yang diperoleh mungkin menyentuh sudut berlian sedemikian rupa sehingga menyebabkan penyusutan beberapa variabel. Namun, dalam regresi ridge, karena itu adalah sebuah lingkaran, seringkali tidak akan menyentuh sumbu. Saya …



3
Dua model tahap: Perbedaan antara model Heckman (untuk berurusan dengan pemilihan sampel) dan variabel Instrumental (untuk berurusan dengan endogenitas)
Saya mencoba mencari tahu perbedaan antara pemilihan sampel dan endogenitas dan pada gilirannya bagaimana model Heckman (untuk menangani pemilihan sampel) berbeda dari regresi variabel instrumental (untuk menangani endogenitas). Apakah benar untuk mengatakan bahwa pemilihan sampel adalah bentuk endogenitas tertentu, di mana variabel endogen adalah kemungkinan diperlakukan? Juga, bagi saya tampaknya …

1
Pearson VS Deviance Residuals dalam regresi logistik
Saya tahu bahwa residual Pearson terstandarisasi diperoleh dengan cara probabilistik tradisional: ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} dan Deviance Residuals diperoleh melalui cara yang lebih statistik (kontribusi setiap titik terhadap kemungkinan): di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} di mana = 1 jika = 1 dan = -1 …


2
Mengapa log-mentransformasikan data sebelum melakukan analisis komponen utama?
Saya mengikuti tutorial di sini: http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/ untuk mendapatkan pemahaman yang lebih baik tentang PCA. Tutorial menggunakan dataset Iris dan menerapkan transformasi log sebelum ke PCA: Perhatikan bahwa dalam kode berikut ini kami menerapkan transformasi log ke variabel kontinu seperti yang disarankan oleh [1] dan mengatur centerdan scalesama dengan TRUEdalam panggilan …

4
Kesalahpahaman nilai-P?
Jadi saya sudah banyak membaca tentang bagaimana menafsirkan nilai-P dengan benar, dan dari apa yang saya baca, nilai-p mengatakan TIDAK ADA tentang kemungkinan bahwa hipotesis nol benar atau salah. Namun, ketika membaca pernyataan berikut: Nilai p menunjukkan kemungkinan membuat kesalahan tipe I, atau menolak hipotesis nol ketika itu benar. Semakin …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.