Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Secara intuitif, bagaimana cara bootstrap liar bekerja?
Saya mencoba memahami intuisi di balik wild-bootstrap. Apa yang sebenarnya ia lakukan? Saya harus dapat memahami apa yang ingin dilakukan dibandingkan dengan regresi konvensional. Data saya memiliki heteroskedastisitas, dan metode yang saya gunakan melakukan 5000 ulangan. Bagaimana cara menghasilkan 5.000 data tambahan?

2
Apa yang disebut "fenomena" ini?
Di bawah ini adalah histogram dari beberapa data, nampan adalah bilangan bulat, parameter lainnya tidak relevan. Seperti yang Anda lihat, tampaknya ada dua distribusi normal yang terpisah tetapi tumpang tindih untuk angka ganjil dan genap. Probabilitas menjadi bilangan genap adalah 1/3, juga 2/3 untuk bilangan ganjil. Saya tidak memiliki gagasan …


3
Apa tujuan menggunakan pohon keputusan?
Saya tidak mengerti apa tujuan dari pohon keputusan? Cara saya melihatnya, itu adalah serangkaian if-else. Mengapa saya tidak hanya menggunakan if-else daripada menggunakan pohon keputusan? Itu karena mengurangi kompleksitas kode saya? Saya masih terhindar dari menghitung entropi dan mendapatkan informasi karena ada algoritma prebuilt untuk mereka di mana saya cukup …


3
Fungsi logistik dengan kemiringan tetapi tanpa asimtot?
Fungsi logistik memiliki rentang keluaran 0 hingga 1, dan kemiringan asimtotik nol di kedua sisi. Apa alternatif untuk fungsi logistik yang tidak rata sepenuhnya pada akhirnya? Lereng asimptotik siapa yang mendekati nol tetapi tidak nol, dan kisarannya tidak terbatas?

2
Ekspektasi bersyarat dari variabel acak seragam yang diberikan statistik pesanan
Asumsikan X =(X1,...,Xn)(X1,...,Xn)(X_1, ..., X_n) ~ U(θ,2θ)U(θ,2θ)U(\theta, 2\theta)dimana θ∈R+θ∈R+\theta \in \Bbb{R}^+. Bagaimana cara menghitung harapan bersyarat E[X1|X(1),X(n)]E[X1|X(1),X(n)]E[X_1|X_{(1)},X_{(n)}]dimana X(1)X(1)X_{(1)} dan X(n)X(n)X_{(n)} Apakah statistik pesanan terkecil dan terbesar masing-masing? Pikiran pertama saya adalah bahwa karena statistik pesanan membatasi rentang, itu sederhana (X(1)+X(n))/2(X(1)+X(n))/2(X_{(1)}+X_{(n)})/2, tetapi saya tidak yakin apakah ini benar!

3
Kapan dan menyiratkan ?
Pertanyaan: Xn→dXXn→dXX_n\stackrel{d}{\rightarrow}X danYn→dY⟹?Xn+Yn→dX+YYn→dY⟹?Xn+Yn→dX+YY_n\stackrel{d}{\rightarrow}Y \stackrel{?}{\implies} X_n+Y_n\stackrel{d}{\rightarrow}X+Y Saya tahu ini tidak berlaku secara umum; Teorema Slutsky hanya berlaku ketika satu atau kedua konvergensi dalam probabilitas. Namun, ada kasus di mana ia tidak ditahan? Misalnya, jika urutan dan independen.XnXnX_nYnYnY_n

1
Dalam regresi berganda, mengapa interaksi dimodelkan sebagai produk, dan bukan sesuatu yang lain, dari prediktor?
Pertimbangkan regresi linier berganda. Pertanyaan ini mungkin tampak sederhana, tetapi saya mencoba untuk memahami secara intuitif mengapa, katakanlah jika saya memiliki prediktor X1 dan X2, maka interaksi antara prediktor ini dapat ditangkap secara memadai oleh X1 * X2. Saya tahu istilah interaksi dimodelkan sebagai produk, hanya karena itulah yang diajarkan …

1
Apakah metode pengambilan sampel "pentingnya Gibbs" berfungsi?
Saya curiga ini adalah pertanyaan yang tidak biasa dan bersifat eksploratif, jadi tolong ajukan pertanyaan ini kepada saya. Saya bertanya-tanya apakah seseorang dapat menerapkan gagasan pentingnya pengambilan sampel untuk pengambilan sampel Gibbs. Inilah yang saya maksud: dalam pengambilan sampel Gibbs, kami mengubah nilai satu variabel (atau blok variabel) pada suatu …


2
Mengapa tidak menggunakan variabel instrumental secara langsung sebagai kovariat dalam regresi?
Saya tahu ini adalah pertanyaan konyol, karena saya tahu teori variabel instrumental dan regresi dua tahap. Namun, saya tidak pernah melihat jawaban yang jelas untuk hal berikut: menganggap Anda memiliki endogenitas karena variabel tidak teramati berkorelasi dengan salah satu regresi awal. Cara khas untuk memperbaikinya adalah dengan menemukan variabel instrumen …

2
Apa yang Silverman (1981) maksudkan dengan 'bandwidth kritis'?
Dalam pemilihan bandwidth untuk Pengukur Densitas Kernel, bandwidth kritis menurut pemahaman saya adalah: "Untuk setiap bilangan bulat k, di mana 1<k<n, kita dapat menemukan lebar minimum h(k)sedemikian rupa sehingga estimasi kepadatan kernel paling banyak k maxima. Silverman menyebut h(k)nilai - nilai ini " lebar kritis. " Saya tidak memahami konsep …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.