Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Bias seleksi di pohon
Dalam Applied Predictive Modelling oleh Kuhn dan Johnson penulis menulis: Akhirnya, pohon-pohon ini menderita bias seleksi: prediktor dengan jumlah nilai berbeda yang lebih tinggi lebih disukai daripada prediktor lebih granular (Loh dan Shih, 1997; Carolin et al., 2007; Loh, 2010). Loh dan Shih (1997) mengatakan bahwa “Bahaya terjadi ketika kumpulan …
8 cart  bias 




1
Hapus distribusi yang diukur dari distribusi lain
Ambil berkas partikel sebagai ansambel banyak partikel. Asumsikan dua variabel acak independenXβXβX_\beta dan δδ\delta yang menambahkan hingga posisi horizontal XXX partikel: X=Xβ+DxδX=Xβ+Dxδ X = X_\beta + D_x \delta (DxDxD_x adalah angka sederhana, fungsi "dispersi" dalam dinamika balok.) Saya memiliki pengukuran horisontal profil balok, fXfXf_X, dan pengukuran lain dari profil momentum …


1
Apakah transformasi monoton yang dapat dibalik dari interval kepercayaan memberi Anda interval kepercayaan (pada tingkat yang sama) di ruang yang diubah?
Seharusnya (a,b)(a,b) (a,b) adalah interval kepercayaan level untuk parameter . Misalkan adalah transformasi monoton yang tidak dapat dibalik. Lalu, adalah(1−α)(1−α)(1-\alpha)θθ\thetaηη\eta (η(a),η(b))(η(a),η(b)) \left (\eta(a), \eta(b) \right ) a tingkat interval kepercayaan untuk ? Asumsikan parameter dan titik akhir interval kepercayaan adalah bilangan real.(1−α)(1−α)(1-\alpha)η(θ)η(θ)\eta(\theta) Jawabannya tampaknya secara intuitif adalah "Ya" untuk alasan …

1
Dugaan terkait dengan Hukum Kolmogorov 0-1 (untuk acara)
Biarkan menjadi ruang probabilitas. Dugaan:(Ω,F,P)(Ω,F,P)(\Omega, \mathscr F, \mathbb P) Misalkan kita memiliki acara st , atau . Terdapat rangkaian acara yang independen stA1,A2,...A1,A2,...A_1, A_2, ...∀ A∈⋂nσ(An,An+1,...)∀ A∈⋂nσ(An,An+1,...)\forall \ A \in \bigcap_n \sigma(A_n, A_{n+1}, ...)P(A)=0P(A)=0P(A) = 0111B1,B2,...B1,B2,...B_1, B_2, ... τAn:=⋂nσ(An,An+1,...)=⋂nσ(Bn,Bn+1,...):=τBnτAn:=⋂nσ(An,An+1,...)=⋂nσ(Bn,Bn+1,...):=τBn\tau_{A_n} := \bigcap_n \sigma(A_n, A_{n+1}, ...) = \bigcap_n \sigma(B_n, B_{n+1}, ...) := …

1
Bisakah seseorang menghitung autokorelasi matriks kovarian sampel oleh MCMC?
Bayangkan bahwa kita mengambil sampel matriks kovarians dari distribusi Wishart oleh MCMC. Pada setiap iterasi, kami mendapatkan matriks sampel dari distribusi Wishart.SsayaSiS_i Pertanyaan : Mengingat jejak yang berisi semua sampel , dapatkah saya memplot korelasi otomatis sampel ini?S1, . . .SnS1,...SnS_1,...S_n Saya telah melihat seseorang menggunakan autocorrelation of , tetapi …

2
Memahami proyeksi linear dalam "Elemen Pembelajaran Statistik"
Dalam buku "Elemen-elemen Pembelajaran Statistik" pada bab 2 ("model linear dan kuadrat terkecil; halaman no: 12"), tertulis bahwa Dalam (p + 1) ruang input-output dimensi, (X, Y) mewakili hyperplane. Jika konstanta termasuk dalam X, maka hyperplane menyertakan asal dan merupakan subruang; jika tidak, itu adalah set affine yang memotong sumbu …

1
(Referensi) Bagaimana cara mendapatkan model desain eksperimental, bukan hanya menghafalnya?
Di kelas Metode Statistik MS-level yang saya ambil, saya telah belajar tentang berbagai model linier untuk desain eksperimental. Ambil, misalnya, untuk model Rancangan Blok Lengkap Acak (RCBD) acak ( mewakili blok, mewakili perawatan), mewakili efek blok, efek pengobatan (tetap), mengikuti beberapa distribusi .Yij=μ+βi+τj+εij,Yij=μ+βi+τj+εij,Y_{ij} = \mu + \beta_i + \tau_j + …

1
OLS vs kemungkinan maksimum dalam distribusi normal dalam regresi linier
Saya menemukan bahwa untuk model regresi linier sederhana, baik OLS dan metode kemungkinan maksimum (dengan asumsi distribusi Normal) memberikan output yang sama (nilai parameter). Dari sini, dapatkah kita mengatakan bahwa OLS juga membuat asumsi implisit tentang distribusi Normal atau sebaliknya? Saya tidak tertarik mengapa keduanya menghasilkan nilai yang sama tetapi …


3
Pengecekan Gradien Angka: Seberapa dekat cukup dekat?
Saya membuat jaringan saraf convolutional dan saya ingin memeriksa bahwa gradien saya dihitung dengan benar menggunakan pengecekan gradien numerik. Pertanyaannya, seberapa dekat cukup dekat? Fungsi pengecekan saya hanya memuntahkan turunan yang dihitung, turunan yang diperkirakan secara numerik, perbedaan antara keduanya, dan apakah kedua nilai tersebut memiliki tanda yang sama (satu …

1
Menghitung rasio risiko menggunakan rasio odds dari koefisien regresi logistik
Saya memiliki regresi logistik biner dengan hanya satu prediktor faktor tetap biner. Alasan saya tidak melakukannya sebagai Chi square atau tes Fisher adalah karena saya juga memiliki sejumlah faktor acak (ada beberapa titik data per individu dan individu dalam kelompok, meskipun saya tidak peduli dengan koefisien atau signifikansi untuk variabel-variabel …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.