Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Jika susut diterapkan dengan cara yang cerdas, apakah itu selalu bekerja lebih baik untuk penduga yang lebih efisien?
Misalkan saya memiliki dua estimator dan yang merupakan estimator konsisten dari parameter yang sama dan sedemikian rupa sehingga dengan dalam arti psd. Dengan demikian, asymptotically lebih efisien daripada . Kedua penaksir ini didasarkan pada fungsi kerugian yang berbeda. β 2β0√βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0V1≤V2 β 1 β 2n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 …


1
Regresi logistik untuk data dari distribusi Poisson
Dari beberapa catatan pembelajaran mesin yang berbicara tentang beberapa metode klasifikasi diskriminatif, khususnya regresi logistik, di mana y adalah label kelas (0 atau 1) dan x adalah datanya, dikatakan bahwa: jika , dan , maka akan menjadi logistik.x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0)x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 \sim \mathrm{Poisson}(λ_1)p(y|x)p(y|x)p(y|x) Mengapa ini benar?

2
Apa yang terjadi pada rasio kemungkinan karena semakin banyak data yang dikumpulkan?
Biarkan , dan menjadi densitas dan anggap Anda memiliki , . Apa yang terjadi dengan rasio kemungkinan sebagai ? (Apakah itu bertemu? Untuk apa?)fffggghhhxi∼hxi∼hx_i \sim hi∈Ni∈Ni \in \mathbb{N}∏i=1nf(xi)g(xi)∏i=1nf(xi)g(xi) \prod_{i=1}^n \frac{f(x_i)}{g(x_i)} n→∞n→∞n \rightarrow \infty Sebagai contoh, kita dapat mengasumsikan . Kasus umum juga menarik.h=gh=gh = g

3
Contoh tandingan di mana Median berada di luar [Mode-Mean]
Ini artikel di atas liga saya tapi itu berbicara tentang topik yang saya tertarik, hubungan antara rata-rata, modus dan median. Ia mengatakan : Dipercaya secara luas bahwa median distribusi unimodal adalah "biasanya" antara mean dan mode. Namun, ini tidak selalu benar ... Pertanyaan saya : dapatkah seseorang memberikan contoh distribusi …
11 mean  median  mode 

2
Cara mulai membangun model regresi ketika prediktor yang paling kuat terkait adalah biner
Saya memiliki kumpulan data yang berisi 365 observasi dari tiga variabel yaitu pm, tempdan rain. Sekarang saya ingin memeriksa perilaku pmdalam menanggapi perubahan dalam dua variabel lainnya. Variabel saya adalah: pm10 = Respon (tergantung) temp = prediktor (independen) rain = prediktor (independen) Berikut ini adalah matriks korelasi untuk data saya: …

3
Estimasi parameter Bayesian atau pengujian hipotesis Bayesian?
Tampaknya ada perdebatan yang sedang berlangsung dalam komunitas Bayesian tentang apakah kita harus melakukan estimasi parameter Bayesian atau pengujian hipotesis Bayesian. Saya tertarik meminta pendapat tentang ini. Apa kekuatan dan kelemahan relatif dari pendekatan ini? Dalam konteks mana yang lebih tepat dari yang lain? Haruskah kita melakukan estimasi parameter dan …


1
Menghitung interval kepercayaan untuk mode?
Saya mencari referensi tentang menghitung interval kepercayaan untuk mode (secara umum). Bootstrap mungkin tampaknya menjadi pilihan pertama yang wajar, tetapi seperti yang dibahas oleh Romano (1988), bootstrap standar gagal untuk mode dan itu tidak memberikan solusi sederhana. Apakah ada yang berubah sejak tulisan ini? Apa cara terbaik untuk menghitung interval …


2
Memahami Gelman & Carlin "Beyond Power Calculations: ..." (2014)
Saya membaca Gelman & Carlin "Beyond Power Calculations: Menilai Tipe S (Sign) dan Tipe M (Magnitude) Errors" (2014). Saya mencoba memahami ide utama, takeway utama, tetapi saya bingung. Adakah yang bisa membantu saya menyaring esensinya? Makalahnya kira-kira seperti ini (jika saya memahaminya dengan benar). Studi statistik dalam psikologi sering diganggu …


4
Apa cara yang lebih tepat untuk membuat set penahan: untuk menghapus beberapa mata pelajaran atau untuk menghapus beberapa pengamatan dari setiap mata pelajaran?
Saya memiliki dataset dengan 26 fitur dan 31000 baris. Ini adalah dataset dari 38 subjek. Ini untuk sistem biometrik. Jadi saya ingin dapat mengidentifikasi mata pelajaran. Untuk memiliki set pengujian, saya tahu saya harus menghapus beberapa nilai. Jadi apa yang lebih baik untuk dilakukan dan mengapa? (a) simpan 30 subjek …

3
Keandalan kurva yang dipasang?
Saya ingin memperkirakan ketidakpastian atau keandalan kurva yang dipasang. Saya sengaja tidak menyebutkan jumlah matematis yang tepat yang saya cari, karena saya tidak tahu apa itu. Di sini (energi) adalah variabel dependen (respons) dan (volume) adalah variabel independen. Saya ingin mencari kurva Energy-Volume, , dari beberapa bahan. Jadi saya membuat …

1
Mengapa banyak pilihan K menurunkan nilai validasi silang saya?
Bermain-main dengan Boston Housing Dataset dan RandomForestRegressor(parameter w / default) di scikit-belajar, saya melihat sesuatu yang aneh: skor validasi silang menurun ketika saya meningkatkan jumlah lipatan di atas 10. Strategi validasi silang saya adalah sebagai berikut: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... di mana num_cvsbervariasi. …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.