Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Clopper-Pearson untuk non matematikawan
Saya bertanya-tanya apakah ada yang bisa menjelaskan kepada saya intuisi di luar Clopper-Pearson CI untuk proporsi. Sejauh yang saya tahu, setiap CI menyertakan varian di dalamnya. Namun, untuk proporsi, bahkan jika proporsi saya adalah 0 atau 1 (0% atau 100%), Clopper-Pearson CI dapat dihitung. Saya mencoba melihat formula, dan saya …

4
Estimasi kepadatan kernel menggabungkan ketidakpastian
Ketika memvisualisasikan data satu dimensi, sudah biasa menggunakan teknik Kernel Density Estimation untuk menjelaskan lebar bin yang dipilih secara tidak tepat. Ketika dataset satu dimensi saya memiliki ketidakpastian pengukuran, apakah ada cara standar untuk memasukkan informasi ini? Misalnya (dan maafkan saya jika pemahaman saya naif) KDE menggabungkan profil Gaussian dengan …

2
Identifikasi pertanyaan yang tidak berguna dari kuesioner
Saya sedang mengembangkan kuesioner. Untuk meningkatkan keandalan dan validitasnya, saya ingin menggunakan metode statistik. Saya ingin menghilangkan pertanyaan yang jawabannya selalu sama. Ini berarti bahwa hampir semua peserta memberikan jawaban yang sama pada pertanyaan-pertanyaan itu. Sekarang pertanyaan saya adalah: Apa istilah teknis untuk pertanyaan tidak berguna yang jawabannya selalu sama, …

1
Kesulitan menemukan model yang bagus cocok untuk data hitungan dengan efek campuran - ZINB atau yang lainnya?
Saya memiliki satu set data yang sangat kecil tentang kelimpahan lebah soliter yang saya kesulitan analisis. Ini menghitung data, dan hampir semua penghitungan berada dalam satu perawatan dengan sebagian besar nol dalam perawatan lainnya. Ada juga beberapa nilai yang sangat tinggi (masing-masing di dua dari enam situs), sehingga distribusi jumlah …

4
Bisakah Anda membandingkan metode pengelompokan berbeda pada dataset tanpa kebenaran dasar dengan validasi silang?
Saat ini, saya mencoba untuk menganalisis dataset dokumen teks yang tidak memiliki kebenaran dasar. Saya diberitahu bahwa Anda dapat menggunakan validasi silang k-fold untuk membandingkan berbagai metode pengelompokan. Namun, contoh-contoh yang saya lihat di masa lalu menggunakan kebenaran dasar. Apakah ada cara untuk menggunakan cara k-fold pada dataset ini untuk …

1
Inversi Berry
Saya memiliki data pasar agregat besar yang ditetapkan pada penjualan anggur di AS dan saya ingin memperkirakan permintaan anggur berkualitas tinggi tertentu. Pangsa pasar ini pada dasarnya berasal dari model utilitas acak dari bentuk mana termasuk karakteristik produk yang diamati, menunjukkan harga produk, adalah karakteristik produk yang tidak teramati yang …

2
Statistik pizza untuk massa
Entri singkat di situs NY Times menyediakan Fakta dan Angka konsumsi pizza di Amerika Serikat. Saya memiliki ketertarikan kasual pada bagaimana statistik digunakan (atau disalahgunakan) untuk memberikan informasi kepada khalayak umum, dan beberapa pertanyaan muncul berdasarkan statistik yang disajikan: Jika 1 dari 8 orang Amerika akan makan pizza hari ini, …

1
Hitung log-kemungkinan "dengan tangan" untuk regresi kuadrat terkecil nonlinier umum (nlme)
Saya mencoba menghitung log-kemungkinan untuk regresi kuadrat terkecil nonlinear umum untuk fungsi dioptimalkan olehfungsi dalam paket R, menggunakan matriks varians kovarians yang dihasilkan oleh jarak pada pohon filogenetik dengan asumsi gerakan Brown (daripaket). Kode R yang dapat direproduksi berikut cocok dengan model gnls menggunakan x, data y dan pohon acak …


5
Bagaimana kurtosis distribusi terkait dengan geometri fungsi kepadatan?
Kurtosis adalah untuk mengukur puncak dan kerataan suatu distribusi. Fungsi kepadatan distribusi, jika ada, dapat dilihat sebagai kurva, dan memiliki fitur geometris (seperti kelengkungan, konveksitas, ...) terkait dengan bentuknya. Jadi saya bertanya-tanya apakah kurtosis suatu distribusi berhubungan dengan beberapa fitur geometris dari fungsi kerapatan, yang dapat menjelaskan makna geometris kurtosis?

4
Asumsi distribusi residu regresi
Mengapa perlu menempatkan asumsi distribusi pada kesalahan, yaitu ϵ i ∼ N ( 0 , σ 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , dengan .ϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) Kenapa tidak menulis y i ~ N ( X β , σ 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , dengan ,yi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) …

1
Informasi dari matriks topi untuk regresi logistik
Jelas bagi saya, dan dijelaskan dengan baik di beberapa situs, informasi apa yang diberikan nilai-nilai pada diagonal dari matriks topi untuk regresi linier. Matriks topi dari model regresi logistik kurang jelas bagi saya. Apakah identik dengan informasi yang Anda dapatkan dari matriks yang menerapkan regresi linier? Ini adalah definisi dari …

1
Pemodelan ketika variabel dependen memiliki "cut-off"
Mohon maaf sebelumnya jika ada terminologi yang saya gunakan salah. Saya akan menerima segala koreksi. Jika apa yang saya gambarkan sebagai "cut-off" menggunakan nama yang berbeda, beri tahu saya dan saya dapat memperbarui pertanyaan. Situasi yang saya minati adalah ini: Anda memiliki variabel independen dan variabel dependen tunggal . Saya …

3
Bayesian vs MLE, masalah overfitting
Dalam buku PRML Bishop, ia mengatakan bahwa, overfitting adalah masalah dengan Estimasi Kemungkinan Maksimum (MLE), dan Bayesian dapat menghindarinya. Tapi saya pikir, overfitting adalah masalah lebih banyak tentang pemilihan model, bukan tentang metode yang digunakan untuk melakukan estimasi parameter. Yaitu, misalkan saya memiliki kumpulan data , yang dihasilkan melalui f …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.