Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Dimungkinkan untuk mengevaluasi GLM dengan Python / scikit-belajar menggunakan distribusi Poisson, Gamma, atau Tweedie sebagai keluarga untuk distribusi kesalahan?
Mencoba mempelajari beberapa Python dan Sklearn, tetapi untuk pekerjaan saya, saya perlu menjalankan regresi yang menggunakan distribusi kesalahan dari keluarga Poisson, Gamma, dan terutama Tweedie. Saya tidak melihat apa pun dalam dokumentasi tentang mereka, tetapi mereka berada di beberapa bagian dari distribusi R, jadi saya bertanya-tanya apakah ada yang melihat …


1
Bagaimana cara membentuk kurva Precision-Recall ketika saya hanya memiliki satu nilai untuk PR?
Saya memiliki tugas penambangan data di mana saya membuat sistem pengambilan gambar berbasis konten. Saya memiliki 20 gambar dari 5 hewan. Jadi total 100 gambar. Sistem saya mengembalikan 10 gambar yang paling relevan ke gambar input. Sekarang saya perlu mengevaluasi kinerja sistem saya dengan kurva Precision-Recall. Namun, saya tidak mengerti …


1
Menguji dataset besar untuk normalitas - bagaimana dan apakah ini dapat diandalkan?
Saya sedang memeriksa bagian dari dataset saya yang berisi 46840 nilai ganda mulai dari 1 hingga 1690 yang dikelompokkan dalam dua grup. Untuk menganalisis perbedaan antara kelompok-kelompok ini saya mulai dengan memeriksa distribusi nilai-nilai untuk memilih tes yang tepat. Mengikuti panduan tentang pengujian normalitas, saya melakukan qqplot, histogram & boxplot. …



2
Metode MCMC - membakar sampel?
Dalam metode MCMC , saya terus membaca tentang burn-inwaktu atau jumlah sampel "burn". Apa ini sebenarnya, dan mengapa itu dibutuhkan? Memperbarui: Setelah MCMC stabil, apakah tetap stabil? Bagaimana pengertian burn-inwaktu terkait dengan waktu pencampuran?
12 sampling  mcmc 

4
Melakukan PCA dengan hanya matriks jarak
Saya ingin mengelompokkan dataset besar yang saya hanya memiliki jarak berpasangan. Saya menerapkan algoritma k-medoid, tetapi butuh waktu terlalu lama untuk dijalankan sehingga saya ingin memulai dengan mengurangi dimensi masalah saya dengan menerapkan PCA. Namun, satu-satunya cara saya tahu untuk melakukan metode ini adalah dengan menggunakan matriks kovarians yang tidak …


1
Contoh intuitif tentang sampling penting
Latar belakang saya adalah ilmu komputer. Saya cukup baru dalam metode pengambilan sampel monte carlo dan, walaupun saya mengerti matematika, saya kesulitan menemukan contoh-contoh intuitif untuk sampling penting. Lebih tepatnya, dapatkah seseorang memberikan contoh: distribusi asli yang tidak dapat diambil sampelnya tetapi seseorang dapat memperkirakan distribusi penting yang dapat diambil …

3
Perkiraan normal untuk distribusi Poisson
Di sini, di Wikipedia dikatakan: Untuk nilai λλλ cukup besar , (katakan λ>1000λ>1000λ>1000 ), distribusi normal dengan rata-rata λλλ dan varians λλλ (standar deviasi λ−−√λ\sqrt{\lambda} ), merupakan pendekatan yang sangat baik untuk distribusi Poisson. Jika λλλ lebih besar dari sekitar 10, maka distribusi normal adalah perkiraan yang baik jika koreksi …

2
Praktik Terbaik untuk Membuat 'Data Rapi'
Hadley Wickham menulis artikel bintang yang disebut "Tidy Data" ( tautan ) di JSS tahun lalu tentang manipulasi data dan memasukkan data ke dalam kondisi "optimal" untuk melakukan analisis. Namun, saya bertanya-tanya apa praktik terbaik dalam hal menyajikan data tabular dalam pengaturan kerja? Katakanlah rekan kerja Anda meminta Anda untuk …
12 dataset  tables 

2
Mengapa Thomas Bayes menganggap teorema Bayes begitu menantang?
Ini lebih merupakan sejarah pertanyaan sains, tapi saya harap ada di topik di sini. Saya pernah membaca bahwa Thomas Bayes hanya berhasil menemukan teorema Bayes untuk kasus khusus seragam sebelumnya, dan bahkan kemudian ia berjuang dengan itu, tampaknya. Mempertimbangkan betapa sepele teorema Bayes dalam pengobatan modern, mengapa hal itu menjadi …

1

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.