Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Analisis garis waktu
Saya sedang melakukan penelitian tentang hubungan antara urutan kelahiran seseorang dan risiko obesitas di kemudian hari menggunakan data dari beberapa kohort kelahiran 1 tahun (mis. Http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/ ). Tantangan utama adalah bahwa urutan kelahiran terkait dengan fitur-fitur lain seperti usia ibu, jumlah saudara kandung yang lebih muda dan / atau lebih …
10 timelines 


3
Bagaimana memvisualisasikan kebaikan Bayesian of fit untuk regresi logistik
Untuk masalah regresi logistik Bayesian, saya telah membuat distribusi prediksi posterior. Saya sampel dari distribusi prediktif dan menerima ribuan sampel (0,1) untuk setiap pengamatan yang saya miliki. Memvisualisasikan kebaikan tidak terlalu menarik, misalnya: Plot ini menunjukkan 10 000 sampel + titik datum yang diamati (cara di sebelah kiri dapat melihat …

3
Menetapkan label kelas untuk klaster k-means
Saya punya pertanyaan yang sangat mendasar tentang pengelompokan. Setelah saya menemukan k cluster dengan centroid mereka, bagaimana cara menafsirkan kelas poin data yang telah saya klaster (memberikan label kelas yang bermakna untuk masing-masing cluster). Saya tidak berbicara tentang validasi cluster yang ditemukan. Dapatkah itu dilakukan dengan diberikan satu set kecil …
10 k-means 

3
Apa keuntungan dari imputasi dibandingkan membangun banyak model dalam regresi?
Saya bertanya-tanya apakah seseorang dapat memberikan beberapa wawasan jika mengapa imputasi untuk data yang hilang lebih baik daripada hanya membangun model yang berbeda untuk kasus dengan data yang hilang. Terutama dalam kasus model linier [umum] (saya mungkin bisa melihat dalam kasus-kasus non-linear hal-hal berbeda) Misalkan kita memiliki model linier dasar: …

1
Statistik untuk pembelajaran mesin, makalah untuk memulai?
Saya memiliki latar belakang dalam pemrograman komputer dan teori bilangan dasar, tetapi tidak ada pelatihan statistik nyata, dan baru-baru ini "menemukan" bahwa dunia yang menakjubkan dari berbagai teknik sebenarnya adalah dunia statistik. Tampaknya faktorisasi matriks, penyelesaian matriks, tensor dimensi tinggi, embedding, estimasi kepadatan, inferensi Bayesian, partisi Markov, perhitungan eigenvektor, PageRank …

4
Cara memeriksa apakah model regresi saya baik
Salah satu cara untuk menemukan akurasi model regresi logistik menggunakan 'glm' adalah dengan menemukan plot AUC. Bagaimana cara memeriksa yang sama untuk model regresi yang ditemukan dengan variabel respon kontinu (keluarga = 'gaussian')? Metode apa yang digunakan untuk memeriksa seberapa baik model regresi saya cocok dengan data?

2
Estimasi kepadatan kernel pada distribusi asimetris
Biarkan menjadi pengamatan yang diambil dari distribusi probabilitas yang tidak diketahui (tetapi tentu saja asimetris).{ x1, ... , xN}{x1,...,xN}\{x_1,\ldots,x_N\} Saya ingin menemukan distribusi probabilitas dengan menggunakan pendekatan Namun, saya mencoba menggunakan kernel Gaussian, tetapi kinerjanya buruk, karena simetris. Jadi, saya telah melihat bahwa beberapa karya tentang kernel Gamma dan Beta …






3
Masalah serius yang serius tentang kemungkinan membalik koin
Katakanlah saya melakukan 10.000 keping koin. Saya ingin tahu probabilitas berapa banyak flip yang diperlukan untuk mendapatkan 4 atau lebih berturut-turut berturut-turut. Hitungan akan berfungsi sebagai berikut, Anda akan menghitung satu putaran flips berturut-turut hanya kepala (4 kepala atau lebih). Ketika sebuah ekor menyentuh dan mematahkan garis-garis kepala, hitungan akan …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.