Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Mengukur Kesamaan Dokumen
Untuk mengelompokkan dokumen (teks) Anda perlu cara mengukur kesamaan antara pasangan dokumen. Dua alternatif adalah: Bandingkan dokumen sebagai vektor istilah menggunakan Cosine Similarity - dan TF / IDF sebagai bobot untuk persyaratan. Bandingkan setiap distribusi probabilitas dokumen menggunakan f-divergence misalnya divergensi Kullback-Leibler Apakah ada alasan intuitif untuk memilih satu metode …

4
Distribusi sebelumnya yang lemah dan informatif untuk parameter skala
Saya telah menggunakan distribusi log normal sebagai distribusi sebelumnya untuk parameter skala (untuk distribusi normal, distribusi t, dll.) Ketika saya memiliki gagasan kasar tentang apa skala seharusnya, tetapi ingin berbuat salah di sisi mengatakan saya tidak tahu banyak tentang itu. Saya menggunakannya karena penggunaan itu masuk akal bagi saya, tetapi …


3
Koefisien Determinasi (
Saya ingin sepenuhnya memahami gagasan menggambarkan jumlah variasi antar variabel. Setiap penjelasan web sedikit mekanis dan tumpul. Saya ingin "mendapatkan" konsepnya, bukan hanya menggunakan angka secara mekanis.r2r2r^2 Misalnya: Jam belajar vs skor tes rrr = .8 r2r2r^2 = .64 So, what does this mean? 64% of the variability of test …





4
Entropi dari suatu gambar
Apa cara paling benar informasi / fisika-teoretis untuk menghitung entropi suatu gambar? Saya tidak peduli dengan efisiensi komputasi saat ini - saya ingin secara teoritis seakurat mungkin. Mari kita mulai dengan gambar skala abu-abu. Salah satu pendekatan intuitif adalah mempertimbangkan gambar sebagai sekumpulan piksel dan menghitung mana adalah jumlah tingkat …

2
Cara merangkum interval yang kredibel untuk audiens medis
Dengan paket Stan dan frontend rstanarmatau brmssaya dapat dengan mudah menganalisis data dengan cara Bayesian seperti yang saya lakukan sebelumnya dengan model campuran seperti lme. Sementara saya memiliki sebagian besar buku dan artikel oleh Kruschke-Gelman-Wagenmakers-dll di meja saya, ini tidak memberi tahu saya bagaimana meringkas hasil untuk audiens medis, terpecah …

5
Pendekatan statistik untuk menentukan apakah data hilang secara acak
Saya memiliki satu set besar fitur vektor yang akan saya gunakan untuk menyerang masalah klasifikasi biner (menggunakan scikit belajar dengan Python). Sebelum saya mulai berpikir tentang imputasi, saya tertarik untuk mencoba menentukan dari bagian data yang tersisa apakah data yang hilang 'hilang secara acak' atau hilang bukan secara acak. Apa …



2
Apa asumsi regresi ridge dan bagaimana cara mengujinya?
Pertimbangkan model standar untuk regresi berganda mana , jadi normalitas, homoscedasticity, dan tidak berkorelasi kesalahan tetap ada.ε ∼ N ( 0 , σ 2 I n )Y= Xβ+ εY=Xβ+εY=X\beta+\varepsilonε ∼ N( 0 , σ2sayan)ε∼N(0,σ2sayan)\varepsilon \sim \mathcal N(0, \sigma^2I_n) Misalkan kita melakukan regresi ridge, dengan menambahkan jumlah kecil yang sama untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.