Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Paradoks data iid (setidaknya untuk saya)
Sejauh pengetahuan agregat (dan kelangkaan) saya tentang statistik memungkinkan, saya mengerti bahwa jika adalah variabel acak iid, maka sebagaimana istilah tersebut menyiratkan bahwa keduanya independen dan terdistribusi secara identik.X1,X2,...,XnX1,X2,...,XnX_1, X_2,..., X_n Perhatian saya di sini adalah properti mantan sampel iid, yang berbunyi: p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(X_{n}|X_{i_1},X_{i_2},...,X_{i_k}) = p(X_{n}), untuk setiap koleksi 's st …

3
Mengapa koreksi hipotesis berganda tidak diterapkan pada semua percobaan sejak awal waktu?
Kita tahu bahwa kita harus menerapkan koreksi seperti Benjamini Hochberg untuk pengujian hipotesis berganda untuk eksperimen yang didasarkan pada satu set data tunggal, untuk mengendalikan laju penemuan palsu, jika tidak semua eksperimen yang memberikan hasil positif bisa salah. Tapi mengapa kita tidak menerapkan prinsip yang sama ini untuk semua percobaan …


3
Mengevaluasi regresi logistik dan interpretasi Hosmer-Lemeshow Goodness of Fit
Seperti kita ketahui, ada 2 metode untuk mengevaluasi model regresi logistik dan mereka menguji hal-hal yang sangat berbeda Kekuatan prediksi: Dapatkan statistik yang mengukur seberapa baik Anda dapat memprediksi variabel dependen berdasarkan variabel independen. Pseudo R ^ 2 yang terkenal adalah McFadden (1974) dan Cox and Snell (1989). Statistik Good-of-fit …

2
Bag-of-Words untuk Klasifikasi Teks: Mengapa tidak hanya menggunakan frekuensi kata daripada TFIDF?
Pendekatan umum untuk klasifikasi teks adalah untuk melatih classifier dari 'kata-kata'. Pengguna mengambil teks untuk diklasifikasikan dan menghitung frekuensi kata-kata di setiap objek, diikuti oleh semacam pemangkasan untuk menjaga matriks yang dihasilkan dari ukuran yang dapat dikelola. Seringkali, saya melihat pengguna membuat vektor fitur mereka menggunakan TFIDF. Dengan kata lain, …

1
Berapakah probabilitas bahwa
Diberikan titik data, masing-masing dengan fitur , diberi label sebagai , yang lain dilabeli sebagai . Setiap fitur mengambil nilai dari secara acak (distribusi seragam). Berapa probabilitas bahwa ada hyperplane yang dapat membagi dua kelas?nnndddn/2n/2n/2000n/2n/2n/2111[0,1][0,1][0,1] Mari kita perhatikan kasus yang paling mudah, yaitu .d=1d=1d = 1

3
Mengapa transformasi daya atau log tidak banyak diajarkan dalam pembelajaran mesin?
Pembelajaran mesin (ML) banyak menggunakan teknik regresi linier dan logistik. Hal ini juga bergantung pada teknik rekayasa fitur ( feature transform, kernel, dll). Mengapa tidak ada sekitar variable transformation(misalnya power transformation) yang disebutkan dalam ML? (Misalnya, saya tidak pernah mendengar tentang mengambil root atau masuk ke fitur, mereka biasanya hanya …

4
Apa yang bisa kita pelajari tentang otak manusia dari jaringan saraf tiruan?
Saya tahu pertanyaan / judul saya tidak terlalu spesifik, jadi saya akan mencoba menjelaskannya: Jaringan saraf tiruan memiliki desain yang relatif ketat. Tentu saja, secara umum, mereka dipengaruhi oleh biologi dan mencoba untuk membangun model matematika dari jaringan saraf nyata, tetapi pemahaman kita tentang jaringan saraf nyata tidak cukup untuk …

4
Algoritma untuk Deteksi Anomali Seri Waktu
Saat ini saya menggunakan AnomalyDetection Twitter di R: https://github.com/twitter/AnomalyDetection . Algoritma ini menyediakan deteksi anomali seri waktu untuk data dengan musiman. Pertanyaan: apakah ada algoritma lain yang mirip dengan ini (mengendalikan musiman tidak masalah)? Saya mencoba untuk mencetak sebanyak mungkin algoritma deret waktu pada data saya sehingga saya dapat memilih …

2
Bayesian laso vs laso biasa
Perangkat lunak implementasi yang berbeda tersedia untuk laso . Saya tahu banyak membahas tentang pendekatan bayesian vs pendekatan frequentist di berbagai forum. Pertanyaan saya sangat spesifik untuk laso - Apa perbedaan atau kelebihan dari baysian laso vs laso biasa ? Berikut adalah dua contoh implementasi dalam paket: # just example …


1
Dapatkah Multinomial (1 / n,…, 1 / n) dikarakteristikkan sebagai Dirichlet yang diskrit (1, .., 1)?
Jadi pertanyaan ini agak berantakan, tetapi saya akan menyertakan grafik warna-warni untuk menebusnya! Pertama Latar Belakang kemudian Pertanyaan. Latar Belakang Katakanlah Anda memiliki distribusi multinomial -dimensi dengan probailit yang sama dengan kategori . Biarkan menjadi hitungan yang dinormalisasi ( ) dari distribusi itu, yaitu:nnnnnnπ=(π1,…,πn)π=(π1,…,πn)\pi = (\pi_1, \ldots, \pi_n)ccc (c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c_1, \ldots, …

2
Autoencoder tidak dapat mempelajari fitur yang berarti
Saya memiliki 50.000 gambar seperti ini: Mereka menggambarkan grafik data. Saya ingin mengekstrak fitur dari gambar-gambar ini sehingga saya menggunakan kode autoencoder yang disediakan oleh Theano (deeplearning.net). Masalahnya adalah, autoencoder ini sepertinya tidak mempelajari fitur apa pun. Saya sudah mencoba RBM dan itu sama. Dataset MNIST menyediakan fitur yang bagus …


3
Deteksi Outlier pada Distribusi miring
Di bawah definisi klasik dari pencilan sebagai titik data di luar 1,5 * IQR dari kuartil atas atau bawah, ada asumsi distribusi tidak miring. Untuk distribusi miring (Eksponensial, Poisson, Geometris, dll) adalah cara terbaik untuk mendeteksi pencilan dengan menganalisis transformasi fungsi asli? Misalnya, distribusi yang secara longgar diatur oleh distribusi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.