Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Memodelkan kriket bowler mengeluarkan batsmen
Saya memiliki satu set data yang merinci banyak game kriket (beberapa ribu). Dalam kriket "bowler" berulang kali melempar bola pada suksesi "batsmen". Bowler sedang mencoba untuk mendapatkan batsman "keluar". Dalam hal ini sangat mirip dengan pitcher dan batter di baseball. Jika saya mengambil seluruh dataset dan membagi jumlah total bola …

1
Distribusi bentuk kuadrat normals
Saya mencoba untuk mencari tahu distribusi mana Z i ∼ N ( 0 , 1 ) , iid aku tahu itu, mengambil masing-masing istilah secara terpisah, n ∑ i = 1 Z 2 i ∼ χ 2 ( n ) dan 1(n−1)∑i=1nZ2i−(∑i=1nZi)2(∗)(n−1)∑i=1nZi2−(∑i=1nZi)2(∗) (n-1) \sum_{i=1}^n Z_i^2 - \left( \sum_{i=1}^n Z_i \right)^2 …

1
I Just Ran Dua Juta Regresi - Kemungkinan Terintegrasi
Saat ini saya sedang berusaha menerapkan metode yang digunakan dalam sebuah makalah populer berjudul "I Just Ran Two Million Regressions". Ide dasar di balik itu adalah bahwa ada kasus-kasus tertentu di mana tidak jelas kontrol apa yang harus dimasukkan dalam model. Satu hal yang dapat Anda lakukan dalam kasus seperti …


2
Pengurangan dimensi yang bisa diukur
Mempertimbangkan jumlah fitur yang konstan, Barnes-Hut t-SNE memiliki kompleksitas , proyeksi acak dan PCA memiliki kompleksitas menjadikannya "terjangkau" untuk set data yang sangat besar.O ( n logn )HAI(ncatatan⁡n)O(n\log n)O ( n )HAI(n)O(n) Di sisi lain, metode yang mengandalkan penskalaan multidimensi memiliki kompleksitas .O ( n2)HAI(n2)O(n^2) Apakah ada teknik pengurangan dimensi …

1
Interval prediksi untuk proporsi keberhasilan di masa depan dalam pengaturan Binomial
Misalkan saya cocok dengan regresi Binomial dan mendapatkan estimasi titik dan matriks varians-kovarians dari koefisien regresi. Itu akan memungkinkan saya untuk mendapatkan CI untuk proporsi keberhasilan yang diharapkan dalam percobaan di masa depan, , tetapi saya membutuhkan CI untuk proporsi yang diamati. Ada beberapa jawaban terkait yang diposting, termasuk simulasi …

1
Prediksi seri waktu menggunakan ARIMA vs LSTM
Masalah yang saya hadapi adalah memprediksi nilai deret waktu. Saya melihat satu seri waktu dan berdasarkan pada misalnya 15% dari data input, saya ingin memprediksi nilai-nilai masa depannya. Sejauh ini saya telah menemukan dua model: LSTM (memori jangka pendek; kelas jaringan saraf berulang) ARIMA Saya sudah mencoba keduanya dan membaca …

2
Apa yang dimaksud dengan “Laplace noise”?
Saat ini saya sedang menulis algoritma untuk privasi diferensial menggunakan mekanisme Laplace. Sayangnya saya tidak memiliki latar belakang statistik, oleh karena itu banyak istilah yang tidak saya ketahui. Jadi sekarang saya tersandung istilah: kebisingan Laplace . Untuk membuat diferensial dataset privat, semua makalah hanya berbicara tentang menambahkan noise Laplace sesuai …

1
Seberapa efisienkah Q-learning dengan Neural Networks ketika ada satu unit output per tindakan?
Latar belakang: Saya menggunakan pendekatan Q-value Neural Network dalam tugas pembelajaran penguatan saya. Pendekatannya persis sama dengan yang dijelaskan dalam pertanyaan ini , namun pertanyaannya sendiri berbeda. Dalam pendekatan ini jumlah output adalah jumlah tindakan yang bisa kita ambil. Dan dengan kata-kata sederhana, algoritmanya adalah sebagai berikut: lakukan tindakan A, …

1
Dapat dibakukan
Saya mencoba menafsirkan hasil artikel, di mana mereka menerapkan regresi berganda untuk memprediksi berbagai hasil. Namun ββ\beta (koefisien B terstandarisasi didefinisikan sebagai βx1=Bx1⋅SDx1SDyβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y} manayyyadalah variabel dependen danx1x1x_1adalah prediktor) yang dilaporkan tampaknya tidak cocok dengandilaporkanR2R2R^2: Meskipun ββ\beta dari -0,83, -0,29, -0,16, -0,43, 0,25, dan -0,29, dilaporkan R2R2R^2hanya …



1
Apakah jaringan saraf menggunakan pengkodean yang efisien?
Pertanyaan saya menyangkut hubungan antara hipotesis pengkodean efisien yang diuraikan di halaman Wikipedia tentang pengkodean efisien dan algoritma pembelajaran jaringan saraf. Apa hubungan antara hipotesis pengkodean yang efisien dan jaringan saraf? Apakah ada model jaringan saraf yang secara eksplisit terinspirasi oleh hipotesis pengkodean yang efisien? Atau akan lebih adil untuk …

2
Bagaimana cara sampel distribusi multinomial terpotong?
Saya perlu algoritma untuk sampel distribusi multinomial terpotong. Itu adalah, x⃗ ∼ 1Zhalx11... halxkkx1! ... xk!x→∼1Zp1x1…pkxkx1!…xk!\vec x \sim \frac{1}{Z} \frac{p_1^{x_1} \dots p_k^{x_k}}{x_1!\dots x_k!} di mana adalah konstanta normalisasi, memiliki komponen positif, dan . Saya hanya mempertimbangkan nilai dalam rentang .→ x k ∑ x i = n → x → …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.