Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Ruby sebagai meja kerja statistik
Ini juga merupakan pertanyaan yang sangat terkait dengan Python sebagai meja kerja statistik dan unggul sebagai meja kerja statistik . Saya tahu ada diskusi besar tentang Ruby versus Python tetapi ini bukan poin dari pertanyaan ini. Saya berpikir bahwa Ruby lebih cepat daripada Python dan memiliki sintaksis yang sangat alami …
13 r  python  software  ruby 



2
Hasil pada estimasi Monte Carlo dihasilkan oleh sampling penting
Saya telah bekerja pada sampel penting cukup dekat selama setahun terakhir dan memiliki beberapa pertanyaan terbuka yang saya harap dapat membantu. Pengalaman praktis saya dengan skema sampel penting adalah bahwa mereka kadang-kadang dapat menghasilkan estimasi varians rendah dan bias rendah yang fantastis. Namun, lebih sering, mereka cenderung menghasilkan perkiraan kesalahan …

2
Analisis proporsi
Saya memiliki dataset yang berisi banyak proporsi yang menambahkan hingga 1. Saya tertarik pada perubahan proporsi ini sepanjang gradien (lihat di bawah untuk contoh data). gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, …
13 r  multinomial 



3
Apakah AR (1) proses Markov?
Apakah proses AR (1) seperti yt=ρyt−1+εtyt=ρyt−1+εty_t=\rho y_{t-1}+\varepsilon_t merupakan proses Markov? Jika ya, maka VAR (1) adalah versi vektor dari proses Markov?




2
Apa yang menghalangi jaringan syaraf berdenyut digunakan dalam aplikasi?
Jaringan saraf pulsed atau Spiking menggabungkan lebih banyak dinamika membran neuron biologis, di mana pulsa membawa informasi ke lapisan berikutnya. Neuron tidak harus harus "menembak" semua pada saat yang sama, seperti yang mereka lakukan di backprop, misalnya. Namun, tampaknya ada hambatan terhadap penggunaan model ini untuk masalah pembelajaran mesin. Apa …

2
Apa n-gram menjadi kontraproduktif?
Saat melakukan pemrosesan bahasa alami, seseorang dapat mengambil corpus dan mengevaluasi probabilitas kata berikutnya yang muncul dalam urutan n. n biasanya dipilih sebagai 2 atau 3 (bigrams dan trigram). Adakah titik yang diketahui di mana pelacakan data untuk rantai ke-n menjadi kontraproduktif, mengingat jumlah waktu yang diperlukan untuk mengklasifikasikan korpus …

3
Mengapa sering diasumsikan distribusi Gaussian?
Mengutip dari artikel Wikipedia tentang estimasi parameter untuk classifier Bayes yang naif : "asumsi umum adalah bahwa nilai kontinu yang terkait dengan setiap kelas didistribusikan sesuai dengan distribusi Gaussian." Saya mengerti bahwa distribusi Gaussian nyaman untuk alasan analitis. Namun, apakah ada alasan lain di dunia nyata untuk membuat anggapan ini? …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.