Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apa perbedaan antara regresi linear yang ditransformasi-logit, regresi logistik, dan model campuran logistik?
Misalkan saya memiliki 10 siswa, yang masing-masing berusaha memecahkan 20 masalah matematika. Masalah diberi skor benar atau salah (dalam longdata) dan kinerja setiap siswa dapat diringkas dengan ukuran akurasi (dalam subjdata). Model 1, 2, dan 4 di bawah ini muncul untuk menghasilkan hasil yang berbeda, tetapi saya memahaminya melakukan hal …

4
Tutorial yang bagus untuk Mesin Boltzmann Terbatas (RBM)
Saya sedang mempelajari Mesin Boltzmann Terbatas (RBM) dan saya mengalami beberapa masalah dalam memahami perhitungan kemungkinan log sehubungan dengan parameter RBM. Meskipun banyak makalah penelitian tentang RBM telah diterbitkan, tidak ada langkah rinci dari turunannya. Setelah mencari online, saya dapat menemukannya di dokumen ini: Fischer, A., & Igel, C. (2012). …
10 references  rbm 

2
Perbedaan variabel acak Gamma
Diberikan dua variabel acak independen dan , apa distribusi perbedaannya, yaitu ?Y ∼ G a m m a ( α Y , β Y ) D = X - YX∼Gamma(αX,βX)X∼Gamma(αX,βX)X\sim \mathrm{Gamma}(\alpha_X,\beta_X)Y∼Gamma(αY,βY)Y∼Gamma(αY,βY)Y\sim \mathrm{Gamma}(\alpha_Y,\beta_Y)D=X−YD=X−YD=X-Y Jika hasilnya tidak diketahui, bagaimana saya akan mendapatkan hasilnya?

3
Bagaimana cara melihat data deret waktu besar secara interaktif?
Saya sering berurusan dengan jumlah data deret waktu yang masuk akal, 50-200 juta ganda dengan perangko waktu terkait dan ingin memvisualisasikannya secara dinamis. Apakah ada perangkat lunak yang ada untuk melakukan ini secara efektif? Bagaimana dengan perpustakaan dan format data? Zoom-cache adalah salah satu contoh perpustakaan yang berfokus pada seri …


1
Kepadatan robot melakukan jalan acak dalam grafik geometri acak tak terbatas
Pertimbangkan grafik geometrik acak tak terbatas di mana lokasi simpul mengikuti proses titik Poisson dengan kerapatan dan ujung-ujungnya ditempatkan di antara simpul yang lebih dekat daripada d . Oleh karena itu, panjang tepi mengikuti PDF berikut:ρρ\rhoddd f(l)={2ld2l≤d0l>df(l)={2ld2l≤d0l>d f(l)= \begin{cases} \frac{2 l}{d^2} \;\quad l \le d \\ 0 \qquad\; l > …

3
Jumlah tertimbang dari dua variabel acak Poisson independen
Menggunakan wikipedia saya menemukan cara untuk menghitung probabilitas fungsi massa yang dihasilkan dari jumlah dua variabel acak Poisson. Namun, saya pikir pendekatan yang saya miliki salah. Misalkan menjadi dua variabel acak Poisson independen dengan mean , dan , di mana dan adalah konstanta, maka fungsi penghasil probabilitas dari diberikan oleh …

1
Teknik penambangan data dalam kampanye Obama
Saya menemukan artikel ini tentang tim penambangan data dalam kampanye pemilihan ulang Obama. Sayangnya, artikel ini sangat kabur tentang mesin yang sebenarnya dari algoritma statistik. Namun, itu terdengar seolah-olah teknik umum dikenal dalam ilmu sosial dan politik. Karena ini bukan bidang keahlian saya, adakah yang bisa mengarahkan saya pada (ikhtisar) …


2
Sisa residu vs outlier yang berpengaruh
Pertama, saya harus menyatakan bahwa saya telah mencari jawabannya di situs ini. Saya juga tidak menemukan pertanyaan yang menjawab pertanyaan saya atau tingkat pengetahuan saya sangat rendah sehingga saya tidak menyadari bahwa saya sudah membaca jawabannya. Saya sedang belajar untuk Ujian Statistik AP. Saya harus belajar regresi linier dan salah …

1
Bagaimana cara menghitung informasi timbal balik?
Saya sedikit bingung. Bisakah seseorang menjelaskan kepada saya bagaimana menghitung informasi timbal balik antara dua istilah berdasarkan matriks dokumen-jangka dengan kemunculan istilah biner sebagai bobot? Document1Document2D o c ument3′Why′111′How′101′Wh en′111′Wh e r e′100′Why′′HHaiw′′When′′Where′DHaickamument11111DHaickamument21010DHaickamument31110 \begin{matrix} & 'Why' & 'How' & 'When' & 'Where' \\ Document1 & 1 & 1 & 1 …

2
Model pas untuk dua distribusi normal di PyMC
Karena saya seorang insinyur perangkat lunak yang mencoba mempelajari lebih banyak statistik, Anda harus memaafkan saya bahkan sebelum saya mulai, ini adalah wilayah newb yang serius ... Saya telah belajar PyMC dan bekerja melalui beberapa contoh sederhana. Satu masalah yang saya tidak dapat mulai bekerja (dan tidak dapat menemukan contoh …
10 modeling  python  pymc 

2
Nilai yang diharapkan dari variabel acak Gaussian ditransformasikan dengan fungsi logistik
Baik fungsi logistik dan standar deviasi biasanya dilambangkan σσ\sigma . Saya akan menggunakan σ(x)=1/(1+exp(−x))σ(x)=1/(1+exp⁡(−x))\sigma(x) = 1/(1+\exp(-x)) dan sss untuk standar deviasi. Saya memiliki neuron logistik dengan input acak yang berarti μμ\mu dan standar deviasi sss saya tahu. Saya berharap perbedaan dari rata-rata dapat didekati dengan baik oleh beberapa noise Gaussian. …

1
Apakah lebar siluet rendah berarti data hanya memiliki sedikit struktur mendasar?
Saya baru dalam analisis sekuens, dan saya bertanya-tanya bagaimana Anda bereaksi jika rata-rata lebar siluet (ASW) dari analisis kluster dari matriks ketidaksamaan berbasis Pencocokan Optimal rendah (sekitar.25). Apakah akan tepat untuk menyimpulkan bahwa ada sedikit struktur mendasar yang akan memungkinkan urutan untuk dikelompokkan? Mungkinkah Anda mengabaikan ASW rendah berdasarkan ukuran …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.