Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Cakupan yang lebih rendah dari yang diharapkan untuk sampel penting dengan simulasi
Aku mencoba untuk menjawab pertanyaan Evaluasi terpisahkan dengan Pentingnya sampel metode dalam R . Pada dasarnya, pengguna perlu menghitung ∫π0f( x ) dx =∫π01cos( x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx menggunakan distribusi eksponensial sebagai distribusi kepentingan q( x ) = λ exp- λ xq(x)=λ exp-λxq(x)=\lambda\ \exp^{-\lambda x} dan temukan nilai yang memberikan perkiraan yang lebih …

1
Memahami topologi LSTM
Seperti banyak orang lain, saya menemukan sumber daya di sini dan di sini sangat berguna untuk memahami sel-sel LSTM. Saya yakin saya mengerti bagaimana nilai mengalir dan diperbarui, dan saya cukup percaya diri untuk menambahkan "koneksi lubang intip" yang disebutkan, dll. Dalam contoh saya, saya punya setiap langkah langkah vektor …

1
Menghasilkan angka acak dari "distribusi seragam miring" dari teori matematika
Untuk beberapa tujuan, saya perlu menghasilkan angka acak (data) dari distribusi "seragam miring". "Kemiringan" dari distribusi ini dapat bervariasi dalam beberapa interval yang masuk akal, dan kemudian distribusi saya harus berubah dari seragam menjadi segitiga berdasarkan pada kemiringan. Inilah derivasi saya: Mari kita membuatnya sederhana dan menghasilkan data dari hingga …


1
Peluang sampel bootstrap persis sama dengan sampel asli
Hanya ingin memeriksa beberapa alasan. Jika sampel asli saya berukuran dan saya bootstrap, maka proses pemikiran saya adalah sebagai berikut:nnn 1n1n\frac{1}{n} adalah peluang pengamatan apa pun yang diambil dari sampel asli. Untuk memastikan pengundian berikutnya bukan observasi sampel sebelumnya, kami membatasi ukuran sampel ke . Jadi, kita mendapatkan pola ini:n …


2
Mengapa saya tidak bisa mendapatkan SVD X yang valid melalui dekomposisi nilai eigen dari XX 'dan X'X?
Saya mencoba melakukan SVD dengan tangan: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) Tetapi baris terakhir tidak mkembali. Mengapa? Tampaknya ada hubungannya dengan tanda-tanda vektor eigen ini ... Atau apakah saya salah memahami prosedur?
9 r  svd  eigenvalues 

2
Mensimulasikan regresi linier dengan heteroskedastisitas
Saya mencoba mensimulasikan dataset yang cocok dengan data empiris yang saya miliki, tetapi saya tidak yakin bagaimana memperkirakan kesalahan dalam data asli. Data empiris mencakup heteroskedastisitas, tetapi saya tidak tertarik untuk mengubahnya, tetapi menggunakan model linier dengan istilah kesalahan untuk mereproduksi simulasi data empiris. Sebagai contoh, katakanlah saya memiliki beberapa …


1
Gradien untuk skipgram word2vec
Saya akan membahas masalah-masalah dalam tugas penugasan tertulis kelas pembelajaran mendalam di Stanford NLP http://cs224d.stanford.edu/assignment1/assignment1_soln Saya mencoba memahami jawaban untuk 3a di mana mereka mencari turunan ke vektor untuk kata pusat. Asumsikan Anda diberikan vektor kata yang diprediksi sesuai dengan kata tengah c untuk skipgram, dan prediksi kata dibuat dengan …

1
Regresi linier multivariat dengan laso di r
Saya mencoba membuat model yang diperkecil untuk memprediksi banyak variabel dependen (DV) (~ 450) yang sangat berkorelasi. Variabel independen saya (IV) juga banyak (~ 2000) dan sangat berkorelasi. Jika saya menggunakan laso untuk memilih model yang direduksi untuk setiap output secara terpisah, saya tidak dijamin mendapatkan subset variabel independen yang …

3
Pemilihan fitur menggunakan pembelajaran mendalam?
Saya ingin menghitung pentingnya setiap fitur input menggunakan model yang mendalam. Tetapi saya hanya menemukan satu makalah tentang pemilihan fitur menggunakan pembelajaran mendalam - pemilihan fitur dalam . Mereka menyisipkan lapisan node yang terhubung ke setiap fitur secara langsung, sebelum lapisan tersembunyi pertama. Saya mendengar bahwa jaringan kepercayaan yang mendalam …

1
Model efek campuran dengan splines
Saya menyesuaikan model efek campuran dengan istilah spline dalam aplikasi di mana tren dari waktu ke waktu dikenal sebagai kurva-linier. Namun, apa yang ingin saya nilai adalah apakah tren kurva-linier terjadi karena penyimpangan individu dari linieritas, atau apakah itu efek pada tingkat kelompok yang membuat tingkat kelompok yang sesuai tampak …
9 r  splines  lme4-nlme 

1
Apa perbedaan antara banyak pembelajaran dan pengurangan dimensi non-linear?
Apa perbedaan antara banyak pembelajaran dan pengurangan dimensi non-linear ? Saya telah melihat kedua istilah ini digunakan secara bergantian. Sebagai contoh: http://www.cs.cornell.edu/~kilian/research/manifold/manifold.html : Manifold Learning (sering juga disebut sebagai pengurangan dimensi non-linear) mengejar tujuan untuk menanamkan data yang awalnya terletak di ruang dimensi tinggi di ruang dimensi yang lebih rendah, …

2
Ukuran sampel bootstrap
Saya belajar tentang bootstrap sebagai cara memperkirakan varians statistik sampel. Saya punya satu keraguan mendasar. Mengutip dari http://web.stanford.edu/class/psych252/tutorials/doBootstrapPrimer.pdf : • Berapa banyak pengamatan yang harus kita sampel ulang? Saran yang baik adalah ukuran sampel asli. Bagaimana kita bisa membuat sampel sebanyak pengamatan seperti pada sampel asli? Jika saya memiliki ukuran …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.