Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Dari perspektif statistik: Transformasi Fourier vs regresi dengan basis Fourier
Saya mencoba memahami apakah transformasi Fourier diskrit memberikan representasi kurva yang sama dengan regresi menggunakan basis Fourier. Sebagai contoh, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT memberikan bilangan …

1
Solusi bentuk tertutup untuk masalah laso ketika data matriks diagonal
\newcommand{\diag}{\operatorname{diag}} Kami memiliki masalah: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), dengan asumsi bahwa: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Apakah ada solusi bentuk tertutup dalam kasus ini? Saya punya itu: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag⁡(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), jadi saya pikir jawabannya adalah : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, untuk yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , tapi saya tidak yakin.

2
Mengapa jaringan saraf mudah tertipu?
Saya telah membaca beberapa makalah tentang membuat gambar secara manual untuk "mengelabui" jaringan saraf (lihat di bawah). Apakah ini karena jaringan hanya memodelkan probabilitas bersyarat ? Jika jaringan dapat memodelkan probabilitas gabungan , akankah kasus seperti itu masih terjadi?p ( y| x)hal(y|x)p(y|x)p ( y, x )hal(y,x)p(y,x) Dugaan saya adalah gambar …

2
Apa asal usul jaringan saraf autoencoder?
Saya mencari di Google, Wikipedia, sarjana Google, dan banyak lagi, tetapi saya tidak dapat menemukan asal Autoencoder. Mungkin itu salah satu konsep yang berevolusi sangat lambat, dan tidak mungkin untuk melacak kembali titik awal yang jelas, tetapi saya masih ingin menemukan semacam ringkasan dari langkah-langkah utama perkembangan mereka. The bab …


3
Melakukan MCMC: gunakan jags / stan atau implementasikan sendiri
Saya baru dalam penelitian Bayesian Statistics. Saya mendengar dari peneliti bahwa peneliti Bayesian lebih baik mengimplementasikan MCMC sendiri daripada menggunakan alat seperti JAGS / Stan. Bolehkah saya bertanya apa manfaat menerapkan algoritma MCMC sendiri (dalam bahasa "tidak terlalu cepat" seperti R), kecuali untuk tujuan pembelajaran?
13 bayesian  mcmc 

5
Apa bidang statistik matematika yang dapat dipekerjakan?
Saya akan menyelesaikan kehormatan saya dalam statistik, dan saya benar-benar ingin melakukan PhD karena saya menemukan statistik matematika sangat menarik. Bidang penelitian yang paling ingin saya lakukan PhD adalah proses stokastik dan deret waktu. Namun saya juga ingin mengejar karir di sektor swasta setelah PhD saya. Saya bertanya-tanya bidang apa …

3
Mengapa
Di halaman pusat AP ini, Variabel Acak vs. Variabel Aljabar , penulis, Peter Flanagan-Hyde menggambarkan perbedaan antara variabel aljabar dan acak. Sebagian katanya x+x=2xx+x=2xx + x = 2x , tetapi X+X≠2XX+X≠2XX + X \neq 2X - sebenarnya ini adalah subtitle dari artikel tersebut. Apa perbedaan dasar antara variabel aljabar dan …

3
Mengapa ada koefisien besar untuk polinomial tingkat tinggi
Dalam buku Bishop tentang pembelajaran mesin, ia membahas masalah penyesuaian kurva fungsi polinomial ke sejumlah titik data. Biarkan M menjadi urutan polinomial yang dipasang. Ini menyatakan seperti itu Kita melihat bahwa, ketika M meningkat, besarnya koefisien biasanya menjadi lebih besar. Khususnya untuk polinomial M = 9, koefisien-koefisiennya telah disesuaikan dengan …

5
Mengapa mempelajari Regresi Linier?
Diberikan dua variabel acak dan η kita dapat menghitung "koefisien korelasi" c mereka , dan membentuk garis paling cocok antara dua variabel acak ini. Pertanyaan saya adalah mengapa?ξξ\xiηη\etaccc 1) Ada variabel acak, dan η yang bergantung pada kemungkinan terburuk, yaitu ξ = f ( η ) dan meskipun ini c …
13 regression 

2
Apa manfaat dari distribusi normal terpotong dalam menginisialisasi bobot dalam jaringan saraf?
Ketika menginisialisasi bobot koneksi dalam jaringan saraf feedforward, penting untuk menginisialisasi mereka secara acak untuk menghindari simetri yang tidak dapat dipecahkan oleh algoritma pembelajaran. Rekomendasi yang saya lihat di berbagai tempat (misalnya dalam tutorial MNIST TensorFlow ) adalah menggunakan distribusi normal terpotong menggunakan standar deviasi , di manaNadalah jumlah input …

1
Apakah inferensi kondisional frequentist masih digunakan dalam praktik?
Saya baru-baru ini meninjau beberapa makalah lama oleh Nancy Reid, Barndorff-Nielsen, Richard Cox dan, ya, sedikit Ronald Fisher tentang konsep "inferensi kondisional" dalam paradigma frequentist, yang tampaknya berarti bahwa kesimpulan didasarkan hanya dengan mempertimbangkan "subset yang relevan" dari ruang sampel, bukan seluruh ruang sampel. Sebagai contoh utama, diketahui bahwa interval …


1
Perhitungan Steve Hsu tentang para genius di Tiongkok
Di blog-nya , fisikawan Steve Hsu menulis yang berikut: Dengan asumsi distribusi normal, hanya ada sekitar 10.000 orang di AS yang tampil di + 4SD dan jumlah yang sama di Eropa, jadi ini adalah populasi yang dipilih (kira-kira, beberapa ratus senior sekolah menengah atas setiap tahun di AS). Jika Anda …

1
Apa saja teknik augmentasi data yang berguna untuk jaringan saraf convolutional yang mendalam?
Latar belakang: Saya baru-baru ini memahami pada tingkat yang lebih dalam pentingnya augmentasi data ketika melatih jaringan saraf convolutional setelah melihat pembicaraan luar biasa ini oleh Geoffrey Hinton . Dia menjelaskan bahwa jaringan saraf convolutional generasi saat ini tidak dapat menggeneralisasi kerangka referensi dari objek yang diuji, membuatnya sulit bagi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.