Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Interpretasi probabilistik dari Thin Plate Smoothing Splines
TLDR: Apakah splines regresi plat tipis memiliki interpretasi probabilistik / Bayesian? Pasangan input-output yang diberikan , ; Saya ingin memperkirakan fungsi sebagai berikut mana adalah fungsi kernel dan adalah vektor fitur dengan ukuran . Koefisien dan dapat ditemukan dengan menyelesaikan mana baris \ Phi diberikan oleh(xsaya,ysaya)(xi,yi)(x_i,y_i)saya=1,...,ni=1,...,ni=1,...,nf(⋅)f(⋅)f(\cdot)f(x)≈kamu(x)=ϕ(xsaya)Tβ+n∑saya=1αsayak(x,xsaya),f(x)≈u(x)=ϕ(xi)Tβ+∑i=1nαik(x,xi),\begin{equation}f(x)\approx u(x)=\phi(x_i)^T\beta +\sum_{i=1}^n \alpha_i k(x,x_i),\end{equation}k(⋅,⋅)k(⋅,⋅)k(\cdot,\cdot)ϕ(xsaya)ϕ(xi)\phi(x_i)m&lt;nm&lt;nm<nαsayaαi\alpha_iβsayaβi\beta_iminα∈Rn,β∈Rm1n‖Y−Φβ−Kα‖2Rn+λαTKα,minα∈Rn,β∈Rm1n∥Y−Φβ−Kα∥2Rn+λαTKα,\begin{equation} …

2
Apa output dari tf.nn.dynamic_rnn ()?
Saya tidak yakin tentang apa yang saya mengerti dari dokumentasi resmi, yang mengatakan: Pengembalian: Sepasang (keluaran, status) tempat: outputs: Tensor keluaran RNN. Jika time_major == False(default), ini akan menjadi Tensor berbentuk: [batch_size, max_time, cell.output_size]. Jika time_major == True, ini akan menjadi Tensor berbentuk: [max_time, batch_size, cell.output_size]. Catatan, jika cell.output_sizetupel integer …




1
Jika saya memiliki vektor probabilitas berkorelasiBagaimana saya bisa mengubahnya menjadi biner tanpa merusak korelasinya?
Tujuan utama saya adalah untuk dapat memiliki cara untuk menghasilkan vektor ukuran dari variabel acak berkorelasi Bernoulli. Salah satu cara saya melakukan ini adalah dengan menggunakan pendekatan Gaussian Coupla. Namun, pendekatan Gaussian Coupla hanya membuat saya dengan vektor:NNN (p1,…,pN)∈[0,1]N(p1,…,pN)∈[0,1]N (p_1, \ldots, p_N) \in [0,1]^N Misalkan saya telah menghasilkan sedemikian rupa …

2
Binomial negatif yang bersaing
Saya menggulirkan dadu yang adil. Berapakah distribusi probabilitas jumlah gulungan sampai saya pertama kali mengakumulasi: 1) Lima yang 2) 20 kemunculan wajah yang bukan satu? Saya senang berbagi aplikasi yang sebenarnya jika itu akan membantu.


2
Transformasi Kuantil dengan Distribusi Gaussian - Implementasi Sklearn
Ini mungkin pertanyaan yang tidak jelas, tetapi saya bertanya-tanya bagaimana transformasi quantile Scikit-Learn diimplementasikan? Saya ingin tahu bagaimana dataset yang miring dapat diubah menjadi distribusi normal seperti ini ? Biasanya scikit-learn menyediakan tautan ke wiki, tetapi bukan transformasi ini. Bisakah seseorang mengarahkan saya ke arah yang benar? Terima kasih

1
Contoh kriging biasa selangkah demi selangkah?
Saya telah mengikuti tutorial online untuk sprigal kriging dengan keduanya geoRdan gstat(dan juga automap). Saya dapat melakukan kriging spasial dan saya memahami konsep utama di baliknya. Saya tahu cara membuat semivariogram, cara menyesuaikan model dengan itu dan bagaimana melakukan kriging biasa. Yang tidak saya mengerti adalah bagaimana bobot dari nilai …

1
Apakah Anda menandai data ini sebagai penipuan?
Misalkan Anda telah diberi beberapa data dari rancangan acak kelompok dengan 4 kali pengulangan dan 23 kali perawatan. Setelah pemeriksaan awal data, Anda perhatikan bahwa untuk 8 perawatan semua pengulangan adalah identik, yang jelas salah. Setelah melaporkan masalah, Anda diberi tahu bahwa itu karena kebingungan dari orang yang bertanggung jawab …

2
Batas Keyakinan Tertinggi dalam Pembelajaran Mesin
Saya menemukan formula untuk mendapatkan batas kepercayaan atas pada masalah bandit bersenjata k: cdalamNsayansaya-----√clnNinic\sqrt{\frac{\text{ln} N_i}{n_i}} di mana adalah jumlah sampel yang kami miliki untuk bandit khusus ini dan adalah jumlah total sampel yang kami miliki dari semua bandit. Algoritma yang sama digunakan dalam Pencarian Pohon Monte Carlo juga untuk mendapatkan …

2
Pemilihan fitur pada model linear umum hirarkis Bayesian
Saya ingin memperkirakan GLM hirarkis tetapi dengan pemilihan fitur untuk menentukan kovariat mana yang relevan pada tingkat populasi untuk dimasukkan. Misalkan saya punya GGGgrup dengan pengamatan dan kemungkinan kovariat Yaitu, saya memiliki matriks desain kovariat , hasil . Koefisien pada kovariat ini adalah .NNNKKKx(N⋅G)×Kx(N⋅G)×K\boldsymbol{x}_{(N\cdot G) \times K}y(N⋅G)×1y(N⋅G)×1\boldsymbol{y}_{(N\cdot G) \times 1}βK×1βK×1\beta_{K …

2
Apa pembenaran menggunakan pendekatan taylor di dalam operator ekspektasi?
Saya terkadang melihat orang menggunakan pendekatan taylor sebagai berikut: E(ex)≈E(1+x)E(ex)≈E(1+x)E(e^x)\approx E(1+x) Saya tahu bahwa pendekatan taylor bekerja untuk ex≈1+xex≈1+xe^x \approx 1+x Tetapi tidak jelas bagi saya bahwa kita dapat melakukan perkiraan di dalam operator ekspektasi. Secara intuitif, saya kira itu bekerja jika "probabilitas jauh lebih besar dari 0 kecil", tapi …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.