Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Koordinasikan vs gradient descent
Saya bertanya-tanya apa perbedaan kasus penggunaan untuk dua algoritma, Koordinat Keturunan dan Gradient Keturunan . Saya tahu bahwa penurunan koordinat memiliki masalah dengan fungsi yang tidak mulus tetapi digunakan dalam algoritma populer seperti SVM dan LASSO. Namun penurunan Gradient menurut saya digunakan secara lebih luas, terutama dengan kebangkitan JST, dan …

2
Mengapa Wilks 1938 proof tidak berfungsi untuk model yang tidak ditentukan spesifikasi?
Dalam makalah yang terkenal tahun 1938 (" Distribusi sampel-besar dari rasio kemungkinan untuk menguji hipotesis komposit ", Annals of Mathematical Statistics, 9: 60-62), Samuel Wilks memperoleh distribusi asimtotik dari (log likelihood ratio) untuk hipotesis bersarang, dengan asumsi bahwa hipotesis yang lebih besar ditentukan dengan benar. Distribusi pembatas adalah (chi-squared) dengan …

2
Apa fungsi kerugian SVM hard margin?
max(0,1−yi(w⊺xi+b))max(0,1−yi(w⊺xi+b))\max(0,1-y_i(w^\intercal x_i+b))12∥w∥2+C∑imax(0,1−yi(w⊺xi+b))12‖w‖2+C∑imax(0,1−yi(w⊺xi+b)) \frac{1}{2}\|w\|^2+C\sum_i\max(0,1-y_i(w^\intercal x_i+b)) ∥w∥2‖w‖2\|w\|^2max(0,1−yi(w⊺xi+b))max(0,1−yi(w⊺xi+b))\max(0,1-y_i(w^\intercal x_i+b)) Namun, untuk SVM hard margin, seluruh fungsi objektif hanya 12∥w∥212‖w‖2 \frac{1}{2}\|w\|^2 Apakah itu berarti SVM hard margin hanya meminimalkan pembuat peraturan tanpa fungsi kerugian? Kedengarannya sangat aneh. Nah, jika 12∥w∥212‖w‖2\frac{1}{2}\|w\|^2 adalah fungsi kerugian dalam kasus ini, dapatkah kita menyebutnya fungsi kehilangan kuadratik? Jika demikian, …

2
Definisi waktu autokorelasi (untuk ukuran sampel yang efektif)
Saya telah menemukan dua definisi dalam literatur untuk waktu autokorelasi dari serangkaian waktu yang stasioner: τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk|τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| di mana adalah autokorelasi pada lagk. ρk=Cov[Xt,Xt+h]Var[Xt]ρk=Cov[Xt,Xt+h]Var[Xt]\rho_k = \frac{\text{Cov}[X_t,X_{t+h}]}{\text{Var}[X_t]}kkk Salah satu penerapan waktu autokorelasi adalah menemukan "ukuran sampel efektif": jika Anda memiliki pengamatan …

3
Interpretasi statistik dari Distribusi Entropi Maksimum
Saya telah menggunakan prinsip entropi maksimum untuk membenarkan penggunaan beberapa distribusi di berbagai pengaturan; akan tetapi, saya belum dapat merumuskan interpretasi statistik, sebagai lawan dari teori informasi, dari entropi maksimum. Dengan kata lain, apa yang memaksimumkan entropi menyiratkan tentang sifat statistik distribusi? Adakah yang bertemu atau mungkin menemukan diri Anda …

2
Apa artinya "fidusia" (dalam konteks statistik)?
Ketika saya Google untuk "fisher" "fiducial" ... Saya benar-benar mendapatkan banyak hit, tetapi semua yang saya ikuti benar-benar di luar pemahaman saya. Semua hit ini tampaknya memiliki satu kesamaan: semuanya ditulis untuk ahli statistik yang dicelup-dalam-wol, orang-orang benar-benar mendalami teori, praktik, sejarah, dan pengetahuan statistik. (Oleh karena itu, tidak satu …


4
Mengapa peneliti menggunakan validasi silang 10 kali lipat alih-alih menguji pada set validasi?
Saya telah membaca banyak makalah penelitian tentang klasifikasi sentimen dan topik terkait. Sebagian besar dari mereka menggunakan validasi silang 10 kali lipat untuk melatih dan menguji pengklasifikasi. Itu berarti tidak ada pengujian / validasi terpisah yang dilakukan. Mengapa demikian? Apa keuntungan / kerugian dari pendekatan ini, terutama bagi mereka yang …

1
Kolmogorov-Smirnov dengan data diskrit: Apa penggunaan yang tepat dari dgof :: ks.test di R?
Pertanyaan pemula: Saya ingin menguji apakah dua set data diskrit berasal dari distribusi yang sama. Tes Kolmogorov-Smirnov disarankan kepada saya. Conover ( Statistik Nonparametrik Praktis , 3d) tampaknya mengatakan bahwa Tes Kolmogorov-Smirnov dapat digunakan untuk tujuan ini, tetapi perilakunya "konservatif" dengan distribusi diskrit, dan saya tidak yakin apa artinya di …

2
Hutan acak untuk regresi multivariat
Saya punya masalah regresi multi-output dengan fitur input dan d y output. Keluaran memiliki struktur korelasi non-linear yang kompleks.dxdxd_xdydyd_y Saya ingin menggunakan hutan acak untuk melakukan regresi. Sejauh yang saya tahu, hutan acak untuk regresi hanya bekerja dengan satu output, jadi saya harus melatih hutan acak - satu untuk setiap …

4
Imputasi nilai yang hilang untuk PCA
Saya menggunakan prcomp()fungsi untuk melakukan PCA (analisis komponen utama) di R. Namun, ada bug di fungsi itu sehingga na.actionparameter tidak berfungsi. Saya meminta bantuan pada stackoverflow ; dua pengguna di sana menawarkan dua cara berbeda dalam menangani NAnilai. Namun, masalah dengan kedua solusi tersebut adalah ketika ada NAnilai, baris itu …

3
Interpretasi nomor AIC & BIC
Saya mencari contoh bagaimana menafsirkan estimasi AIC (kriteria informasi Akaike) dan BIC (kriteria informasi Bayesian). Bisakah perbedaan negatif antara BIC ditafsirkan sebagai peluang posterior dari satu model di atas yang lain? Bagaimana saya bisa mengatakannya dengan kata-kata? Misalnya BIC = -2 dapat menyiratkan bahwa peluang model yang lebih baik daripada …

1
Mengatur simpul dalam splines kubik alami di R
Saya memiliki data dengan banyak fitur yang berkorelasi, dan saya ingin memulai dengan mengurangi fitur dengan fungsi basis yang halus, sebelum menjalankan LDA. Saya mencoba menggunakan splines kubik alami dalam splinespaket dengan nsfungsi. Bagaimana cara menetapkan knot? Berikut kode R dasar: library(splines) lda.pred <- lda(y ~ ns(x, knots=5)) Tetapi saya …
23 r  splines 

4
Perpustakaan C ++ untuk komputasi statistik
Saya punya algoritma MCMC tertentu yang ingin saya porting ke C / C ++. Sebagian besar perhitungan mahal dalam C sudah melalui Cython, tapi saya ingin agar seluruh sampler ditulis dalam bahasa yang dikompilasi sehingga saya bisa menulis pembungkus untuk Python / R / Matlab / apa pun. Setelah menyodok …
23 mcmc  software  c++  computing 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.