Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Kapan pendekatan Bayesian sangat penting untuk mengatasi teori, hipotesis atau masalah?
Sebuah pertanyaan baru-baru ini diposting ke listserve yang saya ikuti (mungkin secara sinis?) Ketika pendekatan Bayesian sangat penting untuk "menyelesaikan pekerjaan" dalam menangani pertanyaan di bidang ekologi. Saya bertanya-tanya, secara umum, tentang kapan pendekatan Bayesian sangat penting untuk kemajuan dalam bidang tertentu. Dalam ekologi, metode Bayesian tampaknya paling sering digunakan …

1
mendeteksi plagiarisme pada tes pilihan ganda
Misalkan invigilator mencurigai satu siswa menyalin jawaban dari kertas siswa lain selama ujian pilihan ganda. Dia kemudian memeriksa jawaban mereka dan menemukan beberapa kesamaan — tetapi di sisi lain, pasti ada kesamaan karena sifat ujian. Bagaimana seharusnya dia menentukan apakah kecurigaannya terbukti? Dengan kata lain, dia pasti harus membandingkan ujian …

3
Bagaimana cara membakukan array jika standar deviasi nol?
Saya mencoba untuk membakukan kolom dataset untuk regresi linier. Salah satu kolom memiliki standar deviasi = 0. def standardize(X): return (X - mean(X)) / std(X) Jadi kode ini tidak berfungsi. Apakah ada trik untuk menyelesaikan masalah ini? Saya sudah mencoba dua hal Lempar kolom dengan standar deviasi 0 karena itu …


1
Manifold regularisasi menggunakan grafik laplacian di SVM
Saya mencoba menerapkan Manifold Regularization di Support Vector Machines (SVMs) di Matlab. Saya mengikuti instruksi di kertas oleh Belkin et al. (2006), ada persamaan di dalamnya: f∗=argminf∈Hk∑li=1V(xi,yi,f)+γA∥f∥2A+γI∥f∥2If∗=argminf∈Hk∑i=1lV(xi,yi,f)+γA‖f‖A2+γI‖f‖I2f^{*} = \text{argmin}_{f \in H_k}\sum_{i=1}^{l}V\left(x_i,y_i,f\right)+\gamma_{A}\left\| f \right\|_{A}^{2}+\gamma_{I}\left\| f \right\|_{I}^{2} di mana V adalah beberapa fungsi kerugian dan γAγA\gamma_A adalah bobot norma fungsi dalam RHKS …

1
Memahami masalah Behrens – Fisher
Bagian dari artikel ini mengatakan: Ronald Fisher pada tahun 1935 memperkenalkan inferensi fidusia untuk menerapkannya pada masalah ini. Dia merujuk pada makalah sebelumnya oleh WV Behrens dari tahun 1929. Behrens dan Fisher mengusulkan untuk menemukan distribusi probabilitas mana dan adalah dua mean sampel, dan dan adalah standar deviasi mereka. [. …

1
Distribusi mana pada [0,1] selain dari distribusi beta yang membentuk senyawa-senyawa yang bagus dengan distribusi binomial?
Untuk distribusi x mana, selain beta, apakah distribusi x-binomial bagus? Distribusi beta dan binomial adalah konjugat terkenal tetapi saya ingin tahu apakah distribusi non-konjugat lainnya akan memberikan senyawa pmfs yang relatif sederhana. Maksud saya, PMF itu bagus untuk dihitung tanpa menggunakan integrasi numerik; Saya tidak mengacu pada kemudahan pengambilan sampel …

1
Interval kepercayaan saat menggunakan teorema Bayes
Saya menghitung beberapa probabilitas bersyarat, dan interval kepercayaan 95% yang terkait. Untuk banyak kasus saya, saya memiliki jumlah xkeberhasilan langsung dari npercobaan (dari tabel kontingensi), sehingga saya dapat menggunakan interval kepercayaan Binomial, seperti yang disediakan oleh binom.confint(x, n, method='exact')in R. Namun dalam kasus lain, saya tidak memiliki data seperti itu, …

4
p-value sebagai jarak?
Dapatkah nilai-p antara tes berpasangan berganda dianggap sebagai pengukuran kesamaan / jarak dan penskalaan multidimensi diterapkan pada matriks nilai-p berpasangan untuk mengurangi dimensi? Ini adalah pertanyaan lunak, tetapi apa yang akan menjadi masalah terbesar di sini, dan bagaimana cara terbaik untuk mengatasinya? (mis: ketimpangan segitiga?)

1
Perbandingan rata-rata mengikuti beberapa imputasi
Saya perlu melakukan beberapa perbandingan rata-rata sederhana antara kelompok (tes ANOVA dasar) pada data dengan nilai yang hilang. Saya menggunakan paket tikus dalam R untuk beberapa imputasi, tapi saya hanya bisa mengumpulkan hasil untuk koefisien model linier, atau .R2R2R^2 Adakah yang tahu cara menggabungkan beberapa statistik F dari setiap model …

2
Proses Dirichlet untuk pembelajaran yang diawasi?
Sepertinya ketika saya melihat-lihat algoritma pembelajaran yang modis, hal-hal seperti jaringan saraf, pohon-pohon yang dikuatkan, mesin vektor pendukung, hutan acak, dan teman-teman dipromosikan untuk masalah pembelajaran yang diawasi. Proses Dirichlet dan sejenisnya tampaknya sebagian besar disebutkan dalam masalah belajar tanpa pengawasan, seperti pengelompokan dokumen atau gambar. Saya melihat mereka terbiasa …



1
Pemodelan spline dari waktu ke waktu - desain matriks dan survei pendekatan
Variabel respon y adalah fungsi nonlinier dari sejumlah variabel prediktor X (dalam data nyata saya respon didistribusikan secara biner, tetapi di sini saya menggunakan nilai yang didistribusikan secara normal untuk kesederhanaan). Saya dapat memodelkan hubungan antara prediktor dan respons menggunakan splines / smooths (misalnya, model GAM dalam mgcvpaket di R). …
8 r  ggplot2  splines  gam 

2
Bagaimana distribusi gamma terbalik terkait dengan dan ?
Mengingat bahwa estimasi posterior dari kemungkinan normal dan gamma terbalik sebelum adalah:σ′ 2σ′2\sigma'^{2}σ2σ2\sigma^2 σ′2∼ IG ( α +n2, β+∑ni = 1(ysaya-μ)22)σ′2∼IG(α+n2,β+∑i=1n(yi−μ)22)\sigma'^{2}\sim\textrm{IG}\left(\alpha + \frac{n}{2}, \beta +\frac{\sum_{i=1}^n{(y_i-\mu)^2}}{2}\right) yang setara dengan σ′ 2∼ IG(n2,nσ22)σ′2∼IG(n2,nσ22)\sigma'^{2}\sim\textrm{IG}\left( \frac{n}{2}, \frac{n\sigma^2}{2}\right) karena yang lemah sebelum menghapus dan dari persamaan 1:IG (α , β)IG(α,β)\textrm{IG}(\alpha, \beta)σ2σ2\sigma^2αα\alphaββ\beta σ′ 2∼ IG (n2,∑ni …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.