Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Proporsi varians yang dijelaskan dalam PCA dan LDA
Saya punya beberapa pertanyaan mendasar tentang PCA (analisis komponen utama) dan LDA (analisis diskriminan linier): Dalam PCA ada cara untuk menghitung proporsi varian yang dijelaskan. Apakah mungkin untuk LDA? Jika ya, bagaimana caranya? Apakah "Proportion of trace" output dari ldafungsi (dalam perpustakaan R MASS) setara dengan "proporsi varian dijelaskan"?

1
Masalah dengan kriging biasa
Saya mengikuti artikel wiki ini yang berhubungan dengan kriging biasa Sekarang matriks kovarians saya terlihat seperti ini, untuk 4 variabel 1 0.740818220681718 0.548811636094027 0.406569659740599 0.740818220681718 1 0.740818220681718 0.548811636094027 0.548811636094027 0.740818220681718 1 0.740818220681718 0.406569659740599 0.548811636094027 0.740818220681718 1 Nah hubungan antara semvariogram dan variogram diberikan oleh γ(h)/(C0)=1−C(h)/C(0)γ(h)/(C0)=1−C(h)/C(0)\gamma(h)/(C0) = 1 - C(h)/C(0) Jadi, …


3
Apa implikasi unit root MA?
Proses ARMA (p, q) lemah stasioner, jika akar bagian AR-nya tidak ada di lingkaran unit. Jadi stasioneritasnya yang lemah tidak tergantung pada bagian MA-nya. Tetapi apa yang bisa disiratkan oleh posisi-posisi akar dari bagian MA-nya? Dalam tes unit root untuk ARIMA, unit root dari polinomial MA menunjukkan bahwa data terlalu …

1
Jika Anda menjalankan regresi OLS pada data cross sectional, haruskah Anda menguji autokorelasi dalam residu?
Saya memiliki serangkaian pengamatan, tidak tergantung waktu. Saya bertanya-tanya apakah saya harus menjalankan tes autokorelasi? Menurut saya itu tidak masuk akal, karena tidak ada komponen waktu dalam data saya. Namun, saya benar-benar mencoba uji LM korelasi serial, dan ini menunjukkan autokorelasi kuat dari residu. Apakah itu masuk akal? Yang saya …

1
Bagaimana cara menghitung tindakan yang berulang dalam glmer?
Desain saya adalah sebagai berikut. yyy adalah respons Bernoulli x1x1x_1 adalah variabel kontinu x2x2x_2 adalah variabel (faktor) variabel dengan dua level Eksperimen sepenuhnya dalam subjek. Artinya, setiap subjek menerima setiap kombinasi dan .x1x1x_1x2x2x_2 Ini adalah tindakan berulang yang dilakukan untuk mengatur regresi logistik. Eksperimen akan memberikan dua tawaran untuk vs …

2
Di MCMC, bagaimana waktu burn-in dipilih?
Di MCMC, bagaimana waktu burn-in dipilih? Dengan kata lain, berapa lama Anda perlu menunggu sebelum Anda berpikir rantai Markov telah mencapai distribusi terbatasnya? Terima kasih!
8 mcmc 

2
Kesalahan standar estimasi distribusi hiperbolik menggunakan metode delta?
Saya ingin menghitung kesalahan standar dari distribusi hiperbolik yang dipasang. Dalam notasi saya, kepadatan diberikan oleh Saya menggunakan paket HyperbolicDistr di R. Saya memperkirakan parameter melalui perintah berikut:H(l;α,β,μ,δ)=α2−β2−−−−−−√2αδK1(δα2−β2−−−−−−√)exp(−αδ2+(l−μ)2−−−−−−−−−−√+β(l−μ))H(l;α,β,μ,δ)=α2−β22αδK1(δα2−β2)exp(−αδ2+(l−μ)2+β(l−μ))\begin{align*} H(l;\alpha,\beta,\mu,\delta)&=\frac{\sqrt{\alpha^2-\beta^2}}{2\alpha \delta K_1 (\delta\sqrt{\alpha^2-\beta^2})} exp\left(-\alpha\sqrt{\delta^2+(l-\mu)^2}+\beta(l-\mu)\right) \end{align*} hyperbFit(mydata,hessian=TRUE) Ini memberi saya parameterisasi yang salah. Saya mengubahnya menjadi parameterisasi yang saya inginkan dengan hyperbChangePars(from=1,to=2,c(mu,delta,pi,zeta))perintah. …


2
Bayesian mengatur NNs atas NNs klasik
Saya telah melihat beberapa artikel penelitian yang mengklaim bahwa jaringan saraf klasik biasanya kurang memiliki kemampuan generalisasi yang memuaskan, yang biasanya menghasilkan prediksi yang tidak tepat, dan JST yang diregulasi Bayesian (BRANNs) lebih kuat daripada jaring propagasi balik standar dan dapat mengurangi atau menghilangkan perlu untuk validasi silang yang panjang. …

3
Alternatif untuk model logit multinomial
Saya mencoba memperkirakan model pilihan pekerjaan dengan tiga pilihan. Adakah alternatif untuk menggunakan regresi logistik multinomial ketika menangani hasil kategorikal yang tidak berurutan seperti itu? Ketika berhadapan dengan variabel dependen biner tampaknya ada beberapa pilihan seperti model LPM serta model probit dan logit biner. Ketika berhadapan dengan variabel kategori tidak …

2
auto.arima tidak mengenali pola musiman
Saya memiliki satu set data cuaca harian, yang memiliki, efek musiman sangat kuat, tidak mengejutkan. Saya mengadaptasi model ARIMA ke kumpulan data ini menggunakan fungsi auto.arima dari paket perkiraan. Yang mengejutkan saya, fungsi ini tidak menerapkan operasi musiman - perbedaan musiman, komponen musiman atau komponen. Berikut adalah model yang diperkirakan: …

2
Merugikan hasil kriteria pengelompokan
Saya telah melakukan pengelompokan titik koordinat (bujur, lintang) dan menemukan hasil yang mengejutkan dan merugikan dari kriteria pengelompokan untuk jumlah cluster yang optimal. Kriteria diambil dari clusterCrit()paket. Poin-poin yang saya coba klaster pada plot (karakteristik geografis dari kumpulan data terlihat jelas): Prosedur lengkapnya adalah sebagai berikut: Melakukan pengelompokan hierarkis pada …
8 r  clustering 

2
Menggunakan peta pengorganisasian diri untuk pengurangan dimensi
Selama beberapa hari terakhir, saya telah melakukan beberapa penelitian tentang pengorganisasian peta untuk sebuah proyek di sekolah. Saya telah memahami bahwa peta yang dapat diatur sendiri dapat digunakan untuk mengurangi dimensi data Anda. Namun, saya tidak mengerti cara kerjanya. Misalnya, Anda memiliki jaringan 10x10 neuron dalam SOM, dan input Anda …

1
Kapan menggunakan median sampel sebagai penduga untuk median distribusi lognormal?
Saya sendiri akan selalu menggunakan mean geometrik untuk memperkirakan median lognormal. Namun, di dunia industri, kadang-kadang menggunakan median sampel memberikan hasil yang lebih baik. Dengan demikian pertanyaannya adalah, adakah rentang cutoff / titik mulai dari mana median sampel dapat digunakan secara andal sebagai penduga untuk median populasi? Juga, rata-rata geometris …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.