Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Regresi hutan acak tidak memprediksi lebih tinggi dari data pelatihan
Saya perhatikan ketika membangun model regresi hutan acak, setidaknya dalam R, nilai prediksi tidak pernah melebihi nilai maksimum dari variabel target yang terlihat dalam data pelatihan. Sebagai contoh, lihat kode di bawah ini. Saya sedang membangun model regresi untuk memprediksi mpgberdasarkan mtcarsdata. Saya membuat OLS dan model hutan acak, dan …
12 r  random-forest 

4
Bootstrap vs Monte Carlo, estimasi kesalahan
Saya membaca artikel Galat propagasi oleh metode Monte Carlo dalam perhitungan geokimia, Anderson (1976) dan ada sesuatu yang tidak saya mengerti. Pertimbangkan beberapa data terukur dan program yang memprosesnya dan mengembalikan nilai yang diberikan. Dalam artikel ini, program ini digunakan untuk pertama-tama mendapatkan nilai terbaik menggunakan sarana data (yaitu: { …

2
"Dasi tidak boleh ada" dalam uji Kolmgorov-Smirnov satu sampel di R
Saya akan menggunakan tes Kolmogorov-Smirnov untuk menguji normalitas MYDATA di R. Ini adalah contoh dari apa yang saya lakukan ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) Inilah hasil yang diberikan R kepada saya: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be …

3
Lasso vs Lasso adaptif
LASSO dan LASSO adaptif adalah dua hal yang berbeda, bukan? (Bagiku, hukumannya terlihat berbeda, tapi aku hanya memeriksa apakah aku melewatkan sesuatu.) Ketika Anda secara umum berbicara tentang jaring elastis, apakah case khusus LASSO atau LASSO adaptif? Paket glmnet mana yang dilakukan, asalkan Anda memilih alpha = 1? LASSO yang …

2
Apakah model seri waktu perbedaan log lebih baik daripada tingkat pertumbuhan?
Seringkali saya melihat penulis memperkirakan model "perbedaan log", misalnya catatan( yt) - log( yt - 1) = log( yt/ yt - 1) = α + βxtcatatan⁡(yt)-catatan⁡(yt-1)=catatan⁡(yt/yt-1)=α+βxt\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t Saya setuju ini sesuai untuk menghubungkan dengan perubahan persentase dalam sementara adalah .y t log ( …

1
Pengambilan sampel dari distribusi marjinal menggunakan distribusi bersyarat?
Saya ingin sampel dari kepadatan univariat tapi saya hanya tahu hubungannya:fXfXf_X fX(x)=∫fX|Y(x|y)fY(y)dy.fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. Saya ingin menghindari penggunaan MCMC (langsung pada representasi integral) dan, karena dan mudah untuk diambil sampelnya, saya berpikir untuk menggunakan sampler berikut :fX|Y(x|y)fX|Y(x|y)f_{X\vert Y}(x\vert y)fY(y)fY(y)f_Y(y) Untuk .j=1,…,Nj=1,…,Nj=1,\dots, N Contoh .yj∼fYyj∼fYy_j \sim f_Y …


3
Perbedaannya adalah ringkasan statistik: koefisien Gini dan standar deviasi
Ada beberapa statistik ringkasan. Ketika Anda ingin menggambarkan penyebaran distribusi yang dapat Anda gunakan misalnya standar deviasi atau koefisien Gini . Saya tahu bahwa standar deviasi didasarkan pada kecenderungan sentral, yaitu deviasi dari nilai tengah, dan koefisien Gini merupakan ukuran umum dari dispersi. Saya juga tahu bahwa koefisien Gini memiliki …

1
Pemodelan Bayesian tentang waktu tunggu kereta: Definisi model
Ini adalah upaya pertama saya untuk seseorang yang datang dari kamp frequentist untuk melakukan analisis data Bayesian. Saya membaca sejumlah tutorial dan beberapa bab dari Bayesian Data Analysis oleh A. Gelman. Sebagai contoh analisis data pertama yang kurang lebih independen saya memilih adalah kereta menunggu waktu. Saya bertanya pada diri …
12 bayesian  pymc 


1
Bagaimana menyesuaikan bobot ke dalam nilai-Q dengan pendekatan fungsi linear
Dalam pembelajaran penguatan, pendekatan fungsi linear sering digunakan ketika ruang keadaan besar hadir. (Ketika mencari tabel menjadi tidak layak.) Bentuk nilai dengan pendekatan fungsi linear diberikan olehQ−Q-Q- Q(s,a)=w1f1(s,a)+w2f2(s,a)+⋯,Q(s,Sebuah)=w1f1(s,Sebuah)+w2f2(s,Sebuah)+⋯,Q(s,a) = w_1 f_1(s,a) + w_2 f_2(s,a) + \cdots, di mana adalah bobot, dan adalah fitur.wiwsayaw_ififsayaf_i Fitur-fiturnya sudah ditentukan oleh pengguna. Pertanyaan saya …


2
Metode rotasi faktor (varimax, oblimin, dll.) - apa arti namanya dan apa yang dilakukan metode tersebut?
Analisis faktor memiliki beberapa metode rotasi, seperti varimax, quartimax, equamax, promax, oblimin, dll. Saya tidak dapat menemukan informasi apa pun yang menghubungkan nama mereka dengan matematika aktual atau statistik. Mengapa disebut "equa-max" atau "quarti-max"? Dengan cara apa sumbu atau matriks diputar sehingga mereka memiliki nama seperti itu? Sayangnya, kebanyakan dari …

3
Sumber daya untuk analisis deret waktu Terganggu dalam R
Saya cukup baru di R. Saya telah mencoba membaca tentang analisis deret waktu dan telah selesai Analisis seri Waktu Shumway dan Stoffer dan penerapannya Edisi ke-3 , Peramalan Hyndman yang sangat baik : prinsip dan praktik Avril Coghlan's Menggunakan R untuk Time Series Analysis A. Ian McLeod dkk. Analisis Rangkaian …
12 r  time-series 

2
Mengoptimalkan Mesin Vektor Dukungan dengan Pemrograman Quadratic
Saya mencoba memahami proses pelatihan mesin vektor dukungan linear . Saya menyadari bahwa properti SMV memungkinkan mereka dioptimalkan lebih cepat daripada dengan menggunakan pemecah pemrograman kuadratik, tetapi untuk tujuan pembelajaran saya ingin melihat bagaimana ini bekerja. Data pelatihan set.seed(2015) df <- data.frame(X1=c(rnorm(5), rnorm(5)+5), X2=c(rnorm(5), rnorm(5)+3), Y=c(rep(1,5), rep(-1, 5))) df X1 …
12 r  svm  optimization 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.