Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Menentukan perbedaan dalam model perbedaan dengan beberapa periode waktu
Ketika saya memperkirakan perbedaan dalam model perbedaan dengan dua periode waktu, model regresi yang setara akan Sebuah. Yist=α+γs∗Treatment+λdt+δ∗(Treatment∗dt)+ϵistYist=α+γs∗Treatment+λdt+δ∗(Treatment∗dt)+ϵistY_{ist} = \alpha +\gamma_s*Treatment + \lambda d_t + \delta*(Treatment*d_t)+ \epsilon_{ist} di mana adalah boneka yang sama dengan 1 jika observasi dari kelompok perlakuanTreatmentTreatmentTreatment dan adalah boneka yang sama dengan 1 pada periode waktu …

2
Apakah caret train berfungsi untuk memvalidasi silang glmnet untuk alpha dan lambda?
Apakah caretpaket R memvalidasi silang baik untuk model alphamaupun lambdauntuk glmnetmodel? Menjalankan kode ini, eGrid <- expand.grid(.alpha = (1:10) * 0.1, .lambda = (1:10) * 0.1) Control <- trainControl(method = "repeatedcv",repeats = 3,verboseIter =TRUE) netFit <- train(x =train_features, y = y_train, method = "glmnet", tuneGrid = eGrid, trControl = Control) …

4
Menghasilkan variabel acak dari campuran distribusi Normal
Bagaimana saya bisa mengambil sampel dari distribusi campuran, dan khususnya campuran distribusi normal R? Misalnya, jika saya ingin mengambil sampel dari: 0.3×N(0,1)+0.5×N(10,1)+0.2×N( 3 , .1 )0,3×N(0,1)+0,5×N(10,1)+0,2×N(3,.1) 0.3\!\times\mathcal{N}(0,1)\; + \;0.5\!\times\mathcal{N}(10,1)\; + \;0.2\!\times\mathcal{N}(3,.1) bagaimana saya bisa melakukan itu?

3
Pendekatan yang lebih lembut terhadap statistik Bayesian
Saya baru-baru ini mulai membaca "Pengantar Statistik Bayesian" Edisi ke-2 oleh Bolstad. Saya memiliki kelas statistik pengantar yang mencakup sebagian besar tes statistik dan saya hampir melalui kelas dalam analisis regresi. Buku apa lagi yang bisa saya gunakan untuk menambah pemahaman saya tentang buku ini? Saya telah berhasil melewati 100-125 …



2
Apa yang terjadi ketika saya memasukkan variabel kuadrat dalam regresi saya?
Saya mulai dengan regresi OLS saya: y=β0+β1x1+β2D+εy=β0+β1x1+β2D+ε y = \beta _0 + \beta_1x_1+\beta_2 D + \varepsilon mana D adalah variabel dummy, perkiraan menjadi berbeda dari nol dengan nilai p yang rendah. Saya kemudian membentuk tes Ramsey RESET dan menemukan bahwa saya memiliki beberapa kesalahan persamaan, dengan demikian saya memasukkan kuadrat …


5
Mengapa repot dengan perkiraan peringkat rendah?
Jika Anda memiliki matriks dengan kolom n rows dan m, Anda dapat menggunakan SVD atau metode lain untuk menghitung perkiraan peringkat rendah dari matriks yang diberikan. Namun, perkiraan peringkat rendah masih akan memiliki kolom n rows dan m. Bagaimana perkiraan peringkat rendah berguna untuk pembelajaran mesin dan pemrosesan bahasa alami, …

4
Intuisi statistik / pengertian data
Saya seorang mahasiswa tahun kedua sarjana, belajar Matematika, dan saya telah berbicara dengan salah satu profesor saya tentang perbedaan antara kemampuan matematika dan kemampuan statistik. Salah satu perbedaan utama yang ia kemukakan adalah "data sense" yang ia jelaskan sebagai kombinasi dari kemampuan teknis saat beroperasi dalam seperangkat apa yang secara …


4
Apa distribusi rata-rata bulat dari variabel acak Poisson?
Jika saya memiliki variabel acak yang terdistribusi Poisson dengan parameter , berapakah distribusi (yaitu rata-rata integer)?X1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_nλ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_nY=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor Sejumlah Poissons juga Poisson, tetapi saya tidak cukup percaya diri dalam statistik untuk menentukan apakah itu sama untuk kasus di atas.

2
Merencanakan interval kepercayaan untuk probabilitas yang diprediksi dari regresi logistik
Ok, saya memiliki regresi logistik dan telah menggunakan predict()fungsi untuk mengembangkan kurva probabilitas berdasarkan perkiraan saya. ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") Ini bagus, tetapi saya ingin tahu tentang …


3
Dapatkah algoritma MIC untuk mendeteksi korelasi non-linear dijelaskan secara intuitif?
Baru-baru ini, saya membaca dua artikel. Yang pertama adalah tentang sejarah korelasi dan yang kedua adalah tentang metode baru yang disebut Maximal Information Coefficient (MIC). Saya butuh bantuan Anda untuk memahami metode MIC untuk memperkirakan korelasi non-linear antara variabel. Selain itu, Instruksi penggunaannya dalam R dapat ditemukan di situs web …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.