Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Memeriksa apakah kepadatan adalah keluarga eksponensial
Mencoba membuktikan bahwa ini bukan milik keluarga eksponensial. f(y|a)=4(y+a)(1+4a);0&lt;y&lt;1,a&gt;0f(y|a)=4(y+a)(1+4a);0&lt;y&lt;1,a&gt;0f(y|a)=4\frac{(y+a)}{(1+4a)} ; 0 < y < 1 , a>0 Inilah pendekatan saya: f(y|a)=4(y+a)e−log(1+4a)f(y|a)=4(y+a)e−log(1+4a)f(y|a) = 4(y+a)e^{-log(1+4a)} f(y|a)=(4y)(1+ay)e−log(1+4a)f(y|a)=(4y)(1+ay)e−log(1+4a)f(y|a) = (4y)(1+\frac{a}{y})e^{-log(1+4a)} Membandingkannya dengan bentuk standar, dan yang harus menjadi fungsi hanya , tidak dapat didefinisikan dalam hal saja, seperti di tidak dapat dipisahkan. Apakah ini …

2
Berurusan dengan kinerja yang baik pada data pelatihan dan validasi, tetapi kinerja yang sangat buruk pada pengujian data
Saya memiliki masalah regresi dengan variabel 5-6k. Saya membagi data saya menjadi 3 set yang tidak tumpang tindih: pelatihan, validasi, dan pengujian. Saya melatih hanya menggunakan set pelatihan, dan menghasilkan banyak model regresi linier yang berbeda dengan memilih serangkaian 200 variabel yang berbeda untuk masing-masing model (saya mencoba sekitar 100k …


4
Regresi data yang mencakup tanggal
Saya memiliki dataset yang berisi beberapa ratus transaksi dari tiga pemasok yang beroperasi di 100+ negara selama periode tiga tahun. Kami telah menemukan bahwa negara penjualan bukan merupakan faktor penting dalam harga yang dicapai (produknya adalah komoditas global yang kurang lebih). Semua harga telah menurun secara signifikan dari waktu ke …

2
Apakah kita perlu khawatir tentang pencilan ketika menggunakan tes berbasis peringkat?
Mohon maaf jika ini adalah pertanyaan yang sangat mendasar. Jika kita memiliki data yang tidak terdistribusi secara normal (misalnya miring, uji Shapiro-Wilk signifikan) dan kita menggunakan metode berbasis peringkat (misalnya uji Peringkat Bertanda Wilcoxon), maka apakah kita perlu khawatir dengan pencilan? Bayangkan, misalnya, kami memplot data menggunakan boxplot dan sebagian …
8 outliers  ranks 


1
Argumen bobot dalam lm dan lme sangat berbeda dalam R-apakah saya menggunakannya dengan benar?
Jadi, bagi saya kelihatannya fungsi bobot dalam lm memberikan bobot pengamatan lebih besar, semakin besar nilai 'bobot' pengamatan, sedangkan fungsi lme di lme justru melakukan sebaliknya. Ini dapat diverifikasi dengan simulasi sederhana. #make 3 vectors- c is used as an uninformative random effect for the lme model a&lt;-c(1:10) b&lt;-c(2,4,6,8,10,100,14,16,18,20) c&lt;-c(1,1,1,1,1,1,1,1,1,1) …

2
Apakah ada alternatif untuk simulasi untuk menentukan distribusi jumlah peristiwa dari dua proses Poisson non-homogen dependen?
Model "canggih" untuk distribusi gol yang dicetak dalam pertandingan sepak bola adalah model Dixon dan Robinson (1998) "Model Proses Kelahiran untuk Pertandingan Sepak Bola Asosiasi" yang menjelaskan dua fenomena utama: 1) Lebih banyak gol yang dicetak pada akhir pertandingan daripada di awal (dihipotesiskan karena kelelahan yang diderita oleh kedua tim) …

1
Bagaimana beta sebelum mempengaruhi posterior di bawah kemungkinan binomial
Saya punya dua pertanyaan, Pertanyaan 1: Bagaimana saya bisa menunjukkan bahwa distribusi posterior adalah distribusi beta jika kemungkinannya adalah binomial dan yang sebelumnya adalah beta Pertanyaan 2: Bagaimana pilihan parameter sebelumnya mempengaruhi posterior? Bukankah seharusnya mereka semua sama? Apakah mungkin untuk menjawab pertanyaan-pertanyaan ini dalam R?

2
Kelompokkan variabel kategori dalam glmnet
Pertimbangkan kecocokan berikut: fit3a=glmnet(x,g4,family="multinomial",type.multinomial="grouped") Bagaimana cara saya menunjukkan kolom mana xyang kategorikal / multinomial? Apakah ada opsi untuk menentukan indeks variabel yang dikelompokkan? Dokumentasi menjelaskan opsi type.multinomialsebagai berikut: Jika "dikelompokkan" maka penalti laso yang dikelompokkan digunakan pada koefisien multinomial untuk suatu variabel. Ini memastikan mereka semua bersama-sama. Standarnya adalah "ungrouped".

1
Pemilihan parameter hyper penuh Bayesian di GPML
Apakah mungkin untuk melakukan pemilihan penuh parameter Bayesian (1) yang diperkirakan penuh (misalnya skala kovarian) dengan kode GPML, alih-alih memaksimalkan kemungkinan marginal (2)? Saya pikir menggunakan metode MCMC untuk menyelesaikan integral yang melibatkan hyper-parameter sebelumnya harus mengarah pada hasil yang lebih baik ketika berhadapan dengan overfitting. Sejauh pengetahuan saya, kerangka …

2
Menggunakan seperangkat regresi logistik biner dengan variabel respon kategoris pilihan ganda
Saya memiliki data survei kategoris tentang sikap masyarakat terhadap bidang kebijakan tertentu dari 13 negara. Variabel respons bersifat kategoris, dan mencakup 4 jawaban berbeda yang tidak dapat dipesan. Saya ingin membangun multi-level random-intercept dan random-slope model multinomial. Masalahnya adalah, bahwa jumlah kasus level-2 hanya 13, dan modelnya tidak bertemu, setidaknya …

2
Pemrograman quadratic ketika matriks tidak pasti positif
http://cran.r-project.org/web/packages/quadprog/quadprog.pdf Paket R quadprogtampaknya dapat menyelesaikan masalah pemrograman kuadrat hanya ketika matriks pasti positif.DDD Namun, ada kasus ketika matriks tidak pasti positif. sepertiDDD min(x2+y2−6xy)subject tox+y3x+yx,y≤≤≥1,1.5,0.min(x2+y2−6xy)subject tox+y≤1,3x+y≤1.5,x,y≥0.\begin{eqnarray} \min(x^2 + y^2 - 6xy) \\ \text{subject to}\quad\quad x + y &\leq& 1,\\ 3x + y &\leq& 1.5,\\ x,y &\geq& 0. \end{eqnarray} Bagaimana saya …
8 r  optimization 

3
Rekomendasi untuk statistik multivariat matematika dengan latihan
Saya membutuhkan tingkat pascasarjana, buku pelajaran matematika yang ketat tentang analisis multivariat dan inferensi untuk meningkatkan diri. Saya telah membaca Elemen Pembelajaran Statistik dan melakukan masalah di dalamnya, tetapi saya membutuhkan buku dengan fokus lain. Topik seperti distribusi terkenal (Wishart, Wilks lambda, dll.), Pengujian hipotesis, beberapa teori tentang estimasi (titik, …

1
Analisis Bayesian hierarkis tentang perbedaan proporsi
Kenapa Hierarkis? : Saya sudah mencoba meneliti masalah ini, dan dari apa yang saya pahami, ini adalah masalah "hierarkis", karena Anda membuat pengamatan tentang pengamatan dari suatu populasi, daripada membuat pengamatan langsung dari populasi itu. Referensi: http://www.econ.umn.edu/~bajari/iosp07/rossi1.pdf Kenapa Bayesian? : Juga, saya telah menandainya sebagai Bayesian karena solusi asimptotik / …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.