Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Menggunakan Distribusi yang Seragam untuk Menghasilkan Sampel Acak yang Berhubungan di R
[Pada pertanyaan baru-baru ini saya sedang mencari untuk menghasilkan vektor acak dalam R , dan saya ingin membagikan "penelitian" itu sebagai tanya jawab independen pada titik tertentu.] Menghasilkan data acak dengan korelasi dapat dilakukan dengan menggunakan dekomposisi Cholesky dari matriks korelasi sini , sebagaimana tercermin pada posting sebelumnya di sini …


1
Menghasilkan Variabel Acak Binomial dengan Korelasi yang diberikan
Misalkan saya tahu cara membuat Variabel Acak Binomial independen. Bagaimana saya bisa menghasilkan dua variabel acakXXX dan YYY seperti yang X∼Bin(8,23),Y∼Bin(18,23) and Corr(X,Y)=0.5X∼Bin(8,23),Y∼Bin(18,23) and Corr(X,Y)=0.5X\sim \text{Bin}(8,\dfrac{2}{3}),\quad Y\sim \text{Bin}(18,\dfrac{2}{3})\ \text{ and }\ \text{Corr}(X,Y)=0.5 Saya berpikir untuk mencoba menggunakan fakta itu XXX dan Y−ρXY−ρXY-\rho X independen di mana ρ=Corr(X,Y)ρ=Corr(X,Y)\rho=Corr(X,Y) tapi saya tidak …

4
Apakah non-stasioneritas dalam logit / probit penting?
Saya ingin bertanya - Saya menggunakan logit untuk menyelidiki, jika beberapa variabel meningkatkan risiko krisis mata uang. Saya memiliki data tahunan dari 1980 untuk banyak negara (panel tidak seimbang), variabel dummy adalah 1 jika krisis mata uang dimulai (menurut definisi saya), 0 sebaliknya. Variabel penjelas sesuai dengan beberapa teori, seperti …
8 logit  probit 


2
Model ekonometrik mana yang dapat digunakan untuk memperkirakan pengembalian keamanan + pertanyaan ARIMA / GARCH
Saya mencoba untuk menulis tesis sarjana di mana saya menguji kekuatan prediksi model ekonometrik yang diberikan pada serangkaian waktu keuangan tertentu. Saya butuh nasihat tentang bagaimana saya harus melakukan ini. Untuk memasukkan masalah ke dalam konteks, saya memiliki ekonometrika yang dipelajari sendiri; satu-satunya kursus saya mengambil subjek berhenti menggali model-model …

1
Model pembelajaran mesin “Ekspor” dari R
Saya dapat membangun dan menerapkan model ML klasik pada pelatihan / set tes tradisional di R, tetapi bagaimana jika seorang mitra ingin mendapatkan model ini untuk menerapkan sistemnya sendiri (apa pun)? Menyimpan dan mengirim struktur model-R tidak membantu, tentu saja; dan mencari tahu mekanisme prediksi tidak bekerja dalam banyak kasus …

1
Probabilitas pasangan nilai yang berurutan
Mari X=(x1,x2,...x20)X=(x1,x2,...x20)X=(x_1, x_2,...x_{20}) dimana xi∼N(0,1)xi∼N(0,1)x_i\sim N(0,1) dan xi,xjxi,xjx_i, x_j independen ∀i≠j∀i≠j\forall i\neq j. Berapa probabilitas untuk mendapatkan sampel XXX di mana setidaknya ada dua nilai berturut-turut xixix_i dan xi+1xi+1x_{i+1} seperti yang ⎧⎩⎨|xi||xi+1|xixi+1&gt;&gt;&lt;1.51.50{|xi|&gt;1.5|xi+1|&gt;1.5xixi+1&lt;0 \begin{cases} |x_{i}| & > & 1.5 \\ |x_{i+1}| & > & 1.5 \\ x_i x_{i+1} & < & …

2
Gagasan alternatif untuk aturan penilaian yang tepat, dan menggunakan aturan penilaian untuk mengevaluasi model
Sebuah aturan skoring adalah sarana mengevaluasi menebak sebuah agen dari probabilitas yang terkait dengan acara kategoris, diberi (kategoris) hasil dari acara tersebut. Bergantung pada tebakan dan hasil yang diamati, aturan pemberian skor memberi nilai pada agen (angka sebenarnya). Aturan penilaian seharusnya menetapkan skor sedemikian rupa sehingga, rata-rata, agen dengan skor …

2
Bagaimana unit softmax diturunkan dan apa implikasinya?
Saya mencoba memahami mengapa fungsi softmax didefinisikan seperti itu: ezjΣKk=1ezk=σ(z)ezjΣk=1Kezk=σ(z)\frac{e^{z_{j}}} {\Sigma^{K}_{k=1}{e^{z_{k}}}} = \sigma(z) Saya mengerti bagaimana ini menormalkan data dan memetakan dengan benar untuk beberapa rentang (0, 1) tetapi perbedaan antara probabilitas berat bervariasi secara eksponensial daripada linear. Apakah ada alasan mengapa kita menginginkan perilaku ini? Juga persamaan ini tampaknya …


1
Tinggi kurva distribusi normal
Untuk kurva distribusi normal 'berbentuk lonceng', orang akan berpikir bahwa ketinggian harus memiliki nilai ideal. Mengetahui nilai ini dapat menjadi salah satu indikator cepat untuk memeriksa apakah data terdistribusi secara normal. Namun, saya tidak dapat menemukan nilai formalnya. Sebagian besar tempat, bentuknya ditampilkan tetapi tidak pengukuran sumbu y. http://www.stat.yale.edu/Courses/1997-98/101/normal.htm Dalam …

2
PDF dari sejumlah variabel dependen
Ini adalah kelanjutan langsung dari pertanyaan terakhir saya . Hal yang sebenarnya ingin saya dapatkan adalah distribusi , di mana seragam dalam . Sekarang, distribusi berhasil dihitung di utas yang disebutkan , dan sebut saja . Distribusi hanyalah . Langkah terakhir adalah menghitung distribusi jumlah dan dengan cara yang mirip …

1
Apa tepatnya yang dilakukan dengan jalan acak?
Sejujurnya, saya telah membaca banyak situs web dan jawaban mengenai pertanyaan ini, dan tidak ada yang menjelaskannya dengan kata-kata sederhana yang dapat dimengerti. Yang ingin saya lakukan adalah memahami apa yang dilakukan dengan berjalan secara acak, dan bagaimana hal itu dapat digunakan untuk Analisis Pengayaan Gene Set. Ada makalah yang …

1
Masalah dengan prediksi deret waktu
Saya mendapat pertanyaan tentang pemodelan seri waktu dalam R. data saya terdiri dari matriks berikut: 1 0.03333333 0.01111111 0.9555556 2 0.03810624 0.02309469 0.9387991 3 0.00000000 0.03846154 0.9615385 4 0.03776683 0.03119869 0.9310345 5 0.06606607 0.01201201 0.9219219 6 0.03900325 0.02058505 0.9404117 7 0.03125000 0.01562500 0.9531250 8 0.00000000 0.00000000 1.0000000 9 0.04927885 0.01802885 …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.