Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Apa gunanya prior non-informatif?
Mengapa bahkan memiliki prior non-informatif? Mereka tidak memberikan informasi tentang . Jadi mengapa menggunakannya? Mengapa tidak hanya menggunakan prior informatif? Misalnya, misalkan . Lalu apakah adalah non-informatif sebelum ?θ ∈ [ 0 , 1 ] θ ∼ U ( 0 , 1 ) θθθ\thetaθ ∈ [ 0 , 1 ]θ∈[0,1] …

1
Bagaimana Anda memilih variabel dalam model regresi?
Pendekatan tradisional untuk pemilihan variabel adalah menemukan variabel yang berkontribusi paling besar dalam memprediksi respons baru. Baru-baru ini saya belajar tentang alternatif untuk ini. Dalam memodelkan variabel yang menentukan efek dari suatu pengobatan - seperti misalnya dalam uji klinis farmasi - variabel tersebut dikatakan saling berinteraksi secara kualitatif.dengan pengobatan jika, …


1
Regresi kuantil logistik - cara terbaik menyampaikan hasil
Dalam posting sebelumnya saya bertanya-tanya bagaimana cara menangani skor EQ-5D . Baru-baru ini saya menemukan regresi kuantil logistik yang disarankan oleh Bottai dan McKeown yang memperkenalkan cara yang elegan untuk menangani hasil yang terbatas. Rumusnya sederhana: logit(y)=log(y−yminymax−y)logit(y)=log(y−yminymax−y)logit(y)=log(\frac{y-y_{min}}{y_{max}-y}) Untuk menghindari log (0) dan pembagian dengan 0 Anda memperluas rentang dengan nilai …

3
Bagaimana cara terbaik untuk mengkomunikasikan ketidakpastian?
Masalah besar dalam mengkomunikasikan hasil perhitungan statistik kepada media dan kepada publik adalah bagaimana kita mengkomunikasikan ketidakpastian. Tentu saja sebagian besar media massa tampaknya menyukai angka yang keras dan cepat, meskipun kecuali dalam jumlah kasus yang relatif kecil, angka selalu memiliki beberapa ketidakpastian. Jadi, bagaimana kita, sebagai ahli statistik (atau …

2
Berkaitan dengan jangka waktu volume
Perhatikan grafik berikut: Garis merah (sumbu kiri) menggambarkan volume perdagangan saham tertentu. Garis biru (sumbu kanan) menjelaskan volume pesan twitter untuk stok itu. Misalnya, pada 9 Mei (05-09) sekitar 1.100 juta perdagangan dan 4.000 tweet dibuat. Saya ingin menghitung apakah ada korelasi antara jangka waktu, baik pada hari yang sama …

2
Nilai korelasi palsu yang diharapkan
Kami menarik sampel , masing-masing ukuran , secara independen dari distribusi Normal .n ( μ , σ 2 )NNNnnn(μ,σ2)(μ,σ2)(\mu,\sigma^2) Dari sampel kami kemudian memilih 2 sampel yang memiliki korelasi Pearson tertinggi (absolut) satu sama lain.NNN Berapa nilai yang diharapkan dari korelasi ini? Terima kasih [PS Ini bukan pekerjaan rumah]

1
Memperkirakan distribusi dari data
Saya memiliki sampel data yang dihasilkan Roleh rnorm(50,0,1), jadi data jelas mengambil distribusi normal. Namun, Rtidak "tahu" informasi distribusi ini tentang data. Apakah ada metode Ryang dapat memperkirakan jenis distribusi sampel saya berasal? Jika tidak, saya akan menggunakan shapiro.testfungsi dan melanjutkan dengan cara itu.
12 r  distributions 


2
Kapan harus menggunakan teknik bootstrap vs bayesian?
Saya memiliki masalah analisis keputusan yang agak rumit yang melibatkan pengujian reliabilitas dan pendekatan logis (bagi saya) tampaknya melibatkan penggunaan MCMC untuk mendukung analisis Bayesian. Namun, telah disarankan bahwa akan lebih tepat untuk menggunakan pendekatan bootstrap. Bisakah seseorang menyarankan referensi (atau tiga) yang mungkin mendukung penggunaan salah satu teknik di …

3
Apa distribusi pada kuadran k-dimensi positif dengan matriks kovarians parametrizable?
Berikut zzk 's pertanyaan pada masalah dengan simulasi negatif, saya bertanya-tanya apa keluarga parametrized distribusi pada kuadran k-dimensi positif, yang kovarians matriks dapat ditetapkan.Rk+R+k\mathbb{R}_+^kΣΣ\Sigma Seperti yang didiskusikan dengan zzk , mulai dari distribusi pada dan menerapkan transformasi linear tidak berfungsi.Rk+R+k\mathbb{R}_+^kX⟶Σ1/2(X−μ)+μX⟶Σ1/2(X−μ)+μX \longrightarrow\Sigma^{1/2} (X-\mu) + \mu

2
Model Bayesian Hirarki (?)
Mohon maaf, pemotongan istilah statistik saya :) Saya telah menemukan beberapa pertanyaan di sini yang terkait dengan iklan dan tarif klik. Tetapi tidak satu pun dari mereka yang sangat membantu saya dengan pemahaman saya tentang situasi hierarkis saya. Ada pertanyaan terkait Apakah representasi setara model Bayesian hierarkis yang sama? , …

2
Menganalisis koefisien regresi logistik
Berikut adalah daftar koefisien regresi logistik (yang pertama adalah intersep) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 Saya merasa aneh bagaimana intersepnya sangat rendah dan saya memiliki koefisien yang sebenarnya sama dengan 0. Saya tidak sepenuhnya yakin bagaimana saya akan menafsirkannya. Apakah 0 mengindikasikan bahwa variabel spesifik …

1
Paket python untuk bekerja dengan model campuran Gaussian (GMM)
Tampaknya ada beberapa opsi yang tersedia untuk bekerja dengan Gaussian Mixture Model (GMMs) dengan Python. Sekilas, setidaknya ada: PyMix - http://www.pymix.org/pymix/index.php Alat untuk pemodelan campuran PyEM - http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/ yang merupakan bagian dari Scipy toolbox dan tampaknya berfokus pada Pembaruan GMM : Sekarang dikenal sebagai sklearn.mixture . PyPR - http://pypr.sourceforge.net/ pengenalan …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.