Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Korelasi antara data kontinu dan jumlah data
Misalkan kita berurusan dengan kumpulan data ini mana adalah variabel kontinu (misalnya Eksponensial) dan adalah distribusi diskrit (misalnya Poisson) untuk . Mari kita mengatakan bahwa adalah korelasi antara dan . Bagaimana seseorang bisa mendefinisikan ? (Xsaya,Nsaya)(Xsaya,Nsaya)(X_i, N_i)XsayaXsayaX_iNsayaNsayaN_ii = 1 , . . . , nsaya=1,...,ni=1,...,nρρ\rhoXXXNNNρρ\rho


1
Apakah nilai-p Bayesian?
Saya mencari jawaban yang akan memuaskan pembaca yang memahami nilai-p yang sering tetapi hanya memahami dasar-dasar pendekatan Bayesian untuk statistik. Saat ini pencarian google tidak mengungkapkan definisi baik pada halaman Wikipedia atau sumber daya lain yang diterima secara umum. Pertanyaan ini tampaknya terkait tetapi tidak benar-benar sejak terungkap bahwa pengguna …


1
Prediksi Arimax: Menggunakan Paket Forecast
The arimaxfungsi dalam TSApaket adalah untuk pengetahuan saya satu-satunya Rpaket yang akan cocok dengan fungsi transfer untuk model intervensi. Tidak memiliki fungsi prediksi meskipun yang kadang-kadang diperlukan. Apakah langkah-langkah berikut untuk mengatasi masalah ini, memanfaatkan forecastpaket yang sangat baik ? Apakah interval prediksi benar? Dalam contoh saya, kesalahan std adalah …

1
MLE dari proses Hawkes multivarian
Saya berjuang dengan menerapkan penduga kemungkinan maksimum untuk proses Hawkes multivarian (HP). Secara khusus, sementara ekspresi analitik untuk fungsi log-likelihood dari HP univariat dapat ditemukan dengan mudah secara online (mis. Ozaki, 1979), tampaknya ada versi yang berbeda (tidak konsisten atau setara?) Dari fungsi log-likelihood dari HP multivarian. di luar sana. …

4
Mengapa metode Stouffer bekerja?
Sepertinya pertanyaan yang cukup mudah, tetapi ketika saya benar-benar memikirkannya, metode Stouffer tidak masuk akal bagi saya. Ini sebabnya: Asumsikan hipotesis dua sisi. Anda pertama-tama menghitung dari nilai- . Jadi mari kita ambil contoh yang cukup sederhana. Mari kita ambil dua -nilai . Ini berarti bahwa dan keduanya . Menurut …


5
Apakah nominal, ordinal, & biner untuk data kuantitatif, data kualitatif, atau keduanya?
Saya mendapatkan berbagai tipe data dan saya butuh bantuan: Jika Anda melihat gambar di atas (diambil dari sini ), ia memiliki tipe data seperti ini: Kuantitatif (Terpisah, Berkelanjutan) Kualitatif (Nominal (N), Ordinal (O), Binary (B)). Tetapi jika Anda melihat gambar berikut ini (dari sini ), kategorinya adalah: Kuantitatif (Diskrit (NOB)) …

2
Apa cara yang benar untuk menentukan fitur mana yang paling berkontribusi terhadap prediksi vektor input yang diberikan?
Saya menggunakan regresi logistik untuk klasifikasi biner. Saya memiliki satu set data besar (kebetulan sangat tidak seimbang: 19: 1). Jadi saya menggunakan scikit-learn's LogisticRegression()untuk melatih 80% dari data berlabel saya dan kemudian saya memvalidasi dengan 20% lainnya (saya melihat area di bawah ROC serta presisi-recall karena datanya sangat tidak seimbang; …

1
Statistik pesanan untuk distribusi beta
Misalkan menjadi undian dari . Bagaimana statistik pesanan minimum dan maksimum didistribusikan, masing-masing?x1,…,xnx1,…,xnx_1,\dots,x_nBeta(k2,k−p−12)Beta(k2,k−p−12)Beta\left(\frac{k}2,\frac{k-p-1}{2}\right) Saya akan sangat menghargai referensi jika memungkinkan. Secara umum saya tidak terbiasa dengan derivasi statistik pesanan. Sunting: Mengingat bahwa distribusi beta dapat diartikan sebagai statistik- untuk distribusi seragam, perkiraan saya adalah bahwa minimum atau maksimum distribusi beta …

3
Cara menghitung mean, median, mode, std dev dari distribusi
Bagaimana cara menghitung mean, varians, median, standar deviasi dan modus dari distribusi? Jika saya secara acak menghasilkan angka yang membentuk distribusi normal, saya telah menetapkan mean sebagai m=24.2standar deviasi seperti sd=2.2: > dist = rnorm(n=1000, m=24.2, sd=2.2) Maka saya bisa melakukan hal berikut: Berarti: > mean(dist) [1] 24.17485 Perbedaan: > …
9 r  distributions  mean 

2
Membiarkan
Saya belajar mandiri pada teori model linier sekarang, dan satu hal yang saya temukan mengejutkan adalah meskipun didefinisikan untuk vektor acak , tidak disebutkan lagi momen-momen selanjutnya selain matriks kovarians.E[Y]E[Y]\mathbb{E}[\mathbf{Y}]Y=⎡⎣⎢⎢⎢⎢y1y2⋮yn⎤⎦⎥⎥⎥⎥Y=[y1y2⋮yn]\mathbf{Y} = \begin{bmatrix} y_1 \\ y_2 \\ \vdots \\ y_n\end{bmatrix} Pencarian Google belum banyak berubah. Apakah momen th (raw) dipertimbangkan, atau …


1
Haruskah deviasi standar dikoreksi dalam uji T Student?
Menggunakan uji T Siswa, T-Critical dihitung melalui: t =X¯-μ0s /n√t=X¯−μ0s/nt = \frac{\bar{X} - \mu_{0}}{s / \sqrt{n}} Melihat artikel Wikipedia pada Estimasi berisi deviasi standar, ada bagian Hasil untuk Distribusi biasa yang menyebutkan faktor koreksi untuk diukur deviasi standar sampel, s , berdasarkan ukuran sampel. Pertanyaan:c4( n )c4(n)c_4(n) (1) Apakah faktor …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.