Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Prasyarat untuk konversi dari rasio odds ke risiko relatif agar valid
sebagai pertanyaan, karena kita dapat melakukan konversi dari rasio odds (p1/q1)/(p2/q2)ke risiko relatif (p1/(p1+q1))/(p2/(p2+q2))dengan mudah, saya bertanya-tanya apakah ada sesuatu yang perlu saya perhatikan sebelum melakukan ini? Jelas bahwa jika saya melakukan studi kasus-kontrol, saya tidak boleh melakukan konversi, karena saya tidak pernah tahu risiko relatif dari studi semacam ini, …

1
Koreksi kontinuitas untuk uji chi-square Pearson dan McNemar
Saya pikir ini adalah pertanyaan yang agak mendasar, tetapi saya baru sadar bahwa saya tidak begitu mengerti istilah koreksi kontinuitas. Saya menggunakan R dan menemukan sintaks yang sama correct=TRUEuntuk keduanya chisq.testdan mcnemar.test. Apakah mereka mengacu pada metode koreksi kontinuitas yang berbeda? Saya telah mendengar tentang kesinambungan yate untuk uji pearson …

5
Membuat kuadrat-akar matriks kovarians positif-pasti (Matlab)
Motivasi : Saya sedang menulis estimator keadaan di MATLAB (filter Kalman tanpa pewangi), yang menyerukan pembaruan akar kuadrat (segitiga-atas) dari matriks kovarians pada setiap iterasi (yaitu, untuk matriks kovarian , memang benar bahwa ). Agar saya dapat melakukan perhitungan yang diperlukan, saya perlu melakukan Update dan Downdate Cholesky Rank-1 menggunakan …

4
Apa interpretasi rentang interkuartil?
Saya memiliki pengukuran harian nitrogen dioksida selama satu tahun (365 hari) dan interkuartil (IQR) adalah 24 mikrogram per meter kubik. Apa arti "24" dalam konteks ini, selain dari definisi IQR yang merupakan perbedaan antara persentil ke-25 dan ke-75 ? Bagaimana Anda menjelaskan angka ini kepada wartawan, misalnya? Terima kasih

4
Memperkirakan dimensi kumpulan data
Seorang kolega dalam statistik terapan mengirimi saya ini: "Saya bertanya-tanya apakah Anda tahu cara untuk mengetahui dimensi sebenarnya dari suatu fungsi. Misalnya, lingkaran adalah fungsi satu dimensi dalam ruang dua dimensi. Jika saya tidak tahu cara menggambar, apakah ada statistik yang dapat saya hitung yang memberi tahu saya bahwa itu …

4
Melakukan partialling atau meregresi variabel kategorikal?
Kadang-kadang saya melihat dalam literatur bahwa variabel kategori seperti seks adalah "partialled" atau "regressed" dalam analisis regresi (efek tetap atau efek campuran). Saya bermasalah dengan masalah-masalah praktis berikut yang terlibat dalam pernyataan seperti itu: (1) Biasanya metode pengkodean tidak disebutkan dalam makalah. Variabel seperti itu harus dikodekan dengan nilai-nilai kuantitatif, …

2
Engsel kehilangan dengan satu-vs-semua classifier
Saat ini saya sedang melihat bentuk primitif satu-vs-semua yang tidak dibatasi ∑i=1NI∑k=1,k≠yiNKL(1+wk⋅xi−wyi⋅xi)∑i=1NI∑k=1,k≠yiNKL(1+wk⋅xi−wyi⋅xi)\sum\limits_{i=1}^{N_I} \sum\limits_{k=1,\atop k \neq y_i}^{N_K} L(1+ \mathbf{w_k}\cdot\mathbf{x_i}-\mathbf{w_{y_i}}\cdot\mathbf{x_i}) dimana NININ_I adalah jumlah instance, NKNKN_K adalah jumlah kelas, NFNFN_F adalah jumlah fitur, XXX adalah NK×NFNK×NFN_K \times N_F matriks data, yyy adalah vektor label kelas, WWW adalah NK×NINK×NIN_K \times N_I matriks di …

4
Menghitung kesalahan pengklasifikasi Bayes secara analitis
Jika dua kelas dan memiliki distribusi normal dengan parameter yang diketahui ( , sebagai sarana dan , adalah kovarian mereka) bagaimana kita dapat menghitung kesalahan dari classifier Bayes untuk mereka secara teori?w1w1w_1w2w2w_2M.1M.1M_1M.2M.2M_2Σ1Σ1\Sigma_1Σ2Σ2\Sigma_2 Anggap pula variabel-variabel berada dalam ruang dimensi-N. Catatan: Salinan pertanyaan ini juga tersedia di https://math.stackexchange.com/q/11891/4051 yang masih belum …


1
Penggunaan estimasi kepadatan kernel di Naive Bayes Classifier?
Pertanyaan ini merupakan tindak lanjut dari pertanyaan saya sebelumnya di sini dan juga terkait, dengan maksud, dengan pertanyaan ini . Pada halaman wiki ini, nilai kepadatan probabilitas dari asumsi distribusi normal untuk rangkaian pelatihan digunakan untuk menghitung posterior Bayes daripada nilai probabilitas aktual. Namun, jika set pelatihan tidak terdistribusi secara …
9 bayesian  kde 



1
Produk distribusi beta
Saya melihat efisiensi pemicu, artinya saya memiliki beberapa perangkat yang menyala kkk dari nnnacara Pada akhirnya saya tertarik pada beberapa estimasi efisiensiϵϵ\epsilonyang merupakan probabilitas untuk menembak pada peristiwa yang diberikan secara acak. Menggunakan pendekatan Bayesian dengan seragam sebelumnya[ 0 , 1 ][0,1][0,1] Saya dapat memodelkan distribusi probabilitas untuk ϵϵ\epsilon sebagai …

2
Analisis data variabel kontinu dan Kategorikal
Saya punya tiga variabel: jarak (kontinu, kisaran tak terbatas negatif hingga tak terhingga positif) isLand (kategori diskrit / Boolean, rentang variabel 1 atau 0) penghuni (kategori diskrit, rentang variabel 0-7) Saya ingin menjawab pertanyaan statistik berikut: Bagaimana cara membandingkan distribusi yang memiliki variabel kategorikal dan kontinu. Sebagai contoh, saya ingin …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.