Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Analisis Diskriminan Linier dan data yang didistribusikan secara tidak normal
Jika saya mengerti dengan benar, Analisis Diskriminan Linier (LDA) mengasumsikan data terdistribusi normal, fitur independen, dan kovarian identik untuk setiap kelas untuk kriteria optimalitas. Karena mean dan varians diperkirakan dari data pelatihan, bukankah itu sudah merupakan pelanggaran? Saya menemukan kutipan dalam sebuah artikel (Li, Tao, Shenghuo Zhu, dan Mitsunori Ogihara. …

1
Menggunakan aturan penilaian yang tepat untuk menentukan keanggotaan kelas dari regresi logistik
Saya menggunakan regresi logistik untuk memprediksi kemungkinan suatu peristiwa terjadi. Pada akhirnya, probabilitas ini dimasukkan ke dalam lingkungan produksi, tempat kami memfokuskan sebanyak mungkin pada prediksi kami yang "Ya". Oleh karena itu berguna bagi kita untuk memiliki gagasan tentang "hit" atau "non-hit" definitif apa yang mungkin menjadi apriori (sebelum berjalan …

1
Apakah populasi orang Mars bermata biru menurun?
Misalkan kita ingin menguji hipotesis bahwa proporsi orang-orang Mars bermata biru telah menurun sepanjang abad ke-20. Sayangnya, populasi Mars berfluktuasi sangat tinggi, sehingga setiap dekade ada perbedaan besar dalam total populasi [pembaruan: anggap populasi Mars konstan pada satu miliar penduduk Mars. Data di bawah ini adalah sampel acak pada setiap …

1
mana dan didistribusikan secara lognormal
Saya mencoba untuk menghitung ekspektasi untuk arbitrary (untuk ekspektasinya tidak terbatas) jika didistribusikan secara lognormal, yaitu .E[ec X]E[ecX]E[e^{cX}]c &lt; 0c&lt;0c<0c &gt; 0c&gt;0c>0XXXcatatan( X) ∼ N( μ , σ)log⁡(X)∼N(μ,σ)\log(X) \sim N(\mu, \sigma) Gagasan saya adalah menuliskan ekspektasi sebagai integral, tetapi saya tidak melihat bagaimana melanjutkan: E[ec X] =12 σπ---√∫∞01xexp( c x …

1
Hyper-volume kontur dari Gaussian multivarian
Saya mencari assymptotic yang ( ) nilai (log dari penentu) kovarians dari % dari pengamatan dengan jarak Eucledian terkecil ke asal dalam sampel berukuran diambil dari, katakanlah , Gaussian standar bivariat.n→∞n→∞n\rightarrow \inftyαα\alphannn - Volume hiper-elips sebanding dengan faktor penentu matriks kovariansnya, maka judulnya-- --Dengan standar bivariat Gaussian, maksud saya mana …

2
bawah Gaussian
Pertanyaan ini mengarah dari pertanyaan berikut. /math/360275/e1-1x2-under-a-normal-distribution Pada dasarnya apa itu bawah Gaussian . Saya mencoba menulis ulang sebagai campuran skalar dari Gaussians ( ). Ini juga terhenti, kecuali kalian punya trik di bawah ikat pinggang Anda.E(11 +x2)E(11+x2)E\left(\frac{1}{1+x^2}\right)N( μ ,σ2)N(μ,σ2)\mathcal{N}(\mu,\sigma^2)11 +x211+x2\frac{1}{1+x^2}∝ ∫N( x | 0 ,τ- 1) G a ( …

1
Bagaimana tepatnya jumlah (atau rata-rata) batasan keterpusatan untuk splines (juga wrt gam dari mgcv) dilakukan?
Proses menghasilkan data adalah:y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y = \text{sin}\Big(x+I(d=0)\Big) + \text{sin}\Big(x+4*I(d=1)\Big) + I(d=0)z^2 + 3I(d=1)z^2 + \mathbb{N}\left(0,1\right) Misalkan menjadi urutan dari ke dengan panjang dan menjadi faktor yang sesuai . Ambil semua kemungkinan kombinasi untuk menghitung : x,zx,zx,z−4−4-4444100100100dddd∈{0,1}d∈{0,1}d\in\{0,1\}x,z,dx,z,dx,z,dyyy Menggunakan B-spline-Basis (tidak terpusat) untuk untuk setiap tingkat tidak akan layak oleh properti-of-unity-properti (baris jumlah …

1
R - power.prop.test, prop.test, dan ukuran sampel yang tidak sama dalam tes A / B
Katakanlah saya ingin tahu ukuran sampel apa yang saya butuhkan untuk percobaan di mana saya ingin menentukan apakah perbedaan dalam dua proporsi keberhasilan itu signifikan secara statistik. Inilah proses saya saat ini: Lihatlah data historis untuk menetapkan prediksi baseline. Katakan bahwa di masa lalu, mengambil tindakan menghasilkan tingkat keberhasilan 10% …

1
Kapan tepat menggunakan PCA sebagai langkah preproses?
Saya mengerti bahwa PCA digunakan untuk reduksi dimensionalitas agar dapat merencanakan dataset dalam 2D ​​atau 3D. Tetapi saya juga melihat orang yang menerapkan PCA sebagai langkah preprocessing dalam skenario klasifikasi di mana mereka menerapkan PCA untuk mengurangi jumlah fitur, kemudian mereka menggunakan beberapa Komponen Utama (vektor eigen dari matriks kovarians) …

2
Analisis survival dalam R dengan data terpotong kiri
Saya melakukan analisis survival dalam R dengan survivalpaket. Saya pikir saya bekerja dengan data terpotong kiri, tapi saya tidak sepenuhnya yakin bagaimana menanganinya. Saya memiliki kohort pasien yang didiagnosis antara 1990 dan 2012. Semua pasien memiliki waktu diagnosis yang jelas (waktu masuk). Namun, hasil yang menarik (penyakit spesifik yang memburuk) …



3
Menghitung ukuran efek dan kesalahan standar untuk perbedaan antara dua perbedaan rata-rata terstandarisasi
Saya memiliki dua pertanyaan terkait, yang keduanya terkait dengan meta-analisis yang saya lakukan di mana di mana hasil utama dinyatakan dalam perbedaan standar rata-rata. Studi saya memiliki banyak variabel yang tersedia untuk menghitung perbedaan rata-rata terstandarisasi. Saya ingin mengetahui sejauh mana perbedaan rata-rata terstandarisasi yang dihitung pada satu variabel konsisten …


2
Apakah nilai p juga tingkat penemuan yang salah?
Dalam http://surveyanalysis.org/wiki/Multiple_Comparisons_(Post_Hoc_Testing) menyatakan Sebagai contoh, jika kita memiliki nilai p 0,05 dan kita menyimpulkan itu signifikan, probabilitas penemuan palsu, menurut definisi, 0,05. Pertanyaan saya: Saya selalu berpikir bahwa penemuan yang salah adalah kesalahan Tipe I, yang sama dengan tingkat signifikansi yang dipilih dalam kebanyakan tes. Nilai-P adalah nilai yang dihitung …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.