Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Temukan UMVUE dari
Biarkan menjadi variabel acak iid yang memiliki pdfX1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) dimana . Berikan UMVUE dari dan hitung variansnyaθ>0θ>0\theta >01θ1θ\frac{1}{\theta} Saya telah belajar tentang dua metode seperti itu untuk memperoleh UMVUE: Batas Bawah Cramer-Rao (CRLB) Lehmann-Scheffe Thereom Saya akan mencoba ini menggunakan yang pertama …

1
Interpretasi Efek Tetap dari Regresi Logistik Efek Campuran
Saya bingung dengan pernyataan di halaman web UCLA tentang efek campuran regresi logistik. Mereka menunjukkan tabel koefisien efek tetap dari pemasangan model seperti itu dan paragraf pertama tampaknya menafsirkan koefisien persis seperti regresi logistik normal. Tetapi ketika mereka berbicara tentang rasio odds, mereka mengatakan Anda harus menafsirkannya tergantung pada efek …

2
A '' variabel signifikan '' yang tidak meningkatkan prediksi out-of-sample - bagaimana menafsirkan?
Saya punya pertanyaan yang menurut saya akan sangat mendasar bagi banyak pengguna. Saya menggunakan model regresi linier untuk (i) menyelidiki hubungan beberapa variabel penjelas dan variabel respons saya dan (ii) memprediksi variabel respons saya menggunakan variabel penjelas. Satu variabel penjelas X tertentu tampaknya secara signifikan mempengaruhi variabel respons saya. Untuk …


2
Mengapa kita menggunakan residu untuk menguji asumsi kesalahan dalam regresi?
Misalkan kita memiliki model .Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i Regresi memiliki sejumlah asumsi, seperti kesalahan seharusnya didistribusikan secara normal dengan mean nol dan varian konstan. Saya telah diajarkan untuk memeriksa asumsi-asumsi ini menggunakan plot QQ normal untuk menguji normalitas residual dan plot …

4
Bagaimana membuktikan secara statistik jika suatu kolom memiliki data kategorikal atau tidak menggunakan Python
Saya memiliki bingkai data dalam python di mana saya perlu menemukan semua variabel kategori. Memeriksa jenis kolom tidak selalu berhasil karena intjenisnya juga bisa kategoris. Jadi saya mencari bantuan dalam menemukan metode pengujian hipotesis yang tepat untuk mengidentifikasi apakah suatu kolom termasuk kategori atau tidak. Saya mencoba di bawah uji …

1
Apa perbedaan antara decision_function, predict_proba, dan fungsi prediksi untuk masalah regresi logistik?
Saya telah melalui dokumentasi sklearn tetapi saya tidak dapat memahami tujuan dari fungsi-fungsi ini dalam konteks regresi logistik. Untuk decision_functionitu dikatakan bahwa jarak antara hyperplane dan contoh uji. bagaimana informasi khusus ini bermanfaat? dan bagaimana hal ini berhubungan dengan predictdan predict-probametode?



5
Peluang bersyarat - apakah mereka unik untuk Bayesianisme?
Saya bertanya-tanya apakah probabilitas bersyarat itu unik bagi Bayesianisme, atau apakah probabilitas lebih merupakan konsep umum yang dibagi di antara beberapa aliran pemikiran di antara orang-orang yang memiliki statistik / probabilitas. Saya agak berasumsi, karena saya berasumsi bahwa tidak ada yang bisa agak masuk akal, jadi saya pikir frequentist setidaknya …

3
Distribusi
Sebagai latihan rutin, saya mencoba mencari distribusi X2+Y2−−−−−−−√X2+Y2\sqrt{X^2+Y^2} mana XXXdanYYYadalahvariabelbebasU(0,1)U(0,1) U(0,1)independen. Kepadatan bersama (X,Y)(X,Y)(X,Y) adalah fX,Y(x,y)=10&lt;x,y&lt;1fX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right), karenacosθcos⁡θ\cos\thetaberkurang padaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]; danzsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right), karenasinθsin⁡θ\sin\thetameningkat padaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]. Jadi, untuk 1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2 , kami memilikicos−1(1z)&lt;θ&lt;sin−1(1z)cos−1⁡(1z)&lt;θ&lt;sin−1⁡(1z)\cos^{-1}\left(\frac{1}{z}\right)<\theta<\sin^{-1}\left(\frac{1}{z}\right). Nilai absolut dari transformasi jacobian adalah |J|=z|J|=z|J|=z Jadi densitas gabungan (Z,Θ)(Z,Θ)(Z,\Theta) diberikan oleh fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2√),θ∈(cos−1(1/z),sin−1(1/z))}fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2),θ∈(cos−1⁡(1/z),sin−1⁡(1/z))}f_{Z,\Theta}(z,\theta)=z\mathbf 1_{\{z\in(0,1),\,\theta\in\left(0,\pi/2\right)\}\bigcup\{z\in(1,\sqrt2),\,\theta\in\left(\cos^{-1}\left(1/z\right),\sin^{-1}\left(1/z\right)\right)\}} Mengintegrasikan θθ\theta , kami memperoleh …

2
Kerugian KL dengan unit Gaussian
Saya telah mengimplementasikan VAE dan saya perhatikan dua implementasi online berbeda dari divergensi KL gaussian univariat yang disederhanakan. Perbedaan asli sebagai per sini adalah Jika kita menganggap kami sebelumnya adalah unit gaussian yaituμ2=0danσ2=1, menyederhanakan ini ke KLloss=-log(σ1)+σ 2 1 +μ 2 1KL.l o s s= log( σ2σ1) + σ21+ ( …

1
Filter ARIMA vs Kalman - bagaimana hubungannya?
Ketika saya mulai membaca tentang filter Kalman ia berpikir bahwa itu adalah kasus khusus model ARIMA (yaitu ARIMA (0,1,1)). Tapi sebenarnya situasinya sepertinya lebih rumit. Pertama-tama, ARIMA dapat digunakan untuk prediksi dan filter Kalman untuk penyaringan. Tapi bukankah mereka terkait erat? Pertanyaan: Apa hubungan antara filter ARIMA dan Kalman? Apakah …


3
Hyperplanes secara optimal mengklasifikasikan data ketika input independen dengan kondisi - Mengapa?
Dalam makalah yang disebut Deep Learning dan Information Bottleneck Principle , penulis menyatakan di bagian II A) berikut ini: Neuron tunggal mengklasifikasikan hanya input yang dapat dipisahkan secara linear, karena mereka hanya dapat mengimplementasikan hiperplanes dalam ruang inputnya . Hyperplanes dapat secara optimal mengklasifikasikan data ketika input secara independen tergantung.u=wh+bu=wh+bu …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.