Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana cara menguji apakah ?
Misalkan saya memiliki tiga grup independen, dengan mean masing-masing.μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 Bagaimana saya bisa menguji apakah atau tidak menggunakan sampel dari setiap grup?μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 Saya ingin mengetahui beberapa metodologi umum, bukan perhitungan terperinci. Saya tidak tahu cara menetapkan hipotesis saya dan …

2
Bagaimana menemukan matriks kovarians poligon?
Bayangkan Anda memiliki poligon yang didefinisikan oleh seperangkat koordinat (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n) dan pusat massanya adalah pada (0,0)(0,0)(0,0) . Anda dapat memperlakukan poligon sebagai distribusi seragam dengan batas poligon. Saya mencari metode yang akan menemukan matriks kovarian poligon . Saya menduga bahwa matriks kovarians poligon terkait erat dengan momen kedua dari area …

2
Kemungkinan
Misalkan dan adalah variabel acak geometris independen dengan parameter . Berapa probabilitas ?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 Saya bingung tentang pertanyaan ini karena kami tidak diberi tahu apa pun tentang dan selain geometris. Tidakkah ini menjadi karena dan dapat berupa apa saja dalam rentang tersebut?X1X1X_1X2X2X_250%50%50\%X1X1X_1X2X2X_2 EDIT: Upaya baru P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1 ≥ X2) = …

3
Cara mengurangi prediktor dengan cara yang tepat untuk model regresi logistik
Jadi saya telah membaca beberapa buku (atau bagian dari mereka) tentang pemodelan (F. Harrell "Strategi Pemodelan Regresi" antara lain), karena situasi saya saat ini adalah bahwa saya perlu melakukan model logistik berdasarkan data respon biner. Saya memiliki data kontinu, kategoris, dan biner (prediktor) dalam kumpulan data saya. Pada dasarnya saya …

1
Mengapa posterior Bayesian berkonsentrasi di sekitar minimiser divergence KL?
Pertimbangkan Bayesian posterior . Secara asimptotik, maksimum terjadi pada estimasi MLE , yang hanya memaksimalkan kemungkinan .θ∣Xθ∣X\theta\mid Xθ^θ^\hat \thetaargminθfθ(X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) Semua konsep ini — prior Bayesian, memaksimalkan kemungkinan — terdengar super berprinsip dan sama sekali tidak sewenang-wenang. Tidak ada catatan yang terlihat. Namun MLE meminimalkan divergensi KL antara distribusi nyata …


2
Estimasi ketidakpastian dalam masalah inferensi dimensi tinggi tanpa sampel?
Saya sedang mengerjakan masalah inferensi dimensi tinggi (sekitar 2000 parameter model) yang kami mampu melakukan estimasi MAP dengan kuat dengan menemukan maksimum global log-posterior menggunakan kombinasi optimasi berbasis gradien dan algoritma genetika. Saya sangat ingin dapat membuat beberapa estimasi ketidakpastian pada parameter model selain menemukan estimasi MAP. Kami dapat menghitung …

2
Mengapa regresi logistik dikalibrasi dengan baik, dan bagaimana cara merusak kalibrasi?
Dalam scikit mempelajari dokumen tentang probabilitas kalibrasi mereka membandingkan regresi logistik dengan metode lain dan menyatakan bahwa hutan acak kurang dikalibrasi dengan baik daripada regresi logistik. Mengapa regresi logistik dikalibrasi dengan baik? Bagaimana seseorang dapat merusak kalibrasi dari regresi logistik (bukan yang ingin dilakukannya - seperti latihan)?

1
Mengapa informasi tentang data validasi bocor jika saya mengevaluasi kinerja model pada data validasi ketika menyetel hyperparameters?
Dalam Pembelajaran Dalam François Chollet dengan Python dikatakan: Akibatnya, menyetel konfigurasi model berdasarkan kinerjanya pada set validasi dapat dengan cepat menghasilkan overfitting ke set validasi, meskipun model Anda tidak pernah dilatih secara langsung mengenai hal itu. Inti dari fenomena ini adalah gagasan kebocoran informasi. Setiap kali Anda menyetel hyperparameter model …


1
Memeriksa apakah koin itu adil
Saya ditanya pertanyaan berikut oleh seorang teman. Saya tidak bisa membantunya tetapi saya berharap seseorang dapat menjelaskannya kepada saya. Saya tidak dapat menemukan contoh serupa. Terima kasih atas bantuan dan penjelasannya. T: Hasil dari 100 percobaan lemparan koin dicatat sebagai 0 = "Ekor" dan 1 = "Kepala". Output x adalah …

1
Bagaimana anak-anak mengatur untuk mengumpulkan orang tua mereka dalam proyeksi PCA dari kumpulan data GWAS?
Ambil 20 titik acak dalam ruang 10.000 dimensi dengan setiap koordinat iid dari . Bagi mereka menjadi 10 pasangan ("pasangan") dan tambahkan rata-rata setiap pasangan ("anak") ke dataset. Kemudian lakukan PCA pada 30 poin yang dihasilkan dan plot PC1 vs PC2.N(0,1)N(0,1)\mathcal N(0,1) Suatu hal yang luar biasa terjadi: setiap "keluarga" …


4
Optimalisasi penurunan gradien
Saya mencoba memahami optimasi gradient descent dalam algoritma ML (pembelajaran mesin). Saya mengerti bahwa ada fungsi biaya — di mana tujuannya adalah untuk meminimalkan kesalahan . Dalam skenario di mana bobot sedang dioptimalkan untuk memberikan kesalahan minimum, dan turunan parsial digunakan, apakah itu mengubah dan di setiap langkah atau merupakan …

3
Regresi Residu Regresi Logistik pada Regresor lainnya
Dengan regresi OLS diterapkan pada respon kontinu, seseorang dapat membangun persamaan regresi berganda dengan menjalankan regresi residual secara berurutan pada setiap kovariat. Pertanyaan saya adalah, adakah cara untuk melakukan ini dengan regresi logistik melalui residu regresi logistik ? Pr(Y=1|x,z)Pr(Y=1|x,z)\Pr(Y = 1 | x, z)xxxR1R1R_1R1R1R_1zzz

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.