Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Di CLT, mengapa ?
Biarkan menjadi pengamatan independen dari distribusi yang memiliki rata-rata dan varians , ketika , makaX1,...,XnX1,...,XnX_1,...,X_nμμ\muσ2&lt;∞σ2&lt;∞\sigma^2 < \inftyn→∞n→∞n \rightarrow \infty n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). Mengapa ini menyiratkan bahwa X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

3
Uji hubungan untuk DV berdistribusi normal dengan variabel independen terarah?
Apakah ada tes hipotesis apakah variabel dependen yang terdistribusi normal dikaitkan dengan variabel yang terdistribusi secara terarah ? Sebagai contoh, jika waktu dalam sehari adalah variabel penjelas (dan menganggap hal-hal seperti hari dalam seminggu, bulan dalam setahun, dll. Tidak relevan) - itu adalah bagaimana menjelaskan fakta bahwa 11 malam adalah …


1
Apakah pernah merupakan ide yang baik untuk memberikan "kredit parsial" (hasil terus menerus) dalam pelatihan regresi logistik?
Saya sedang melatih regresi logistik untuk memprediksi pelari mana yang paling mungkin menyelesaikan lomba ketahanan yang melelahkan. Sangat sedikit pelari yang menyelesaikan lomba ini, jadi saya memiliki ketidakseimbangan kelas yang parah dan sejumlah kecil keberhasilan (mungkin beberapa lusin). Saya merasa seperti saya bisa mendapatkan "sinyal" yang bagus dari lusinan pelari …


5
Menjelaskan Mean, Median, Mode dalam Ketentuan Layman
Bagaimana Anda akan menjelaskan konsep mean, median, dan mode daftar angka dan mengapa mereka penting bagi seseorang dengan hanya keterampilan aritmatika dasar? Jangan menyebutkan kemiringan, CLT, kecenderungan sentral, sifat statistiknya, dll. Saya telah menjelaskan kepada seseorang bahwa maksudnya hanyalah cara cepat dan kotor untuk "meringkas" daftar angka. Tapi melihat ke …

2
Mengapa Rao-Blackwell Teorema membutuhkan
Teorema Rao-Blackwell menyatakan Biarkan θ menjadi estimator dari θ dengan E ( θ 2 ) &lt; ∞ untuk semua θ . Misalkan T cukup untuk θ , dan biarkan θ * = E ( θ | T ) Lalu untuk semua θ , E ( θ * - θ ) …


3
Apa yang seharusnya menjadi informasi sebelumnya untuk lereng ketika melakukan regresi linier?
Ketika melakukan regresi linear bayesian, kita perlu menetapkan prior untuk kemiringan dan mencegat . Karena adalah parameter lokasi, masuk akal untuk menetapkan seragam sebelumnya; Namun, bagi saya tampaknya mirip dengan parameter skala dan tampaknya tidak wajar untuk menetapkan seragam sebelum itu.aaabbbbbbaaa Di sisi lain, sepertinya tidak tepat untuk menetapkan Jeffrey …

3
Fitur peringkat dalam regresi logistik
Saya menggunakan Regresi Logistik. Saya memiliki enam fitur, saya ingin tahu fitur-fitur penting dalam pengklasifikasi ini yang lebih memengaruhi hasil daripada fitur lainnya. Saya menggunakan Penguatan Informasi tetapi tampaknya itu tidak bergantung pada classifier yang digunakan. Apakah ada metode untuk memeringkat fitur sesuai dengan kepentingannya berdasarkan klasifikasi tertentu (seperti Regresi …

3
Haruskah fungsi delta Dirac dianggap sebagai subkelas dari distribusi Gaussian?
Dalam Wikidata adalah mungkin untuk menautkan distribusi probabilitas (seperti yang lainnya) dalam ontologi, misalnya, bahwa distribusi-t adalah subkelas dari distribusi-t noncentral, lihat, misalnya, https://angryloki.github.io/wikidata-graph-builder/?property=P279&amp;item=Q209675&amp;iterations=3&amp;limit=3 Ada berbagai kasus pembatas, misalnya, ketika derajat kebebasan dalam distribusi-t pergi hingga tak terbatas atau ketika varians mendekati nol untuk distribusi normal (distribusi Gaussian). Dalam kasus …

1
Apakah ada statistik nyata di balik "teorema baseball Pythagoras"?
Saya membaca buku tentang sabermetrics, khususnya Mathletics oleh Wayne Winston, dan di bab pertama ia memperkenalkan kuantitas yang dapat digunakan untuk memprediksi tingkat kemenangan tim: dan ia sepertinya mengisyaratkan bahwa, di pertengahan musim, itu dapat digunakan untuk memprediksi tingkat kemenangan lebih baik daripada tingkat kemenangan pada paruh pertama musim. Ia …

1
NeuralNetwork lapisan tunggal dengan aktivasi ReLU sama dengan SVM?
Misalkan saya memiliki jaringan neural single layer yang sederhana, dengan n input dan output tunggal (tugas klasifikasi biner). Jika saya mengatur fungsi aktivasi di node output sebagai fungsi sigmoid- maka hasilnya adalah classifier Logistic Regression. Dalam skenario yang sama ini, jika saya mengubah aktivasi output ke ReLU (unit linear yang …


1
Dua Sampel uji chi kuadrat
Pertanyaan ini dari buku Asymptotic Statistics Van der Vaart, hal. 253. # 3: Misalkan XmXm\mathbf{X}_m dan YnYn\mathbf{Y}_n adalah vektor multinomial independen dengan parameter ( m , a1, ... , ak)(m,Sebuah1,...,Sebuahk)(m,a_1,\ldots,a_k) dan ( n , b1, ... , bk)(n,b1,...,bk)(n,b_1,\ldots,b_k) . Di bawah hipotesis nol bahwa Sebuahsaya= bsayaSebuahsaya=bsayaa_i=b_i menunjukkan bahwa ∑i = …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.