Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
MLE vs kuadrat terkecil dalam distribusi probabilitas pas
Kesan yang saya dapat, berdasarkan beberapa makalah, buku, dan artikel yang saya baca, adalah cara yang disarankan untuk menyesuaikan distribusi probabilitas pada set data adalah dengan menggunakan estimasi kemungkinan maksimum (MLE). Namun, sebagai seorang fisikawan, cara yang lebih intuitif adalah dengan menyesuaikan pdf model dengan pdf empiris data menggunakan kuadrat …


2
Cara terbaik untuk melakukan multiclass SVM
Saya tahu bahwa SVM adalah classifier biner. Saya ingin memperluasnya ke multi-class SVM. Mana yang terbaik, dan mungkin cara termudah untuk melakukannya? kode: di MATLAB u=unique(TrainLabel); N=length(u); if(N>2) itr=1; classes=0; while((classes~=1)&&(itr<=length(u))) c1=(TrainLabel==u(itr)); newClass=double(c1); tst = double((TestLabel == itr)); model = svmtrain(newClass, TrainVec, '-c 1 -g 0.00154'); [predict_label, accuracy, dec_values] = …


1
Bagaimana Uji Kuadrat Pearson Pearson bekerja
Setelah pemungutan suara baru-baru ini saya telah mencoba untuk memeriksa pemahaman saya tentang tes Pearson Chi Squared. Saya biasanya menggunakan statistik chi kuadrat (atau statistik chi kuadrat berkurang) untuk pas atau memeriksa cocok yang dihasilkan. Dalam hal ini varians biasanya bukan jumlah yang diharapkan dari hitungan dalam tabel atau histogram …

2
Apakah ada representasi grafis tradeoff bias-varians dalam regresi linier?
Saya menderita pemadaman. Saya disajikan gambar berikut untuk menunjukkan tradeoff bias-varians dalam konteks regresi linier: Saya dapat melihat bahwa tidak satu pun dari kedua model yang cocok - "sederhana" tidak menghargai kompleksitas hubungan XY dan "kompleks" hanya overfitting, pada dasarnya mempelajari data pelatihan dengan hati. Namun saya benar-benar gagal melihat …

2
Jalan acak dengan momentum
Pertimbangkan bilangan bulat acak mulai dari 0 dengan kondisi berikut: Langkah pertama adalah plus atau minus 1, dengan probabilitas yang sama. Setiap langkah di masa depan adalah: 60% kemungkinan berada di arah yang sama dengan langkah sebelumnya, 40% kemungkinan berada di arah yang berlawanan Jenis distribusi apa yang dihasilkannya? Saya …

4
Interval kepercayaan sempit - akurasi lebih tinggi?
Saya punya dua pertanyaan tentang interval kepercayaan: Rupanya interval kepercayaan yang sempit menyiratkan bahwa ada kemungkinan lebih kecil untuk mendapatkan pengamatan dalam interval itu, oleh karena itu, akurasi kami lebih tinggi. Interval kepercayaan 95% juga lebih sempit dari interval kepercayaan 99% yang lebih luas. Interval kepercayaan 99% lebih akurat daripada …

2
Mengapa pengujian chi-square menggunakan jumlah yang diharapkan sebagai varians?
Dalam pengujian , apa dasar untuk menggunakan akar kuadrat dari jumlah yang diharapkan sebagai standar deviasi (yaitu jumlah yang diharapkan sebagai variasi) dari masing-masing distribusi normal? Satu-satunya hal yang bisa saya temukan membahas ini sama sekali adalah http://www.physics.csbsju.edu/stats/chi-square.html , dan itu hanya menyebutkan distribusi Poisson.χ2χ2\chi^2 Sebagai ilustrasi sederhana dari kebingungan …

2
Apa cara yang benar untuk menguji perbedaan yang signifikan antara koefisien?
Saya berharap seseorang dapat membantu meluruskan titik kebingungan bagi saya. Katakanlah saya ingin menguji apakah 2 set koefisien regresi secara signifikan berbeda satu sama lain, dengan pengaturan berikut: yi=α+βxi+ϵiyi=α+βxi+ϵiy_i = \alpha + \beta x_i + \epsilon_i , dengan 5 variabel independen. 2 grup, dengan ukuran yang kira-kira sama (meskipun ini …

2
Distribusi yang menggambarkan perbedaan antara variabel terdistribusi binomial negatif?
Sebuah Skellam Distribusi menjelaskan perbedaan antara dua variabel yang memiliki distribusi Poisson. Apakah ada distribusi serupa yang menggambarkan perbedaan antara variabel yang mengikuti distribusi binomial negatif? Data saya dihasilkan oleh proses Poisson, tetapi mencakup cukup banyak noise, yang menyebabkan penyebaran berlebihan dalam distribusi. Dengan demikian, pemodelan data dengan distribusi binomial …

2
Bounding informasi mutual diberikan batasan pada informasi mutual pointwise
Misalkan saya memiliki dua set dan dan distribusi probabilitas gabungan atas set ini . Misalkan dan menunjukkan distribusi marginal lebih dari dan masing-masing.XXXYYYp(x,y)p(x,y)p(x,y)p(x)p(x)p(x)p(y)p(y)p(y)XXXYYY Informasi timbal balik antara dan didefinisikan sebagai: XXXYYYI(X;Y)=∑x,yp(x,y)⋅log(p(x,y)p(x)p(y))I(X;Y)=∑x,yp(x,y)⋅log⁡(p(x,y)p(x)p(y))I(X; Y) = \sum_{x,y}p(x,y)\cdot\log\left(\frac{p(x,y)}{p(x)p(y)}\right) yaitu itu adalah nilai rata-rata dari pmi information mutual pointwise .(x,y)≡log(p(x,y)p(x)p(y))(x,y)≡log⁡(p(x,y)p(x)p(y))(x,y) \equiv \log\left(\frac{p(x,y)}{p(x)p(y)}\right) Misalkan saya tahu …

2
Penaksir James-Stein: Bagaimana Efron dan Morris menghitung dalam faktor susut untuk contoh baseball mereka?
Saya punya pertanyaan tentang penghitungan faktor Penyusutan James-Stein dalam makalah Scientific American 1977 oleh Bradley Efron dan Carl Morris, "Stein's Paradox in Statistics" . Saya mengumpulkan data untuk pemain baseball dan diberikan di bawah ini: Name, avg45, avgSeason Clemente, 0.400, 0.346 Robinson, 0.378, 0.298 Howard, 0.356, 0.276 Johnstone, 0.333, 0.222 …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.