Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Hampir yakin konvergensi tidak menyiratkan konvergensi lengkap
Kita katakan konvergen sepenuhnya ke jika untuk setiap .X ϵ &gt; 0 ∑ ∞ n = 1 P ( | X n - X | &gt; ϵ ) &lt; ∞X1, X2, ...X1,X2,…X_1, X_2, \ldotsXXXϵ &gt; 0ϵ&gt;0\epsilon>0 ∑∞n = 1P ( | Xn- X| &gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty Dengan Borel, Cantelli's lemma …

1
Formula untuk Bayesian A / B Testing tidak masuk akal
Saya menggunakan rumus dari pengujian ab Bayesian untuk menghitung hasil tes AB menggunakan metodologi Bayesian. Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} dimana αAαA\alpha_A dalam satu ditambah jumlah keberhasilan untuk A βAβA\beta_A dalam satu ditambah jumlah kegagalan untuk A αBαB\alpha_B dalam satu ditambah jumlah keberhasilan untuk B βBβB\beta_B dalam …
10 r  bayesian  ab-test 

2
Implementasi validasi silang bersarang
Saya mencoba mencari tahu apakah pemahaman saya tentang validasi silang bersarang benar, oleh karena itu saya menulis contoh mainan ini untuk melihat apakah saya benar: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 …

3
Bagaimana cara mengklasifikasikan dataset yang tidak seimbang oleh Convolutional Neural Networks (CNN)?
Saya memiliki dataset tidak seimbang dalam tugas klasifikasi biner, di mana jumlah positif vs jumlah negatif adalah 0,3% vs 99,7%. Kesenjangan antara positif dan negatif sangat besar. Ketika saya melatih CNN dengan struktur yang digunakan dalam masalah MNIST, hasil pengujian menunjukkan Tingkat Negatif Palsu yang tinggi. Juga, kurva kesalahan latihan …

1
Apa matriks kovarians asimptotik?
Benarkah matriks kovarians asimptotik sama dengan matriks kovarians estimasi parameter? Jika tidak, apa itu? Dan apa perbedaan antara matriks kovarians dan matriks kovarians asimptotik dalam kasus itu? Terima kasih sebelumnya!


2
Penentu matriks informasi Fisher untuk model overparameter
Pertimbangkan variabel acak Bernoulli dengan parameter (probabilitas keberhasilan). Fungsi kemungkinan dan informasi Fisher ( matriks ) adalah:X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} Sekarang pertimbangkan versi "over-parameterized" dengan dua parameter: probabilitas keberhasilan θ1θ1\theta_1 dan probabilitas kegagalan θ0θ0\theta_0 . (Perhatikan …


3
Adakah yang setara dengan Skewness dan Kurtosis yang dinormalisasi?
Apa yang akan menjadi setara dinormalisasi dengan Skewness yang akan memiliki unit yang sama dengan data? Demikian pula, apa yang setara dengan Kurtosis yang dinormalisasi? Idealnya, fungsi-fungsi ini harus linier berkenaan dengan data, yang berarti bahwa jika semua pengamatan dikalikan dengan suatu faktor n, skewness dan kurtosis yang dinormalisasi akan …

1
Apakah
Dalam pengujian hipotesis statistik, hipotesis nol sering mengambil bentuk (setidaknya dalam buku yang pernah saya baca): H 0 : θ = θ 0 H 0 : θ ≤ θ 0 atau H 0 : θ 1 ≤ θ ≤ θ 2H0H0H_0H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 Apakah hanya konvensi …

2
Bagaimana saya harus memodelkan interaksi antara variabel penjelas ketika salah satu dari mereka mungkin memiliki istilah kuadratik dan kubik?
Saya sungguh berharap bahwa saya telah mengutarakan pertanyaan ini sedemikian rupa sehingga dapat dijawab secara pasti - jika tidak, tolong beri tahu saya dan saya akan mencoba lagi! Saya juga harus menebak bahwa saya akan menggunakan R untuk analisis ini. Saya memiliki beberapa ukuran plant performance (Ys)yang saya curigai dipengaruhi …

1
Referensi untuk cerita tentang pengambilan sampel dari buku telepon
Saya berbicara dengan seseorang hari ini tentang pengambilan sampel dan samar-samar ingat cerita tentang beberapa ahli statistik yang sangat dihormati merekomendasikan pengambilan sampel sistematis dari buku telepon dalam kasus hukum tertentu. Saya ingat cerita tentang sesuatu seperti hakim di pengadilan mengatakan sesuatu kepadanya seperti, "Saya tidak tahu banyak tentang statistik, …

2
Apakah ada cara yang elegan / berwawasan untuk memahami identitas regresi linier ini untuk banyak ?
Dalam regresi linear saya menemukan hasil yang menyenangkan jika kita cocok dengan model E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, kemudian, jika kita membuat standar dan memusatkan data , dan ,YYYX1X1X_1X2X2X_2 R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. Bagi saya ini terasa seperti versi 2 variabel dari …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.