Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Perkiraan sederhana distribusi kumulatif Poisson ekor panjang?
Saya ingin memutuskan kapasitas dari sebuah tabel sehingga memiliki peluang sisa kurang dari untuk melimpah karena , dengan asumsi jumlah entri mengikuti hukum Poisson dengan yang diberikan ekspektasi .2 - p p ∈ [ 40 … 120 ] E ∈ [ 10 3 ... 10 12 ]CCC2−p2−p2^{-p}p∈[40…120]p∈[40…120]p\in[40\dots 120]E∈[103…1012]E∈[103…1012]E\in[10^3\dots 10^{12}] Idealnya, …


2
Bingung tentang interval kepercayaan
Saya bingung tentang konsep interval kepercayaan. Secara khusus, asumsikan ada variabel Gaussian X∼N(μ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma) dengan σσ\sigma diketahui, dan saya tertarik pada μLμL\mu_L batas bawah rata-rata dengan tingkat kepercayaan 95%95%95\% . Saya akan melakukan percobaan sebanyak 555 kali, dan mengamati X1X1X_1 , X2X2X_2 , X3X3X_3 , X4X4X_4 , X5X5X_5 …

1
randomForest dan bug pentingnya variabel?
Saya tidak mendapatkan perbedaan antara rfobject$importancedan importance(rfobject)di kolom MeanDecreaseAccuracy. Contoh: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > …

1
Bisakah model P (Y | X) dilatih melalui stochastic gradient descent dari sampel non-iid P (X) dan sampel iid dari P (Y | X)?
Ketika melatih model parameter (misalnya untuk memaksimalkan kemungkinan) melalui penurunan gradien stokastik pada beberapa set data, umumnya diasumsikan bahwa sampel pelatihan diambil di awal dari distribusi data pelatihan. Jadi, jika tujuannya adalah untuk memodelkan distribusi bersama , maka setiap sampel pelatihan harus diambil iid dari distribusi itu.P(X,Y)P(X,Y)P(X,Y)(xi,yi)(xi,yi)(x_i,y_i) Jika tujuannya adalah …




1
Pembuatan Angka Acak Log-Cauchy
Saya perlu menggambar angka acak dari distribusi log-cauchy yang memiliki kepadatan: Adakah yang bisa membantu saya atau mengarahkan saya ke buku / kertas yang bisa menunjukkan caranya?f( x ; μ , σ) = 1x πσ[ 1 + ( l n ( x ) - μσ)2].f(x;μ,σ)=1xπσ[1+(ln(x)-μσ)2].f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.


1
"Central limit theorem" untuk jumlah tertimbang dari variabel acak berkorelasi
Saya membaca makalah yang mengklaim itu X^k= 1N--√∑j = 0N- 1Xje- i 2 πk j / N,X^k=1N∑j=0N-1Xje-saya2πkj/N,\hat{X}_k=\frac{1}{\sqrt{N}}\sum_{j=0}^{N-1}X_je^{-i2\pi kj/N}, (yaitu Discrete Fourier Transform , DFT) oleh CLT cenderung ke variabel acak gaussian (kompleks). Namun, saya tahu ini tidak benar secara umum. Setelah membaca argumen (keliru) ini, saya mencari di internet dan …


4
Mengapa menggunakan variabel kontrol dalam perbedaan-dalam-perbedaan?
Saya punya pertanyaan tentang pendekatan perbedaan-dalam-perbedaan dengan persamaan standar berikut: mana perlakuan adalah variabel dummy untuk grup dan pos yang dirawat. y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u Sekarang, pertanyaan saya sederhana: Mengapa sebagian besar makalah masih menggunakan variabel kontrol tambahan? Saya pikir jika asumsi tren paralel …

2
Kurtosis raksasa?
Saya melakukan beberapa statistik deskriptif pengembalian harian pada indeks saham. Yaitu jika dan adalah tingkat indeks masing-masing pada hari 1 dan 2, maka adalah pengembalian yang saya gunakan (sepenuhnya standar dalam literatur).P 2 l o g e ( P 2P1P1P_1P2P2P_2l o ge( P2P1)loge(P2P1)log_e (\frac{P_2}{P_1}) Jadi kurtosis sangat besar dalam beberapa …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.