Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Contoh CLT saat momen tidak ada
PertimbangkanXn=⎧⎩⎨1−12kw.p. (1−2−n)/2w.p. (1−2−n)/2w.p. 2−k for k>nXn={1w.p. (1−2−n)/2−1w.p. (1−2−n)/22kw.p. 2−k for k>nX_n = \begin{cases} 1 & \text{w.p. } (1 - 2^{-n})/2\\ -1 & \text{w.p. } (1 - 2^{-n})/2\\ 2^k & \text{w.p. } 2^{-k} \text{ for } k > n\\ \end{cases} Saya perlu menunjukkan bahwa meskipun ini memiliki momen tak terbatas,n−−√(X¯n)→dN(0,1)n(X¯n)→dN(0,1)\sqrt{n}(\bar{X}_n) \overset{d}{\to} …

2
Analisis Bayesian dari tabel kontingensi: Cara menggambarkan ukuran efek
Saya sedang mengerjakan contoh-contoh dalam Analisis Data Does Bayesian Kruschke , khususnya ANOVA eksponensial Poisson di bab. 22, yang ia sajikan sebagai alternatif untuk uji chi-square independensi untuk tabel kontingensi. Saya dapat melihat bagaimana kita mendapatkan informasi tentang interaksi yang terjadi lebih atau kurang dari yang diharapkan jika variabelnya independen …


2
Konvergensi dalam Distribusi \ CLT
Mengingat bahwa , distr kondisional. dari adalah . memiliki distr marjinal. Poisson ( ), adalah konstanta positif.Y χ 2 ( 2 n ) N q qN=nN=nN = nYYYχ2(2n)χ2(2n)\chi ^2(2n)NNNθθ\thetaθθ\theta Tunjukkan bahwa, sebagai , dalam distribusi.( Y - E ( Y ) ) / √θ→∞θ→∞\theta \rightarrow \infty (Y−E(Y))/Var(Y)−−−−−−√→N(0,1) (Y−E(Y))/Var⁡(Y)→N(0,1)\space \space (Y …

2
Bagaimana Anda memvisualisasikan corong yang disegmentasi? (dan bisakah Anda melakukannya dengan Python?)
Saya melihat pos ini di Moz yang menyajikan saluran pemasaran tersegmentasi: Hal semacam ini akan memiliki nilai yang cukup besar dalam pekerjaan saya. Apa yang saya tidak tahu adalah bagaimana memvisualisasikan data mentah untuk menampilkan saluran tersegmentasi seperti ini. Idenya adalah bahwa arahan penjualan berasal dari sumber yang berbeda (yang …

1
Nilai batas jarak Cook
Saya telah membaca tentang jarak juru masak untuk mengidentifikasi outlier yang memiliki pengaruh besar pada regresi saya. Dalam penelitian asli Cook, ia mengatakan bahwa tingkat cut-off 1 harus sebanding dengan mengidentifikasi influencer. Namun, berbagai penelitian lain menggunakan atau44n4n\frac{4}{n} sebagai cut-off.4n - k - 14n-k-1\frac{4}{n-k-1} Dalam penelitian saya, tidak ada residu …


2
Bias optimisme - perkiraan kesalahan prediksi
Buku Elemen Pembelajaran Statistik (tersedia dalam PDF online) membahas bias optimisim (7.21, halaman 229). Ini menyatakan bahwa bias optimisme adalah perbedaan antara kesalahan pelatihan dan kesalahan dalam sampel (kesalahan diamati jika kita sampel nilai-nilai hasil baru di masing-masing poin pelatihan asli) (per di bawah). Selanjutnya, ia menyatakan bias optimisme ini …

2
R mendeteksi tren peningkatan / penurunan deret waktu
Saya memiliki banyak rangkaian waktu dengan periode: hari, minggu atau bulan. Dengan stl()fungsi atau dengan loess(x ~ y)saya dapat melihat bagaimana tren seri waktu tertentu terlihat. Saya perlu mendeteksi apakah tren deret waktu meningkat atau menurun. Bagaimana saya bisa mengaturnya? Saya mencoba menghitung koefisien regresi linier dengan lm(x ~ y)dan …
9 r  time-series  trend 

1
Menyesuaikan koefisien DLM yang bervariasi waktu
Saya ingin menyesuaikan DLM dengan koefisien yang bervariasi waktu, yaitu perpanjangan untuk regresi linier biasa, .yt=θ1+θ2x2yt=θ1+θ2x2y_t = \theta_1 + \theta_2x_2 Saya memiliki prediktor ( ) dan variabel respon ( y t ), marine & tangkapan ikan pedalaman tahunan masing-masing dari 1950 - 2011. Saya ingin model regresi DLM untuk mengikuti,x2x2x_2ytyty_t …

1
Bagaimana estimasi kemungkinan maksimum memiliki perkiraan distribusi normal?
Saya telah membaca tentang MLE sebagai metode untuk menghasilkan distribusi yang sesuai. Saya menemukan sebuah pernyataan yang mengatakan bahwa perkiraan kemungkinan maksimum "memiliki perkiraan distribusi normal." Apakah ini berarti bahwa jika saya menerapkan MLE berulang kali pada data saya dan keluarga distribusi yang saya coba cocokkan, model yang saya dapatkan …

3
Intuisi tentang entropi bersama
Saya kesulitan membangun intuisi tentang entropi bersama. = ketidakpastian dalam distribusi bersama p ( x , y ) ; H ( X ) = ketidakpastian dalam p x ( x ) ; H ( Y ) = ketidakpastian dalam p y ( y ) .H(X,Y)H(X,Y)H(X,Y)p(x,y)p(x,y)p(x,y)H(X)H(X)H(X)px(x)px(x)p_x(x)H(Y)H(Y)H(Y)py(y)py(y)p_y(y) Jika H (X) tinggi maka …

2
Mengapa 0,05 <p <0,95 hasil disebut false positive?
Sunting: Basis pertanyaan saya cacat, dan saya perlu meluangkan waktu mencari tahu apakah itu bisa masuk akal. Sunting 2: Mengklarifikasi bahwa saya mengakui bahwa nilai-p bukan ukuran langsung dari probabilitas hipotesis nol, tetapi bahwa saya berasumsi bahwa semakin dekat nilai-p ke 1, semakin besar kemungkinan hipotesis memiliki telah dipilih untuk …

1
Haruskah saya melaporkan interval yang kredibel alih-alih interval kepercayaan?
Setelah menemukan konsep dalam buku teks statistik, saya mencoba untuk membungkus kepala saya tentang hal itu, dan akhirnya sampai pada kesimpulan yang tampaknya sesuai dengan semua penjelasan yang telah saya lihat sejauh ini: Interval yang kredibel adalah apa yang non-ahli statistik pikir kepercayaan Intervalnya adalah. Digresi bagi orang-orang seperti saya-dari-satu-jam …

2
Memasukkan variabel penjelas yang lebih rinci dari waktu ke waktu
Saya mencoba memahami bagaimana cara terbaik saya memodelkan variabel di mana seiring waktu saya mendapatkan prediktor yang semakin rinci. Misalnya, pertimbangkan untuk memodelkan tingkat pemulihan pada pinjaman yang gagal bayar. Misalkan kita memiliki dataset dengan data 20 tahun, dan dalam 15 tahun pertama kita hanya tahu apakah pinjaman tersebut dijamin …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.