Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Haruskah derajat koreksi kebebasan digunakan untuk inferensi pada parameter GLM?
Pertanyaan ini terinspirasi oleh jawaban Martijn di sini . Misalkan kita cocok GLM untuk satu keluarga parameter seperti model binomial atau Poisson dan itu adalah prosedur kemungkinan penuh (sebagai lawan mengatakan, quasipoisson). Kemudian, varians adalah fungsi dari mean. Dengan binomial: dan dengan Poisson .var [ X ] = E [ …

2
Mengapa statistik-T membutuhkan data untuk mengikuti distribusi normal
Saya sedang melihat notebook ini , dan saya bingung dengan pernyataan ini: Ketika kita berbicara tentang normalitas yang kita maksud adalah bahwa data harus terlihat seperti distribusi normal. Ini penting karena beberapa uji statistik mengandalkan ini (misalnya t-statistik). Saya tidak mengerti mengapa statistik-T membutuhkan data untuk mengikuti distribusi normal. Memang, …


2
Mengapa tabel anova regresi ini identik?
Saya memiliki dua regresi dari Y yang sama dan tiga tingkat X. Secara keseluruhan n = 15, dengan n = 5 di setiap kelompok atau tingkat X. Regresi pertama memperlakukan X sebagai kategori, menetapkan variabel indikator ke level 2 dan 3 dengan level satu menjadi rujukan. Indikator / boneka seperti: …
11 regression  anova 

4
Mengapa metode Least-Squares dan Maximum-Likelihood tidak setara ketika kesalahan tidak terdistribusi secara normal?
Judul mengatakan itu semua. Saya mengerti bahwa Least-Squares dan Maximum-Likelihood akan memberikan hasil yang sama untuk koefisien regresi jika kesalahan model terdistribusi secara normal. Tetapi, apa yang terjadi jika kesalahan tidak terdistribusi secara normal? Mengapa kedua metode ini tidak lagi setara?

4
Apa hubungan antara ANOVA untuk membandingkan cara beberapa kelompok dan ANOVA untuk membandingkan model bersarang?
Sejauh ini saya telah melihat ANOVA digunakan dalam dua cara: Pertama , dalam teks statistik pengantar saya, ANOVA diperkenalkan sebagai cara untuk membandingkan rata-rata tiga kelompok atau lebih, sebagai peningkatan dibandingkan perbandingan berpasangan, untuk menentukan apakah salah satu cara memiliki perbedaan yang signifikan secara statistik. Kedua , dalam teks pembelajaran …



2
Apakah tingkat Kesalahan fungsi Cembung parameter lambda Regularisasi?
Dalam memilih parameter regularisasi lambda di Ridge atau Lasso, metode yang disarankan adalah mencoba nilai-nilai lambda yang berbeda, mengukur kesalahan dalam Set Validasi dan akhirnya memilih nilai lambda yang mengembalikan kesalahan terendah. Ini tidak jelas bagi saya jika fungsi f (lambda) = error adalah Convex. Mungkinkah seperti ini? Yaitu dapat …

3
Mengapa kemungkinan filter Kalman dihitung menggunakan hasil filter alih-alih hasil yang lebih halus?
Saya menggunakan filter Kalman dengan cara yang sangat standar. Sistem diwakili oleh persamaan keadaan dan persamaan observasi .xt+1=Fxt+vt+1xt+1=Fxt+vt+1x_{t+1}=Fx_{t}+v_{t+1}yt=Hxt+Azt+wtyt=Hxt+Azt+wty_{t}=Hx_{t}+Az_{t}+w_{t} Buku ajar mengajarkan bahwa setelah menerapkan filter Kalman dan mendapatkan "prakiraan satu langkah ke depan" (atau "perkiraan terfilter"), kita harus menggunakannya untuk menghitung fungsi kemungkinan:x^t|t−1x^t|t−1\hat{x}_{t|t-1} fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp⁡{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}f_{y_{t}|\mathcal{I}_{t-1},z_{t}}\left(y_{t}|\mathcal{I}_{t-1},z_{t}\right)=\det\left[2\pi\left(HP_{t|t-1}H^{\prime}+R\right)\right]^{-\frac{1}{2}}\exp\left\{ -\frac{1}{2}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)^{\prime}\left(HP_{t|t-1}H^{\prime}+R\right)^{-1}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)\right\} Pertanyaan saya adalah: Mengapa fungsi …

4
Korelasi antara X dan XY
Jika saya memiliki dua variabel acak independen X dan Y, apa korelasi antara X dan produk XY? Jika ini tidak diketahui, saya akan tertarik untuk mengetahui setidaknya apa yang terjadi dalam kasus spesifik X dan Y yang normal dengan nol rata-rata, jika itu lebih mudah untuk diselesaikan.

5
Menunjukkan bahwa estimator OLS adalah ekuivalen skala?
Saya tidak memiliki definisi formal tentang kesetaraan skala, tetapi inilah yang dikatakan Pengantar Pembelajaran Statistik tentang hal ini pada hal. 217: Koefisien kuadrat terkecil standar ... adalah skala ekuivalen : mengalikan dengan konstanta hanya mengarah ke penskalaan estimasi koefisien kuadrat terkecil dengan faktor .XjXjX_jccc1/c1/c1/c Untuk mempermudah, mari kita asumsikan model …

5
Mengapa kami menolak hipotesis nol pada level 0,05 dan bukan pada level 0,5 (seperti yang kami lakukan di Klasifikasi)
Pengujian hipotesis mirip dengan masalah Klasifikasi. Jadi katakanlah, kami memiliki 2 label yang memungkinkan untuk pengamatan (subjek) - Bersalah vs. Tidak Bersalah. Biarkan Non-Bersalah menjadi Hipotesis nol. Jika kita melihat masalah dari sudut pandang Klasifikasi, kita akan melatih Klasifikasi yang akan memprediksi probabilitas subjek yang termasuk dalam masing-masing dari 2 …

5
Bagaimana cara menghasilkan urutan
Saya tahu cara membuat urutan dengan rata-rata . Misalnya, dalam Matlab, jika saya ingin menghasilkan urutan panjang , itu adalah:0 ± 1 10000±1±1\pm 1000±1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 Namun, bagaimana cara menghasilkan urutan dengan rata-rata , yaitu, dengan yang sedikit disukai?0,05 1±1±1\pm 10.050.050.05111

2
Apakah membagi data menjadi set tes dan pelatihan semata-mata merupakan "statistik"?
Saya seorang mahasiswa fisika yang mempelajari pembelajaran mesin / ilmu data, jadi saya tidak bermaksud pertanyaan ini untuk memulai konflik apa pun :) Namun, sebagian besar program sarjana fisika adalah melakukan laboratorium / eksperimen, yang berarti banyak data pemrosesan dan analisis statistik. Namun, saya melihat perbedaan yang tajam antara cara …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.