Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

6
Penjelasan intuitif dari
Jika XXX adalah peringkat penuh, kebalikan dari XTXXTXX^TX ada dan kita mendapatkan kuadrat β^=(XTX)−1XYβ^=(XTX)−1XY\hat\beta = (X^TX)^{-1}XY dan Var(β^)=σ2(XTX)−1Var⁡(β^)=σ2(XTX)−1\operatorname{Var}(\hat\beta) = \sigma^2(X^TX)^{-1} Bagaimana kita menjelaskan secara intuitif (XTX)−1(XTX)−1(X^TX)^{-1} dalam rumus varian? Teknik derivasi jelas bagi saya.



3
Mengapa ada -1 dalam fungsi kepadatan distribusi beta?
Distribusi beta muncul di bawah dua parameter (atau di sini ) f(x)∝xα(1−x)β(1)(1)f(x)∝xα(1−x)β f(x) \propto x^{\alpha} (1-x)^{\beta} \tag{1} atau yang tampaknya lebih sering digunakan f(x)∝xα−1(1−x)β−1(2)(2)f(x)∝xα−1(1−x)β−1 f(x) \propto x^{\alpha-1} (1-x)^{\beta-1} \tag{2} Tetapi mengapa sebenarnya ada " " dalam formula kedua?−1−1-1 Formulasi pertama secara intuitif tampaknya lebih langsung berhubungan dengan distribusi binomial g(k)∝pk(1−p)n−k(3)(3)g(k)∝pk(1−p)n−k …



3
apa yang membuat jaringan saraf model klasifikasi nonlinier?
Saya mencoba memahami makna matematika dari model klasifikasi non-linear: Saya baru saja membaca sebuah artikel yang berbicara tentang jaring saraf menjadi model klasifikasi non-linear. Tapi saya baru sadar bahwa: Lapisan pertama: h1=x1∗wx1h1+x2∗wx1h2h1=x1∗wx1h1+x2∗wx1h2h_1=x_1∗w_{x1h1}+x_2∗w_{x1h2} h2=x1∗wx2h1+x2∗wx2h2h2=x1∗wx2h1+x2∗wx2h2h_2=x_1∗w_{x2h1}+x_2∗w_{x2h2} Lapisan selanjutnya y= b ∗ wb y+ h1∗ bh 1 y+ h2∗ bh 2 yy=b∗wby+h1∗wh1y+h2∗wh2yy=b∗w_{by}+h_1∗w_{h1y}+h_2∗w_{h2y} Dapat disederhanakan …

5
Intuisi (geometris atau lainnya) dari
Pertimbangkan identitas dasar varian: Var(X)===E[(X−E[X])2]...E[X2]−(E[X])2Var(X)=E[(X−E[X])2]=...=E[X2]−(E[X])2 \begin{eqnarray} Var(X) &=& E[(X - E[X])^2]\\ &=& ...\\ &=& E[X^2] - (E[X])^2 \end{eqnarray} Ini adalah manipulasi aljabar sederhana dari definisi momen sentral menjadi momen non-sentral. Ini memungkinkan manipulasi yang mudah dari dalam konteks lain. Ini juga memungkinkan perhitungan varians melalui data single pass over daripada …


1
Apakah kita benar-benar melakukan analisis regresi multivariat dengan * juta * koefisien / variabel independen?
Saya menghabiskan beberapa waktu untuk belajar mesin pembelajaran (maaf untuk rekursi :) dan saya tidak bisa tidak tertarik dengan aturan praktis untuk memilih Gradient Descent daripada penyelesaian persamaan langsung untuk menghitung koefisien regresi, dalam kasus regresi linier multivariat. Rule of thumb: jika jumlah fitur (koefisien baca / variabel independen) adalah …

4
Dalam statistik, haruskah saya menganggap
Saya sedang mempelajari statistik dan sering menemukan formula yang mengandung logdan saya selalu bingung jika saya harus menafsirkannya sebagai makna standar log, yaitu basis 10, atau jika dalam statistik simbol log umumnya dianggap sebagai log natural ln. Khususnya saya sedang mempelajari Estimasi Frekuensi Good-Turing sebagai contoh, tetapi pertanyaan saya lebih …

4
Membandingkan dua histogram menggunakan jarak Chi-Square
Saya ingin membandingkan dua gambar wajah. Saya menghitung histogram-LBP mereka. Jadi sekarang saya perlu membandingkan dua histogram ini dan mendapatkan sesuatu yang akan memberi tahu seberapa banyak histogram ini sama (0 - 100%). Ada banyak cara untuk menyelesaikan tugas ini, tetapi penulis metode LBP menekankan (Deskripsi Wajah dengan Pola Biner …

1
Metode momen kedua, gerak Brown?
Biarkan menjadi gerakan Brown standar. Biarkan menunjukkan acara dan biarkan mana menunjukkan fungsi indikator. Apakah ada sedemikian rupa sehingga untuk untuk semua ? Saya kira jawabannya adalah ya; Saya sudah mencoba bermain-main dengan metode momen kedua, tetapi tidak banyak berhasil. Bisakah ini ditunjukkan dengan metode momen kedua? Atau haruskah saya …

5
Apa ukuran efek ... dan mengapa itu bahkan berguna?
Saya memiliki latar belakang statistik tingkat pengantar lulusan (anggap saya tahu statistik matematika dan probabilitas pada tingkat sarjana (misalnya, Wackerly et al., Probabilitas Ross), dan memiliki pengetahuan tentang teori ukuran). Saya baru-baru ini memulai pekerjaan melakukan desain eksperimental dan pelaporan statistik dalam statistik pendidikan, dan telah ditempatkan pada proyek di …

2
Kecepatan, biaya komputasi PCA, LASSO, jaring elastis
Saya mencoba membandingkan kompleksitas komputasi / perkiraan kecepatan tiga kelompok metode untuk regresi linier sebagaimana dibedakan dalam Hastie et al. "Elemen Pembelajaran Statistik" (edisi kedua), Bab 3: Pilihan subset Metode penyusutan Metode menggunakan arah input yang diturunkan (PCR, PLS) Perbandingannya bisa sangat kasar, hanya untuk memberikan beberapa ide. Saya mengumpulkan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.