Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
RMSE vs Standar deviasi dalam populasi
RMSE (Root mean square error) dan SD (Standar deviasi) memiliki rumus yang sama. Tautan ini mengatakan Satu-satunya perbedaan adalah bahwa Anda membaginya dengan dan bukan karena Anda tidak mengurangi mean sampel di sini. RMSE kemudian akan sesuai dengan . Oleh karena itu, populasi RMSE adalah dan Anda menginginkan CI untuk …


3
Arti “kesalahan rekonstruksi” dalam PCA dan LDA
Saya menerapkan PCA, LDA, dan Naif Bayes, masing-masing untuk kompresi dan klasifikasi (menerapkan LDA untuk kompresi dan klasifikasi). Saya memiliki kode yang ditulis dan semuanya berfungsi. Apa yang perlu saya ketahui, untuk laporan ini, adalah apa definisi umum kesalahan rekonstruksi . Saya dapat menemukan banyak matematika, dan menggunakannya dalam literatur …

1
Distribusi kesalahan jumlah kuadrat untuk regresi linier?
Saya tahu bahwa distribusi varians sampel Dari fakta bahwa dapat diekspresikan dalam bentuk matriks, (di mana A: simetris), dan itu bisa lagi diekspresikan dalam: (di mana Q: ortonormal, D: matriks diagonal). ∑(Xsaya-X¯)2σ2∼χ2( n - 1 )∑(Xi−X¯)2σ2∼χ(n−1)2 \sum\frac{(X_i-\bar{X})^2}{\sigma^2}\sim \chi^2_{(n-1)} ∑(Xi−X¯)2n−1∼σ2n−1χ2(n−1)∑(Xi−X¯)2n−1∼σ2n−1χ(n−1)2 \sum\frac{(X_i-\bar{X})^2}{n-1}\sim \frac{\sigma^2}{n-1}\chi^2_{(n-1)} (X−X¯)2(X−X¯)2(X-\bar{X})^2xAx′xAx′xAx'x′QDQ′xx′QDQ′xx'QDQ'x Bagaimana dengan , dengan asumsi ? ∑(Yi−β^0−β^1Xi)2∑(Yi−β^0−β^1Xi)2\sum(Y_i-\hat{\beta}_0-\hat{\beta}_1X_i)^2(Y−β0−β1X)∼N(0,σ2)(Y−β0−β1X)∼N(0,σ2)(Y - …

2
Bagaimana saya harus menangani variabel kategori dengan beberapa level ketika melakukan eliminasi mundur?
Saya sedang melakukan model eliminasi mundur berbasis AIC sederhana di mana beberapa variabel adalah variabel kategori dengan beberapa level. Variabel-variabel ini dimodelkan sebagai seperangkat variabel dummy. Ketika melakukan eliminasi mundur, haruskah saya menghapus semua level variabel secara bersamaan? Atau haruskah saya memperlakukan setiap variabel dummy secara terpisah? Dan mengapa? Sebagai …



3
Bagaimana cara mendiskusikan sebar dengan banyak garis yang muncul?
Kami telah mengukur dua variabel, dan scatterplot tampaknya menyarankan beberapa model "linear". Apakah ada cara untuk mencoba menyaring model-model itu? Mengidentifikasi variabel independen lain ternyata sulit. Kedua variabel sangat condong ke kiri (menuju angka kecil), ini merupakan distribusi yang diharapkan dalam domain kami. Intensitas titik mewakili jumlah titik data (pada …

1
Apa perbedaan antara AIC () dan extractAIC () dalam R?
Dokumentasi R untuk keduanya tidak menjelaskan banyak hal. Semua yang bisa saya dapatkan dari tautan ini adalah bahwa menggunakan salah satu dari keduanya harus baik-baik saja. Yang tidak saya dapatkan adalah mengapa mereka tidak sama. Fakta: Fungsi regresi bertahap di R, step()menggunakan extractAIC(). Menariknya, menjalankan lm()model dan model glm()'null' (hanya …


2
Apakah ukuran populasi parameter, atau ukuran sampel statistik?
Definisi parameter dan statistik cukup setuju: parameter dan statistik adalah karakteristik numerik atau ringkasan numerik dari populasi dan sampel, masing-masing, untuk studi tertentu. Saya tidak berpikir ini adalah penggunaan umum, tetapi ... Bisakah ukuran populasi NNN dianggap sebagai parameter? Bisakah ukuran sampel nnn dianggap sebagai statistik? Bagaimanapun, ukuran populasi atau …

2
Definisi "persentil"
Saya sekarang membaca catatan tentang Biostatistik yang ditulis oleh PMT Education, dan perhatikan kalimat-kalimat berikut di Bagian 2.7: Seorang bayi yang lahir pada persentil ke-50 untuk massa lebih berat dari 50% bayi. Bayi yang lahir pada persentil ke-25 untuk massa lebih berat dari 75% bayi. Seorang bayi yang lahir pada …

2
Mengapa model "kesalahan dalam X" tidak banyak digunakan?
Ketika kita menghitung standard error dari koefisien regresi, kita tidak memperhitungkan keacakan dalam desain matriks XXX . Dalam OLS misalnya, kita menghitung var(β^)var(β^)\text{var}(\hat{\beta}) sebagai var((XTX)−1XTY)=σ2(XTX)−1var((XTX)-1XTY)=σ2(XTX)-1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Jika XXX dianggap acak, hukum varians total akan, dalam arti tertentu, menuntut kontribusi tambahan dari varian XXX juga. yaitu var(β^)=var(E(β^|X))+E(var(β^|X)).var(β^)=var(E(β^|X))+E(var(β^|X)).\text{var}(\hat{\beta}) = \text{var}(E(\hat{\beta}|X)) + …


1
Perkiraan urutan kedua dari fungsi kehilangan (buku pembelajaran Deep, 7.33)
Dalam buku Goodfellow (2016) tentang pembelajaran yang mendalam, ia berbicara tentang kesetaraan dari berhenti dini untuk regularisasi L2 ( https://www.deeplearningbook.org/contents/regularization.html halaman 247). Perkiraan kuadrat dari fungsi biaya jjj diberikan oleh: J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) HHHf(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.