Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Apa model nol dalam regresi dan bagaimana hal itu terkait dengan hipotesis nol?
Apa model nol dalam regresi dan apa hubungan antara model nol dan hipotesis nol? Untuk pemahaman saya, apakah itu berarti Menggunakan "rata-rata variabel respons" untuk memprediksi variabel respons kontinu? Menggunakan "distribusi label" dalam memprediksi variabel respons diskrit? Jika itu masalahnya, tampaknya ada hubungan yang hilang antara hipotesis nol.

7
Mengapa data miring tidak disukai untuk pemodelan?
Sebagian besar waktu ketika orang berbicara tentang transformasi variabel (untuk variabel prediktor dan respon), mereka membahas cara untuk memperlakukan kemiringan data (seperti transformasi log, transformasi kotak dan transformasi cox, dll.). Apa yang saya tidak bisa mengerti adalah mengapa menghilangkan kemiringan dianggap sebagai praktik terbaik yang umum? Bagaimana skewness mempengaruhi kinerja …

5
Bagaimana metode ensemble mengungguli semua konstituennya?
Saya agak bingung tentang pembelajaran ensemble. Singkatnya, ini menjalankan model k dan mendapatkan rata-rata model k ini. Bagaimana bisa dijamin bahwa rata-rata model k akan lebih baik daripada model mana pun sendiri? Saya mengerti bahwa bias "menyebar" atau "rata-rata". Namun, bagaimana jika ada dua model dalam ansambel (yaitu k = …



1
Kesenjangan maksimum antara sampel yang diambil tanpa penggantian dari distribusi seragam diskrit
Masalah ini terkait dengan penelitian lab saya dalam cakupan robot: Gambar angka secara acak dari set tanpa penggantian, dan urutkan angka dalam urutan menaik. .nnn{1,2,…,m}{1,2,…,m}\{1,2,\ldots,m\}1≤n≤m1≤n≤m1\le n\le m Dari daftar angka yang diurutkan ini , menghasilkan perbedaan antara angka berurutan dan batas: . Ini memberi celah.{a(1),a(2),…,a(n)}{a(1),a(2),…,a(n)}\{a_{(1)},a_{(2)},…,a_{(n)}\}g={a(1),a(2)−a(1),…,a(n)−a(n−1),m+1−a(n)}g={a(1),a(2)−a(1),…,a(n)−a(n−1),m+1−a(n)}g = \{a_{(1)},a_{(2)}−a_{(1)},\ldots,a_{(n)}−a_{(n-1)},m+1-a_{(n)}\}n+1n+1n+1 Apa distribusi kesenjangan …

1
Tensor dalam literatur jaringan saraf: apa definisi paling sederhana di luar sana?
Dalam literatur jaringan saraf, sering kita menemukan kata "tensor". Apakah berbeda dari vektor? Dan dari sebuah matriks? Apakah Anda punya contoh spesifik yang menjelaskan definisi itu? Saya agak bingung tentang definisinya. Wikipedia tidak membantu dan kadang-kadang saya memiliki kesan bahwa definisinya tergantung pada lingkungan pembelajaran mesin tertentu yang digunakan (TensorFlow, …



1
Membalikkan regresi ridge: diberikan matriks respons dan koefisien regresi, temukan prediktor yang sesuai
Pertimbangkan masalah regresi OLS standar\newcommand{\Y}{\mathbf Y}\newcommand{\X}{\mathbf X}\newcommand{\B}{\boldsymbol\beta}\DeclareMathOperator*{argmin}{argmin}: Saya memiliki matriks YY\Y dan XX\X dan saya ingin mencari ββ\B untuk meminimalkan L=∥Y−Xβ∥2.L=‖Y−Xβ‖2.L=\|\Y-\X\B\|^2. Solusinya diberikan oleh β^=argminβ{L}=(X⊤X)+X⊤Y.β^=argminβ⁡{L}=(X⊤X)+X⊤Y.\hat\B=\argmin_\B\{L\} = (\X^\top\X)^+\X^\top \Y. Saya juga dapat menimbulkan masalah "terbalik": mengingat YY\Y dan β∗β∗\B^* , cari X^X^\hat\X yang akan menghasilkan β^≈β∗β^≈β∗\hat\B\approx \B^* , yaitu akan meminimalkan …

2
Perbedaan kesalahan standar residual antara optim dan glm
Saya mencoba mereproduksi dengan optimhasil dari regresi linier sederhana yang dilengkapi dengan glmatau bahkan nlsfungsi R. Perkiraan parameter adalah sama tetapi estimasi varians residual dan kesalahan standar dari parameter lain tidak sama terutama ketika ukuran sampel rendah. Saya kira ini disebabkan oleh perbedaan dalam cara kesalahan standar residual dihitung antara …


2
Pandangan sistem dinamis dari Central Limit Theorem?
(Awalnya diposting di MSE.) Saya telah melihat banyak diskusi heuristik tentang teorema limit sentral klasik yang berbicara tentang distribusi normal (atau distribusi stabil mana pun) sebagai "penarik" dalam ruang kepadatan probabilitas. Sebagai contoh, perhatikan kalimat-kalimat ini di bagian atas perawatan Wikipedia : Dalam penggunaan yang lebih umum, teorema limit pusat …

2
Mengapa uji-F sangat sensitif terhadap asumsi normalitas?
Mengapa uji- F untuk perbedaan varian sangat sensitif terhadap asumsi distribusi normal, bahkan untuk besar ?NNN Saya sudah mencoba mencari di web dan mengunjungi perpustakaan, tetapi tidak ada yang memberikan jawaban yang baik. Dikatakan bahwa tes ini sangat sensitif untuk pelanggaran asumsi untuk distribusi normal, tetapi saya tidak mengerti mengapa. …

3
Intuisi di balik tingkat bahaya
Saya bingung tentang persamaan yang berfungsi sebagai definisi tingkat bahaya. Saya mendapatkan ide tentang tingkat bahaya, tetapi saya tidak melihat bagaimana persamaan itu mengekspresikan intuisi itu. Jika adalah variabel acak yang mewakili titik waktu kematian seseorang pada interval waktuxxx[0,T][0,T][0,T] . Maka tingkat bahaya adalah: h(x)=f(x)1−F(x)h(x)=f(x)1−F(x)h(x)=\frac{f(x)}{1-F(x)} Di mana mewakili probabilitas kematian …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.