Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data




2
Mengapa meminimalkan MAE menyebabkan peramalan median dan bukan rata-rata?
Dari buku Forecasting: Principles and Practice oleh Rob J Hyndman dan George Athanasopoulos , khususnya bagian tentang pengukuran akurasi : Metode perkiraan yang meminimalkan MAE akan menghasilkan perkiraan median, sedangkan meminimalkan RMSE akan mengarah pada perkiraan rata-rata. Bisakah seseorang memberikan penjelasan intuitif mengapa meminimalkan MAE mengarah pada peramalan median dan …
19 forecasting  mean  median  rms  mae 



4
Mengapa menambah ukuran sampel membalik koin tidak meningkatkan perkiraan kurva normal?
Saya membaca buku Statistik (Freeman, Pisani, Purves) dan saya mencoba mereproduksi contoh di mana koin dilemparkan katakan 50 kali, jumlah kepala dihitung dan ini diulang katakan 1.000 kali. Pertama, saya menjaga jumlah lemparan (ukuran sampel) pada 1000 dan meningkatkan pengulangan. Semakin banyak pengulangan, semakin baik data sesuai dengan kurva normal. …

1
Tes non-parametrik jika dua sampel diambil dari distribusi yang sama
Saya ingin menguji hipotesis bahwa dua sampel diambil dari populasi yang sama, tanpa membuat asumsi tentang distribusi sampel atau populasi. Bagaimana saya harus melakukan ini? Dari Wikipedia kesan saya adalah bahwa tes Mann Whitney U harus sesuai, tetapi sepertinya tidak berhasil untuk saya dalam praktik. Untuk konkret saya telah membuat …


4
Hubungan antara korelasi dan sebab-akibat
Dari halaman Wikipedia yang berjudul korelasi tidak menyiratkan hubungan sebab akibat , Untuk dua peristiwa berkorelasi, A dan B, hubungan yang mungkin berbeda meliputi: A menyebabkan B (penyebab langsung); B menyebabkan A (penyebab terbalik); A dan B adalah konsekuensi dari penyebab umum, tetapi tidak menyebabkan satu sama lain; A dan …



2
Metrik klasifikasi multilabel pada scikit
Saya mencoba membangun multi-label classifier untuk menetapkan topik ke dokumen yang ada menggunakan scikit Saya sedang memproses dokumen saya melewati mereka melalui TfidfVectorizerlabel melalui MultiLabelBinarizerdan membuat OneVsRestClassifierdengan SGDClassifiersebagai penaksir. Namun ketika menguji classifier saya, saya hanya mendapatkan skor hingga 0,29 yang dari apa yang saya baca cukup rendah untuk masalah …

5
Ketika Teorema Limit Pusat dan Hukum Angka Besar tidak setuju
Ini pada dasarnya adalah replikasi dari pertanyaan yang saya temukan di math.se , yang tidak mendapatkan jawaban yang saya harapkan. Biarkan menjadi urutan variabel acak yang independen dan terdistribusi secara identik, dengan dan .{Xi}i∈N{Xi}i∈N\{ X_i \}_{i \in \mathbb{N}}E[Xi]=1E[Xi]=1\mathbb{E}[X_i] = 1V[Xi]=1V[Xi]=1\mathbb{V}[X_i] = 1 Pertimbangkan evaluasi limn→∞P(1n−−√∑i=1nXi≤n−−√)limn→∞P(1n∑i=1nXi≤n) \lim_{n \to \infty} \mathbb{P}\left(\frac{1}{\sqrt{n}} \sum_{i=1}^n …

3
Apakah tunggul keputusan merupakan model linier?
Decision stump adalah pohon keputusan dengan hanya satu split. Ini juga dapat ditulis sebagai fungsi piecewise. Misalnya, anggap adalah vektor, dan adalah komponen pertama , dalam pengaturan regresi, beberapa tunggul keputusan dapatxxxx1x1x_1xxx f(x)={35x1≤2x1>2f(x)={3x1≤25x1>2f(x)= \begin{cases} 3& x_1\leq 2 \\ 5 & x_1 > 2 \\ \end{cases} Tetapi apakah ini model linier? …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.