Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

7
Mengapa matriks simetris positif pasti (SPD) begitu penting?
Saya tahu definisi matriks positif simetris positif (SPD), tetapi ingin lebih memahami. Mengapa mereka begitu penting, secara intuitif? Inilah yang saya tahu. Apa lagi? Untuk data yang diberikan, matriks Co-variance adalah SPD. Matriks co-variance adalah metrik penting, lihat posting yang luar biasa ini untuk penjelasan intuitif. Bentuk kuadrat 12x⊤Ax−b⊤x+c12x⊤SEBUAHx-b⊤x+c\frac 1 …


1
Bisakah splines digunakan untuk prediksi?
Saya tidak dapat secara spesifik tentang sifat data karena ini adalah hak milik, tetapi anggaplah kami memiliki data seperti ini: Setiap bulan, beberapa orang mendaftar untuk suatu layanan. Kemudian, pada setiap bulan berikutnya, orang-orang tersebut dapat memutakhirkan layanan, menghentikan layanan atau menolak layanan (misalnya karena gagal membayar). Untuk kohort awal …

3
Dalam pembelajaran mesin, mengapa superskrip digunakan sebagai pengganti subskrip?
Saya mengambil kursus Andrew Ng tentang Pembelajaran Mesin melalui Coursera . Untuk persamaan, superskrip digunakan sebagai pengganti subskrip. Misalnya, dalam persamaan berikut x(i)x(i)x^{(i)} digunakan sebagai ganti xixix_i : J(θ0,θ1)=12m∑i=1m(hθ(x(i))−y(i))2J(θ0,θ1)=12m∑saya=1m(hθ(x(saya))-y(saya))2J(\theta_0, \theta_1) = \frac{1}{2m} \sum\limits_{i=1}^{m}{(h_\theta(x^{(i)}) - y^{(i)})^2} Rupanya, ini adalah praktik umum. Pertanyaan saya adalah mengapa menggunakan superskrip, bukan subskrip? Superskrip sudah …


5
Mengapa kita menggunakan rumus standar deviasi yang bias dan menyesatkan untuk distribusi normal?
Itu sedikit mengejutkan bagi saya ketika pertama kali saya melakukan simulasi distribusi normal Monte Carlo dan menemukan bahwa rata-rata standar deviasi dari sampel, semuanya memiliki ukuran sampel hanya , terbukti jauh lebih sedikit. dari, yaitu rata-rata kali, digunakan untuk menghasilkan populasi. Namun, ini terkenal, jika jarang diingat, dan saya agak …



4
Buku Pelajaran tentang Matrix Calculus?
Lihat pertanyaan ini di Math SE . Cerpen: Saya membaca Elemen Pembelajaran Statistik dan merasa frustrasi ketika saya mencoba memverifikasi beberapa hasil, misalnya, diberikan lalu RSS ( β) = ( y - X β)T( y - X β) ,RSS(β)=(y-Xβ)T(y-Xβ),\text{RSS}(\beta) = \left(\mathbf{y}-\mathbf{X}\beta\right)^{T}\left(\mathbf{y}-\mathbf{X}\beta\right)\text{,} Saya mencari buku kalkulus matriks yang ditulis seperti buku …

1
Apakah Paradox Stein's masih berlaku ketika menggunakan norma
Stein's Paradox menunjukkan bahwa ketika tiga atau lebih parameter diestimasi secara bersamaan, rata-rata ada gabungan estimasi yang lebih akurat (yaitu, memiliki kesalahan kuadrat rata-rata yang diharapkan) daripada metode apa pun yang menangani parameter secara terpisah. Ini adalah hasil yang sangat berlawanan dengan intuisi. Apakah hasil yang sama berlaku jika alih-alih …

5
Apakah kita masih perlu melakukan pemilihan fitur saat menggunakan algoritma Regularisasi?
Saya punya satu pertanyaan berkenaan dengan kebutuhan untuk menggunakan metode pemilihan fitur (Acak fitur nilai pentingnya hutan atau metode pemilihan fitur Univariat dll) sebelum menjalankan algoritma pembelajaran statistik. Kami tahu untuk menghindari overfitting, kami dapat menerapkan penalti regularisasi pada vektor bobot. Jadi jika saya ingin melakukan regresi linier, maka saya …

1
Contoh kehidupan nyata dari Proses Keputusan Markov
Saya telah menonton banyak video tutorial dan terlihat sama. Yang ini misalnya: https://www.youtube.com/watch?v=ip4iSMRW5X4 Mereka menjelaskan keadaan, tindakan dan probabilitas yang baik-baik saja. Orang itu menjelaskannya baik-baik saja tetapi sepertinya saya tidak bisa memahami apa yang akan digunakan dalam kehidupan nyata. Saya belum menemukan daftar apa pun. Yang paling umum yang …

1
Apa "efek tapal kuda" dan / atau "efek lengkungan" dalam analisis PCA / korespondensi?
Ada banyak teknik dalam statistik ekologi untuk analisis data eksplorasi data multidimensi. Ini disebut teknik 'penahbisan'. Banyak yang sama atau terkait erat dengan teknik umum di tempat lain dalam statistik. Mungkin contoh prototipikal akan menjadi analisis komponen utama (PCA). Ahli ekologi mungkin menggunakan PCA, dan teknik terkait, untuk mengeksplorasi 'gradien' …

1
Apakah kinerja canggih menggunakan vektor paragraf untuk analisis sentimen telah direplikasi?
Saya terkesan dengan hasil dalam makalah ICML 2014 " Representasi Terdistribusi dari Kalimat dan Dokumen " oleh Le dan Mikolov. Teknik yang mereka gambarkan, disebut "vektor paragraf", mempelajari representasi paragraf / dokumen yang panjangnya tidak diawasi secara sewenang-wenang, berdasarkan perluasan model word2vec. Makalah ini melaporkan kinerja canggih pada analisis sentimen …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.