Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Bagaimana , koordinat kutub, didistribusikan ketika dan kapan ?
Biarkan koordinat Cartesian dari titik acak dipilih st .x,yx,yx,y(x,y)∼U(−10,10)×U(−10,10)(x,y)∼U(−10,10)×U(−10,10)(x,y) \sim U(-10,10) \times U(-10,10) Dengan demikian, jari-jari, , tidak merata seperti yang tersirat oleh 's pdf .ρ=x2+y2−−−−−−√ρ=x2+y2\rho = \sqrt{x^2 + y^2}ρρ\rho Meskipun demikian saya berharap hampir seragam, tidak termasuk artefak karena sisa 4 di tepi:θ=arctanyxθ=arctan⁡yx\theta = \arctan{\frac{y}{x}} Berikut ini adalah fungsi …

5
Apa namanya: hyperparameters
Jadi dalam distribusi normal, kami memiliki dua parameter: mean dan variance . Dalam buku Pattern Recognition dan Machine Learning , tiba-tiba muncul hyperparameter dalam istilah regularisasi fungsi kesalahan.μμ\muσ2σ2\sigma^2λλ\lambda Apa itu hiperparameter? Mengapa mereka dinamai demikian? Dan bagaimana mereka secara intuitif berbeda dari parameter pada umumnya?

1
Antonim dari varian
Apakah ada kata yang berarti 'kebalikan dari varians'? Yaitu, jika memiliki varian tinggi, maka memiliki rendah ? Tidak tertarik dengan antonim dekat (seperti 'perjanjian' atau 'kesamaan') tetapi secara khusus berarti ?XXXXXX……\dots1/σ21/σ21/\sigma^2

3
Apa yang harus diajarkan terlebih dahulu: Probabilitas atau Statistik?
Saya baru saja bergabung sebagai anggota fakultas di departemen matematika. dari sebuah institusi terkenal. Saya akan mengajarkan Probabilitas dan Statistik program studi di tingkat sarjana. Lembaga ini sudah memiliki silabus untuk kursus ini yang saya tidak puas. Dalam silabus itu, statistik dibahas pertama kali, juga bagian estimasi tidak ada. Saya …
19 teaching 

2
Dapatkah regularisasi bermanfaat jika kita hanya tertarik pada pemodelan, bukan pada peramalan?
Dapatkah regularisasi bermanfaat jika kita hanya tertarik dalam memperkirakan (dan menafsirkan) parameter model, bukan dalam peramalan atau prediksi? Saya melihat bagaimana regularisasi / validasi silang sangat berguna jika tujuan Anda adalah membuat perkiraan yang baik tentang data baru. Tetapi bagaimana jika Anda melakukan ekonomi tradisional dan semua yang Anda pedulikan …




2
Mengapa estimasi kemungkinan maksimum dianggap sebagai teknik yang sering dilakukan
Statistik Frequentist bagi saya identik dengan mencoba membuat keputusan yang baik untuk semua sampel yang mungkin. Yaitu, aturan keputusan frequentist harus selalu berusaha meminimalkan risiko frequentist, yang tergantung pada fungsi kerugian dan keadaan sebenarnya :L θ 0δδ\deltaLLLθ0θ0\theta_0 Rfreq=Eθ0(L(θ0,δ(Y))Rfreq=Eθ0(L(θ0,δ(Y))R_\mathrm{freq}=\mathbb{E}_{\theta_0}(L(\theta_0,\delta(Y)) Bagaimana estimasi kemungkinan maksimum terhubung ke risiko frequentist? Mengingat bahwa itu adalah …

1
Bagaimana LDA, teknik klasifikasi, juga berfungsi sebagai teknik reduksi dimensi seperti PCA
Pada artikel ini , penulis menghubungkan analisis diskriminan linier (LDA) ke analisis komponen utama (PCA). Dengan pengetahuan saya yang terbatas, saya tidak bisa mengikuti bagaimana LDA bisa agak mirip dengan PCA. Saya selalu berpikir bahwa LDA adalah bentuk algoritma klasifikasi, mirip dengan regresi logistik. Saya akan menghargai bantuan dalam memahami …

1
Penggunaan prediktor sirkuler dalam regresi linier
Saya mencoba menyesuaikan model menggunakan data angin (0, 359) dan waktu hari (0, 23), tetapi saya khawatir bahwa mereka tidak akan cocok dengan regresi linier karena mereka bukan parameter linear sendiri. Saya ingin mengubahnya menggunakan Python. Saya telah melihat beberapa penyebutan penghitungan vektor dengan cara mengambil dosa dan cos dari …

2
Boosting: mengapa laju pembelajaran disebut parameter regularisasi?
The tingkat belajar parameter ( ) di Gradient Meningkatkan menyusut kontribusi masing-masing model dasar baru -typically sebuah pohon yang dangkal yang ditambahkan dalam seri. Itu terbukti secara dramatis meningkatkan akurasi set tes, yang dapat dimengerti karena dengan langkah-langkah yang lebih kecil, minimum fungsi kerugian dapat dicapai lebih tepat. ν∈ [ …

3
Pentingnya simpul bias dalam jaringan saraf
Saya ingin tahu seberapa penting bias node bagi efektivitas jaringan saraf modern. Saya dapat dengan mudah memahami bahwa ini penting dalam jaringan yang dangkal dengan hanya beberapa variabel input. Namun, jaring saraf modern seperti dalam pembelajaran yang mendalam sering memiliki sejumlah besar variabel input untuk memutuskan apakah neuron tertentu dipicu. …

3
Julia: Mencermati bagaimana keadaannya
Posting ini berkaitan dengan peristiwa yang berubah dengan cepat. Saya menemukan pertanyaan 2012 yang memiliki diskusi yang sangat baik tentang Julia sebagai alternatif untuk R / Python untuk berbagai jenis pekerjaan statistik. Di sinilah letak Pertanyaan asli dari 2012 tentang janji Julia Sayangnya Julia masih sangat baru saat itu & …
19 r  python  computing  julia 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.