Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


5
Intuisi Teorema Bayes
Saya telah mencoba untuk mengembangkan pemahaman berbasis intuisi teorema Bayes dalam hal sebelumnya , posterior , kemungkinan dan probabilitas marjinal . Untuk itu saya menggunakan persamaan berikut: P( B | A ) = P( A | B ) P( B )P( A )P(B|SEBUAH)=P(SEBUAH|B)P(B)P(SEBUAH)P(B|A) = \frac{P(A|B)P(B)}{P(A)} manaSEBUAHSEBUAHAmewakili hipotesis atau keyakinan danBBBmewakili …

4
Mengapa output softmax bukan ukuran ketidakpastian yang baik untuk model Deep Learning?
Saya telah bekerja dengan Convolutional Neural Networks (CNNs) untuk beberapa waktu sekarang, sebagian besar pada data gambar untuk segmentasi semantik / contoh segmentasi. Saya sering memvisualisasikan softmax dari output jaringan sebagai "peta panas" untuk melihat seberapa tinggi per pixel aktivasi untuk kelas tertentu. Saya telah menafsirkan aktivasi rendah sebagai prediksi …

5
Regresi polinomial mentah atau ortogonal?
Saya ingin mengembalikan variabel ke x , x 2 , ... , x 5 . Haruskah saya melakukan ini menggunakan polinomial mentah atau ortogonal? Saya melihat pertanyaan di situs yang berurusan dengan ini, tetapi saya tidak benar-benar mengerti apa perbedaan antara menggunakannya. yyyx,x2,…,x5x,x2,…,x5x,x^2,\ldots,x^5 Mengapa saya tidak bisa hanya melakukan regresi …

1
Menjatuhkan salah satu kolom saat menggunakan pengkodean satu-panas
Pemahaman saya adalah bahwa dalam pembelajaran mesin itu bisa menjadi masalah jika dataset Anda memiliki fitur yang sangat berkorelasi, karena mereka secara efektif menyandikan informasi yang sama. Baru-baru ini seseorang menunjukkan bahwa ketika Anda melakukan enkode satu-panas pada variabel kategori Anda berakhir dengan fitur yang berkorelasi, jadi Anda harus membuang …

2
Bisakah PCA diterapkan untuk data deret waktu?
Saya mengerti bahwa Principal Component Analysis (PCA) dapat diterapkan pada dasarnya untuk data cross sectional. Dapatkah PCA digunakan untuk data deret waktu secara efektif dengan menetapkan tahun sebagai variabel deret waktu dan menjalankan PCA secara normal? Saya telah menemukan bahwa PCA dinamis berfungsi untuk data panel dan pengkodean di Stata …
22 time-series  pca 


2
Mengapa nama "kernel" dalam statistik dan ML?
Ini telah ditanyakan pada situs SE lainnya dalam konteks sistem operasi dan aljabar linier, tetapi pertanyaan yang sama mengganggu saya mengenai metode kernel yang digunakan dalam statistik dan pembelajaran mesin. Seringkali dikatakan bahwa kernel, misalnya dalam estimasi kepadatan kernel atau SVM, mewakili beberapa kesamaan, tetapi saya tidak mendapatkan dari mana …

4
Mengapa Central Limit Theorem rusak dalam simulasi saya?
Katakanlah saya memiliki nomor berikut: 4,3,5,6,5,3,4,2,5,4,3,6,5 Saya sampel beberapa dari mereka, katakanlah, 5 dari mereka, dan menghitung jumlah 5 sampel. Kemudian saya ulangi berulang-ulang untuk mendapatkan banyak jumlah, dan saya plot nilai-nilai penjumlahan dalam histogram, yang akan menjadi Gaussian karena Teorema Limit Pusat. Tetapi ketika mereka mengikuti angka, saya hanya …

3
Apakah ada perbedaan antara Frequentist dan Bayesian pada definisi Kemungkinan?
Beberapa sumber mengatakan fungsi kemungkinan bukan probabilitas kondisional, beberapa mengatakan itu. Ini sangat membingungkan saya. Menurut sebagian besar sumber yang saya lihat, kemungkinan distribusi dengan parameter θθ\theta , harus merupakan produk dari fungsi massa probabilitas yang diberikansampel:x innnxsayaxsayax_i L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(\theta) = L(x_1,x_2,...,x_n;\theta) = \prod_{i=1}^n p(x_i;\theta) Misalnya dalam Regresi Logistik, kami menggunakan …

3
Apa sebenarnya benih dalam generator angka acak?
Saya mencoba beberapa pencarian google biasa dll tetapi sebagian besar jawaban yang saya temukan agak ambigu atau bahasa / perpustakaan tertentu seperti Python atau C ++ stdlib.hdll. Saya mencari bahasa agnostik, jawaban matematis, bukan spesifik perpustakaan. Sebagai contoh, banyak yang mengatakan bahwa benih adalah titik awal generator bilangan acak dan …

4
Dengan ukuran sampel yang cukup besar, sebuah tes akan selalu menunjukkan hasil yang signifikan kecuali ukuran efek sebenarnya adalah nol. Mengapa?
Saya ingin tahu tentang klaim yang dibuat dalam artikel Wikipedia tentang ukuran efek . Secara khusus: [...] perbandingan statistik non-nol akan selalu menunjukkan hasil yang signifikan secara statistik kecuali ukuran efek populasi benar-benar nol Saya tidak yakin apa artinya ini / menyiratkan, apalagi argumen untuk mendukungnya. Saya kira, setelah semua, …


4
Apa gunanya pelaporan statistik deskriptif?
Saya baru saja melakukan analisis data saya menggunakan regresi logistik tetapi saya juga diharuskan memiliki bagian Statistik deskriptif dalam laporan saya. Sejujurnya saya tidak mengerti maksudnya dan saya berharap seseorang mungkin bisa menjelaskan mengapa itu perlu. Misalnya jika saya memplot histogram dari salah satu variabel kontinu independen saya dan itu …

1
Menunjukkan bahwa 100 pengukuran untuk 5 subjek memberikan informasi yang jauh lebih sedikit daripada 5 pengukuran untuk 100 subjek
Di sebuah konferensi saya mendengar pernyataan berikut: 100 pengukuran untuk 5 subjek memberikan informasi yang jauh lebih sedikit daripada 5 pengukuran untuk 100 subjek. Ini agak jelas bahwa ini benar, tetapi saya bertanya-tanya bagaimana orang dapat membuktikannya secara matematis ... Saya pikir model campuran linear dapat digunakan. Namun, saya tidak …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.