Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Bagaimana cara menghitung divergensi Kullback-Leibler ketika PMF berisi 0s?
Saya memiliki jangka waktu berikut diperoleh dengan menggunakan data yang diposting di bawah ini. Untuk ukuran jendela geser 10, saya mencoba menghitung KL-divergensi antara nilai-nilai PMF dalam jendela geser saat ini dan PMF sejarah dengan tujuan akhir memplot nilai KL-divergensi sepanjang waktu sehingga saya dapat membandingkan dua seri waktu. Sampai …

1
Apakah distribusi entropi maksimum konsisten dengan distribusi marjinal yang diberikan distribusi produk dari marjinal?
Umumnya ada banyak distribusi gabungan konsisten dengan set distribusi marginal yang diketahui .P(X1=x1,X2=x2,...,Xn=xn)P(X1=x1,X2=x2,...,Xn=xn)P(X_1 = x_1, X_2 = x_2, ..., X_n = x_n)fi(xi)=P(Xi=xi)fi(xi)=P(Xi=xi)f_i(x_i) = P(X_i = x_i) Dari distribusi gabungan ini, apakah produk dibentuk dengan mengambil produk dari marginal yang dengan entropi tertinggi?∏ifi(xi)∏ifi(xi)\prod_i f_i(x_i) Saya yakin ini benar, tetapi saya sangat …

2
Apa arti dan varian untuk distribusi Gamma?
Ada dua bentuk untuk distribusi Gamma, masing-masing dengan definisi berbeda untuk parameter bentuk dan skala. Daripada menanyakan bentuk apa yang digunakan untuk implementasi gsl_ran_gamma , mungkin lebih mudah untuk meminta definisi terkait untuk mean dan standar deviasi dalam hal bentuk dan parameter skala. Setiap pointer ke definisi akan dihargai.

2
Bagaimana cara menggunakan kode GPML Matlab dengan benar untuk masalah aktual (non-demo)?
Saya telah mengunduh kode GPML Matlab terbaru. Kode GPML Matlab dan saya telah membaca dokumentasi dan menjalankan demo regresi tanpa masalah. Namun, saya mengalami kesulitan memahami bagaimana menerapkannya pada masalah regresi yang saya hadapi. Masalah regresi didefinisikan sebagai berikut: Membiarkan xsaya∈R20xi∈R20\mathbf{x}_i \in \mathbb{R}^{20} menjadi vektor input dan ysaya∈R25yi∈R25\mathbf{y}_i \in \mathbb{R}^{25}menjadi …


1
Kriteria siku untuk menentukan jumlah cluster
Disebutkan di sini bahwa salah satu metode untuk menentukan jumlah cluster optimal dalam satu set data adalah "metode siku". Di sini persentase varians dihitung sebagai rasio varians antara-kelompok dengan total varians. Saya merasa sulit memahami perhitungan ini. Adakah yang bisa menjelaskan bagaimana cara menghitung persentase varian untuk set data yang …

2
Ukuran autokorelasi nilai kategoris Rantai Markov?
Pertanyaan Langsung: Apakah ada langkah-langkah korelasi-otomatis untuk urutan pengamatan variabel kategori (tidak berurutan)? Latar Belakang: Saya menggunakan MCMC untuk mengambil sampel dari variabel kategori dan saya ingin mengukur seberapa baik metode pengambilan sampel yang saya kembangkan adalah pencampuran di seluruh distribusi posterior. Saya kenal dengan petak acf dan korelasi-otomatis untuk …

1
Teknik Kategorisasi / Segmentasi
Pertama, izinkan saya mengatakan bahwa saya sedikit keluar dari kedalaman saya di sini, jadi jika pertanyaan ini perlu diutarakan kembali atau ditutup sebagai duplikat, harap beri tahu saya. Mungkin saja saya tidak memiliki kosakata yang tepat untuk mengungkapkan pertanyaan saya. Saya mengerjakan tugas pemrosesan gambar di mana saya mengidentifikasi fitur-fitur …

1
Interval kepercayaan bootstrap pada parameter atau distribusi?
Maafkan apa yang mungkin pertanyaan jelas tentang bootstrap. Saya terjebak di dunia Bayesian awal dan tidak pernah benar-benar menjelajahi bootstrap sebanyak yang seharusnya saya lakukan. Saya berlari melintasi analisis di mana penulis tertarik pada analisis kelangsungan hidup terkait dengan waktu ke data kegagalan. Mereka memiliki sekitar 100 poin dan menggunakan …

1
Kesesuaian resmi dari data yang dirangkum: memilih parameter
Sebagai lanjutan dari pertanyaan saya sebelumnya , solusi untuk persamaan normal untuk regresi ridge diberikan oleh: β^λ= (XTX+ λ I)- 1XTyβ^λ=(XTX+λI)−1XTy\hat{\beta}_\lambda = (X^TX+\lambda I)^{-1}X^Ty Bisakah Anda menawarkan panduan untuk memilih parameter regularisasi . Selain itu, karena diagonal tumbuh dengan jumlah pengamatan , haruskah juga menjadi fungsi ?λλ\lambdaXTXXTXX^TXmmmλλ\lambdammm

1
Analisis statistik STFT
Saya menggunakan evolfftfungsi dalam RSEISpaket R untuk melakukan analisis sinyal STFT. Sinyal satu jam panjang dan diperoleh selama 3 kondisi yang berbeda, khususnya kontrol 0-20 ', 20'-40' stimulus, 40'-60 'setelah stimulus. Secara visual, saya melihat perubahan dalam spektogram selama 3 periode ini, dengan frekuensi yang lebih tinggi dan daya FFT …

3
Apa istilah untuk regresi deret waktu yang memiliki lebih dari satu prediktor?
Cukup sulit mencari di Web untuk info tentang sesuatu ketika Anda tidak tahu kata-kata apa yang biasa digunakan untuk menggambarkannya. Dalam hal ini, saya ingin tahu apa namanya ketika Anda memasukkan prediktor lain dalam rangkaian waktu. Sebagai contoh, katakan saya memodelkan variabel menggunakan AR (3):XXX Xt=φ1Xt−1+φ2Xt−2+φ3Xt−3+εtXt=φ1Xt−1+φ2Xt−2+φ3Xt−3+εt X_t = \varphi_1 X_{t-1} …

2
Apakah interval kepercayaan berlaku untuk pengambilan sampel kuota?
Lembaga pemungutan suara Prancis saat ini menghadapi krisis besar setelah mereka baru-baru ini menerbitkan apa yang hanya bisa disebut polling paling konyol sejauh ini pada pacuan kuda pemilihan presiden 2012. Senat Prancis sekarang mempertimbangkan untuk membuat undang-undang tentang masalah ini dengan memaksa lembaga pemungutan suara untuk menerbitkan, antara lain, interval …

1
Struktur direktori proyek statistik dengan berbagai bahasa (misalnya, R dan Splus)?
Membangun posting Bagaimana mengelola proyek analisis statistik dan ProjectTemplatepaket dalam R ... T: Bagaimana Anda membangun struktur direktori proyek statistik Anda ketika banyak bahasa banyak fitur (misalnya, R DAN Splus)? Sebagian besar diskusi tentang topik ini terbatas pada proyek yang terutama menggunakan satu bahasa. Saya prihatin dengan cara meminimalkan kecerobohan, …

3
Mahalanobis berjarak antara dua distribusi bivariat dengan kovarian yang berbeda
Pertanyaannya cukup banyak terkandung dalam judul. Berapa jarak Mahalanobis untuk dua distribusi matriks kovarian yang berbeda? Apa yang saya temukan sampai sekarang mengasumsikan kovarian yang sama untuk kedua distribusi, yaitu, semacam ini: ΔTΣ−1ΔΔTΣ−1Δ\Delta^T \Sigma^{-1} \Delta Bagaimana jika saya memiliki dua berbeda ?ΣΣ\Sigma Catatan: - Masalahnya adalah ini: ada dua distribusi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.