Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Penjelasan untuk derajat kebebasan non-integer dalam uji t dengan varian yang tidak sama
Prosedur t-Tes SPSS melaporkan 2 analisis ketika membandingkan 2 cara independen, satu analisis dengan varians sama diasumsikan dan satu dengan varians sama tidak diasumsikan. Derajat kebebasan (df) ketika varians yang sama diasumsikan selalu nilai integer (dan sama dengan n-2). Df ketika varians yang sama tidak diasumsikan adalah non-integer (misalnya, 11,467) …

3
Bagaimana memilih jumlah optimal faktor laten dalam faktorisasi matriks non-negatif?
Dengan matriks , Factorisasi Matriks Non-negatif (NMF) menemukan dua matriks non-negatif dan ( yaitu dengan semua elemen ) untuk mewakili matriks yang diuraikan sebagai:Vm×nVm×n\mathbf V^{m \times n}Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, misalnya dengan mensyaratkan bahwa dan yang non-negatif meminimalkan kesalahan rekonstruksiWW\mathbf …

4
Arti fitur laten?
Saya mencoba memahami model faktorisasi matriks untuk sistem yang merekomendasikan dan saya selalu membaca 'fitur laten', tetapi apa artinya itu? Saya tahu apa artinya fitur untuk dataset pelatihan tapi saya tidak bisa memahami ide fitur laten. Setiap makalah tentang topik yang saya temukan terlalu dangkal. Edit: jika Anda setidaknya bisa …

3
Hitung Perbedaan Kullback-Leibler dalam praktik?
Saya menggunakan KL Divergence sebagai ukuran ketidaksamaan antara 2 p.m.f.p.m.f.p.m.f. PPP dan QQQ . DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Jika maka kita dapat dengan mudah menghitung bahwa P ( X i ) l n ( Q ( X i ) ) = …

1
Bagaimana cara menghitung kemurnian?
Dalam analisis kluster bagaimana kita menghitung kemurnian? Apa persamaannya? Saya tidak mencari kode untuk melakukannya untuk saya. Biarkan menjadi cluster k, dan c_j menjadi kelas j.c jωkωk\omega_kcjcjc_j Jadi apakah kemurnian bisa dibilang akurat? sepertinya menjumlahkan jumlah kelas yang benar-benar diklasifikasikan per cluster di atas ukuran sampel. sumber persamaan Pertanyaannya adalah …
15 clustering 

4
Cara menjaga variabel invarian waktu dalam model efek tetap
Saya memiliki data tentang karyawan perusahaan besar Italia selama lebih dari sepuluh tahun dan saya ingin melihat bagaimana kesenjangan gender dalam pendapatan pria-wanita berubah dari waktu ke waktu. Untuk tujuan ini saya menjalankan OLS dikumpulkan: yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = X'_{it}\beta + \delta {\rm male}_i + \sum^{10}_{t=1}\gamma_t d_t + \varepsilon_{it} di mana …


1
Rangkaian waktu biologis multivarian: VAR dan musiman
Saya memiliki dataset deret waktu multivarian termasuk variabel biologis dan lingkungan yang berinteraksi (ditambah beberapa variabel eksogen). Selain musiman, tidak ada tren jangka panjang yang jelas dalam data. Tujuan saya adalah untuk melihat variabel mana yang terkait satu sama lain. Peramalan tidak benar-benar dicari. Menjadi orang baru dalam analisis deret …

1
Secara kualitatif apa itu Cross Entropy
Pertanyaan ini memberikan definisi kuantitatif tentang entropi silang, dalam hal rumusnya. Saya mencari definisi yang lebih jelas, kata wikipedia: Dalam teori informasi, entropi silang antara dua distribusi probabilitas mengukur jumlah rata-rata bit yang diperlukan untuk mengidentifikasi suatu peristiwa dari serangkaian kemungkinan, jika skema pengkodean digunakan berdasarkan distribusi probabilitas yang diberikan …

1
Mengapa saya tidak dapat mencocokkan output glmer (keluarga = binomial) dengan penerapan algoritma Gauss-Newton secara manual?
Saya ingin mencocokkan output dari lmer (benar-benar glmer) dengan contoh binomial mainan. Saya sudah membaca sketsa dan yakin saya mengerti apa yang sedang terjadi. Tapi ternyata saya tidak. Setelah macet, saya memperbaiki "kebenaran" dalam hal efek acak dan pergi setelah memperkirakan efek tetap saja. Saya memasukkan kode ini di bawah. …


1
Cara terbaik untuk menyajikan hubungan secara visual dari model linier berganda
Saya memiliki model linier dengan sekitar 6 prediktor dan saya akan mempresentasikan estimasi, nilai F, nilai p, dll. Namun, saya bertanya-tanya apa yang akan menjadi plot visual terbaik untuk mewakili efek individual dari satu prediktor tunggal pada variabel respon? Scatterplot? Plot Bersyarat? Efek plot? dll? Bagaimana saya menafsirkan plot itu? …

1
Goni fungsi logistik
Saya mengalami kesulitan untuk mendapatkan Hessian dari fungsi objektif, l(θ)l(θ)l(\theta) , dalam regresi logistik di mana adalah: l(θ)l(θ)l(\theta)l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) adalah fungsi logistik. Hessian adalah . Saya mencoba menurunkannya dengan menghitung , tetapi kemudian tidak jelas bagi saya bagaimana cara mendapatkan …
15 logistic 

2
Bingung dengan variasi MCMC Metropolis-Hastings: Random-Walk, Non-Random-Walk, Independent, Metropolis
Selama beberapa minggu terakhir saya telah mencoba memahami MCMC dan algoritma Metropolis-Hastings. Setiap kali saya pikir saya memahaminya, saya menyadari bahwa saya salah. Sebagian besar contoh kode yang saya temukan on-line mengimplementasikan sesuatu yang tidak konsisten dengan deskripsi. yaitu: Mereka mengatakan mereka menerapkan Metropolis-Hastings tetapi mereka benar-benar menerapkan metropolis berjalan …

3
Pengaturan dan penskalaan fitur dalam pembelajaran online?
Katakanlah saya memiliki penggolong regresi logistik. Dalam pembelajaran batch normal, saya akan memiliki istilah regularizer untuk mencegah overfitting dan menjaga bobot saya kecil. Saya juga akan menormalkan dan memperbesar fitur saya. Dalam pengaturan pembelajaran online, saya mendapatkan aliran data yang berkelanjutan. Saya melakukan pembaruan gradient descent dengan setiap contoh dan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.