Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Hubungan antara koefisien korelasi phi, Matthews dan Pearson
Apakah koefisien korelasi phi dan Matthews konsep yang sama? Bagaimana mereka terkait atau setara dengan koefisien korelasi Pearson untuk dua variabel biner? Saya menganggap nilai biner adalah 0 dan 1. Korelasi Pearson antara dua variabel acak Bernoulli dan y adalah:xxxyyy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y - \mathbb{E}[y])]} {\sqrt{\text{Var}[x] …

1
Bisakah Anda membandingkan nilai AIC selama model didasarkan pada dataset yang sama?
Saya melakukan beberapa peramalan dalam R menggunakan paket perkiraan Rob Hyndman . Kertas milik paket dapat ditemukan di sini . Dalam makalah, setelah menjelaskan algoritma peramalan otomatis, penulis mengimplementasikan algoritma pada set data yang sama. Namun, setelah memperkirakan model eksponensial smoothing dan ARIMA mereka membuat pernyataan yang saya tidak mengerti …



1
Memahami algoritma MCMC dan Metropolis-Hastings
Selama beberapa hari terakhir saya telah mencoba memahami bagaimana Markov Chain Monte Carlo (MCMC) bekerja. Secara khusus saya telah mencoba memahami dan mengimplementasikan algoritma Metropolis-Hastings. Sejauh ini saya pikir saya memiliki pemahaman keseluruhan tentang algoritma tetapi ada beberapa hal yang belum jelas bagi saya. Saya ingin menggunakan MCMC agar sesuai …

1
Tingkat kebebasan regresi linier berganda
Derajat kebebasan dalam regresi berganda sama dengan , di mana adalah jumlah variabel.N−k−1N−k−1N-k-1kkk Apakah kkk menyertakan variabel respons (yaitu, YYY )? Misalnya, dalam model Y=B0+B1X1+B2X2Y=B0+B1X1+B2X2Y = B_0 + B_1X_1 + B_2X_2 , lalu apakah k=3k=3k = 3 (yaitu, masing-masing 1 df untuk YYY , X1X1X_1 , & X2X2X_2 )?

3
Skor jarak dan kesamaan Euclidean
Saya hanya bekerja dengan buku Collective Intelligence (oleh Toby Segaran) dan menemukan skor jarak Euclidean. Dalam buku ini penulis menunjukkan bagaimana menghitung kesamaan antara dua array rekomendasi (yaitu skor .orang × film ↦ skor )person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) Dia menghitung jarak Euclidean untuk dua orang, dan p 2 dengan …

1
Entropi Diferensial
Entropi diferensial dari Gaussian RV adalah . Ini tergantung padaσ, yang merupakan standar deviasi.catatan2( σ2 πe---√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e})σσ\sigma Jika kita menormalkan variabel acak sehingga memiliki varians unit, tetesan diferensialnya turun. Bagi saya ini kontra-intuitif karena kompleksitas Kolmogorov dari normalisasi konstan harus sangat kecil dibandingkan dengan pengurangan entropi. Seseorang dapat dengan …

2
Ekspektasi bersyarat dari variabel acak eksponensial
Untuk variabel acak ( ) Saya merasa secara intuitif bahwa harus sama dengan karena oleh properti tanpa memori distribusi sama dengan distribusi tetapi bergeser ke kanan sebesar .X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda)E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]x+E[X]x+E[X]x + \mathbb{E}[X]X|X>xX|X>xX|X > xXXXxxx Namun, saya berjuang untuk menggunakan properti tanpa memori untuk memberikan bukti nyata. Bantuan …

1
Bagaimana cara menghasilkan kurva selamat yang diprediksi dari model yang lemah (menggunakan R coxph)?
Saya ingin menghitung fungsi survivor yang diprediksi untuk model bahaya proporsional Cox dengan persyaratan yang rapuh [menggunakan paket survival]. Tampaknya ketika istilah kelemahan ada dalam model, fungsi survivor yang diprediksi tidak dapat dihitung. ## Example require(survival) data(rats) ## Create fake weight set.seed(90989) rats$weight<-runif(nrow(rats),0.2,0.9) ## Cox model with gamma frailty on …

3
Mesin Boltzmann Terbatas untuk regresi?
Saya menindaklanjuti pertanyaan yang saya tanyakan sebelumnya pada RBM . Saya melihat banyak literatur menggambarkan mereka tetapi tidak ada yang benar-benar berbicara tentang regresi (bahkan klasifikasi dengan data berlabel). Saya merasa bahwa ini hanya digunakan untuk data tidak berlabel. Apakah ada sumber daya untuk menangani regresi? Atau sesederhana menambahkan lapisan …

3
Implementasi laso non negatif di R
Saya mencari beberapa sumber terbuka atau perpustakaan yang ada yang dapat saya gunakan. Sejauh yang saya katakan paket glmnet tidak mudah diperluas untuk menutupi kasus non negatif. Saya mungkin salah, Siapa pun yang punya ide sangat dihargai. Maksud saya non-negatif semua koefisien dibatasi menjadi positif (> 0).
13 r  lasso 

3
Bagaimana Anda bisa menangani estimasi tidak stabil dalam regresi linier dengan multi-collinearity tinggi tanpa membuang variabel?
Stabilitas beta dalam regresi linier dengan multi-collinearity tinggi? Katakanlah dalam regresi linier, variabel dan memiliki multi-collinearity tinggi (korelasi sekitar 0,9).x 2x1x1x_1x2x2x_2 Kami khawatir tentang stabilitas koefisien sehingga kami harus memperlakukan multi-collinearity.ββ\beta Solusi buku teks akan hanya membuang salah satu variabel. Tetapi kami tidak ingin kehilangan informasi yang berguna hanya dengan …

4
Apa yang harus dilakukan ketika rata-rata dua sampel berbeda secara signifikan tetapi perbedaannya tampaknya terlalu kecil untuk diperhitungkan
Saya punya dua sampel ( dalam kedua kasus). Berarti berbeda sekitar dua kali lipat dari std. dev. Nilai dihasilkan adalah sekitar 10. Sementara itu bagus untuk mengetahui bahwa saya telah meyakinkan menunjukkan bahwa berarti tidak sama, menurut saya ini didorong oleh n besar. Melihat histogram data saya tentu tidak merasa …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.