Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Seleksi df spline dalam masalah model aditif Poisson umum
Saya telah menyesuaikan beberapa data deret waktu menggunakan model aditif umum Poisson menggunakan SAS PROC GAM. Secara umum, saya sudah memiliki prosedur validasi silang internal yang terintegrasi menghasilkan setidaknya "titik awal" yang layak untuk spline tunggal saya, yang merupakan fungsi waktu non-linear bersama dengan istilah parametrik tunggal (yang saya sebenarnya …


3
Apa RMSE dinormalisasi dengan nilai rata-rata yang diamati disebut?
Saya telah menggunakan Root Mean Squared Error(RMSE) untuk mengukur akurasi nilai yang diprediksi menggunakan model. Saya mengerti bahwa nilai yang dikembalikan menggunakan satuan ukuran saya (bukan persentase). Namun, saya ingin mengutip nilai saya sebagai persentase. Pendekatan yang saya ambil adalah menormalkan RMSEdengan nilai rata-rata pengamatan saya. Apakah ada istilah untuk …

2
Menggunakan model regresi untuk membuat prediksi: Kapan harus berhenti?
Saya menghitung model regresi linier sederhana dari ukuran percobaan saya untuk membuat prediksi. Saya telah membaca bahwa Anda tidak harus menghitung prediksi untuk poin yang terlalu jauh dari data yang tersedia. Namun, saya tidak dapat menemukan panduan untuk membantu saya mengetahui sejauh mana saya bisa memperkirakan. Sebagai contoh, jika saya …


3
auto.arima memperingatkan NaN yang diproduksi pada kesalahan std
Data saya adalah serangkaian waktu populasi yang dipekerjakan, L, dan rentang waktu, tahun. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 …
9 r  regression  arima 


1
Prediksi GLM poisson dengan offset
Saya tahu ini mungkin pertanyaan dasar ... Tapi sepertinya saya tidak menemukan jawabannya. Saya pas GLM dengan keluarga Poisson, dan kemudian mencoba untuk melihat prediksi, namun offset tampaknya dipertimbangkan: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Saya mendapatkan case bukan rate ... Saya sudah mencoba juga model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), data=data, …

1
Bagaimana cara mendapatkan batas keputusan dari linear SVM di R?
Saya membutuhkan paket yang dapat memberi saya persamaan untuk model SVM linier. Saat ini saya menggunakan e1071 seperti: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Namun, saya tidak yakin bagaimana e1071::svm()memilih kelas positif dan negatif, jadi …
9 r  svm  e1071 

3
Penalaran dan pengkondisian yang sering pada pengamatan (contoh dari Wagenmakers et al.)
Saya bukan ahli dalam statistik, tetapi saya menemukan ada ketidaksepakatan apakah interpretasi probabilitas "frequentist" atau "Bayesian" adalah yang "benar". Dari Wagenmakers et. al p. 183: Pertimbangkan distribusi seragam dengan rata-rata dan lebar . Menggambar dua nilai secara acak dari distribusi ini, label yang terkecil dan yang terbesar , dan memeriksa …

1
Klasifikasi dengan satu prediktor dominan
Saya memiliki masalah klasifikasi ( -class), dengan urutan 100 prediktor nilai nyata, salah satunya tampaknya memiliki kekuatan penjelas yang lebih banyak daripada yang lain. Saya ingin masuk lebih dalam ke efek dari variabel lain. Namun, teknik pembelajaran mesin standar (hutan acak, SVM, dll) tampaknya dibanjiri oleh satu peramal yang kuat …

2
Memahami dan menerapkan analisis sentimen
Saya baru saja ditugaskan proyek melakukan analisis sentimen untuk beberapa koleksi dokumen. Oleh Googling, banyak penelitian terkait sentimen bermunculan. Pertanyaan saya adalah: Apa metode / algoritma utama untuk analisis sentimen di bidang pembelajaran mesin dan analisis statistik? Apakah ada hasil yang mapan? Apakah ada perangkat lunak sumber terbuka yang dapat …

1
Bagaimana memahami residu standar dalam analisis regresi?
Menurut Analisis Regresi dengan Contoh , residual adalah perbedaan antara respon dan nilai prediksi, maka dikatakan bahwa setiap residual memiliki varian yang berbeda, jadi kita perlu mempertimbangkan residu terstandarisasi. Tetapi variansnya adalah untuk sekelompok nilai, bagaimana mungkin nilai tunggal memiliki varians?


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.