Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apakah mungkin untuk mengotomatisasi perkiraan seri waktu?
Saya ingin membangun sebuah algoritma yang akan dapat menganalisis deret waktu dan "secara otomatis" memilih metode peramalan tradisional / statiskal terbaik (dan parameternya) untuk data deret waktu yang dianalisis. Mungkinkah melakukan hal seperti ini? Jika ya, dapatkah Anda memberi saya beberapa tips tentang bagaimana hal ini dapat didekati?

2
Bagaimana cara melakukan tes post-hoc pada model lmer?
Ini adalah bingkai data saya: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) Lalu saya menjalankan model efek linear-campuran untuk membandingkan perbedaan 3 Grup pada "Nilai", di mana "Subjek" adalah faktor acak: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), data = data) summary(model) …
18 r  lme4-nlme  post-hoc 

1
kompleksitas komputasi k-NN
Apa kompleksitas waktu dari algoritma k -NN dengan pendekatan pencarian naif (tidak ada pohon kd atau similars)? Saya tertarik pada kompleksitas waktunya mempertimbangkan juga hyperparameter k . Saya telah menemukan jawaban yang bertentangan: O (nd + kn), di mana n adalah kardinalitas set pelatihan dan d dimensi masing-masing sampel. [1] …




3
Analisis perbedaan Kullback-Leibler
Mari kita perhatikan dua distribusi probabilitas berikut P Q 0.01 0.002 0.02 0.004 0.03 0.006 0.04 0.008 0.05 0.01 0.06 0.012 0.07 0.014 0.08 0.016 0.64 0.928 Saya telah menghitung divergensi Kullback-Leibler yang sama dengan , saya ingin tahu secara umum apa yang ditunjukkan angka ini kepada saya? Secara umum, …

4
Kapan metode Bayesian lebih disukai daripada Frequentist?
Saya benar-benar ingin belajar tentang teknik Bayesian, jadi saya telah berusaha sedikit belajar sendiri. Namun, saya mengalami kesulitan melihat ketika menggunakan teknik Bayesian yang pernah memberi keuntungan atas metode Frequentist. Sebagai contoh: Saya telah melihat dalam literatur sedikit tentang bagaimana beberapa menggunakan prior informatif sedangkan yang lain menggunakan non-informatif sebelumnya. …

2
Menguji Klasifikasi pada Data Ketidakseimbangan yang Berlebihan
Saya sedang mengerjakan data yang sangat tidak seimbang. Dalam literatur, beberapa metode digunakan untuk menyeimbangkan kembali data menggunakan re-sampling (over-atau under-sampling). Dua pendekatan yang baik adalah: SMOTE: Tehnik Sintetis Minoritas Berlebih ( SMOTE ) ADASYN: Pendekatan Sampling Sintetis Adaptif untuk Pembelajaran Ketidakseimbangan ( ADASYN ) Saya telah menerapkan ADASYN karena …


2
Memvisualisasikan basis spline
Buku teks biasanya memiliki contoh plot yang bagus dari dasar untuk splines seragam ketika mereka menjelaskan topik tersebut. Sesuatu seperti deretan segitiga kecil untuk spline linier, atau deretan punuk kecil untuk spline kubik. Ini adalah contoh khas: http://support.sas.com/documentation/cdl/en/statug/63033/HTML/default/viewer.htm#statug_introcom_a0000000525.htm Saya bertanya-tanya apakah ada cara mudah untuk menghasilkan plot basis spline menggunakan …

1
Kesalahan standar untuk koefisien regresi berganda?
Saya menyadari bahwa ini adalah pertanyaan yang sangat mendasar, tetapi saya tidak dapat menemukan jawaban di mana pun. Saya menghitung koefisien regresi menggunakan persamaan normal atau dekomposisi QR. Bagaimana saya bisa menghitung kesalahan standar untuk setiap koefisien? Saya biasanya menganggap kesalahan standar dihitung sebagai: SEx¯ =σx¯n√SEx¯ =σx¯nSE_\bar{x}\ = \frac{\sigma_{\bar x}}{\sqrt{n}} …

3
Perbedaan antara sampel, langkah waktu dan fitur dalam jaringan saraf
Saya akan melalui blog berikut pada jaringan saraf LSTM: http://machinelearningmastery.com/understanding-stateful-lstm-recurrent-neural-networks-python-keras/ Penulis membentuk kembali vektor input X sebagai [sampel, langkah waktu, fitur] untuk konfigurasi LSTM yang berbeda. Penulis menulis Memang, urutan huruf adalah langkah waktu dari satu fitur daripada satu langkah waktu dari fitur yang terpisah. Kami telah memberikan lebih banyak …

2
Proporsi varian yang dijelaskan dalam model efek-campuran
Saya tidak tahu apakah ini sudah ditanyakan sebelumnya, tetapi saya tidak menemukan apa-apa tentang itu. Pertanyaan saya adalah apakah ada yang bisa memberikan referensi yang baik untuk belajar bagaimana mendapatkan proporsi varian yang dijelaskan oleh masing-masing faktor tetap dan acak dalam model efek campuran.

1
Asumsi LASSO
Dalam skenario regresi LASSO di mana y=Xβ+ϵy=Xβ+ϵy= X \beta + \epsilon , dan perkiraan LASSO diberikan oleh masalah optimisasi berikut minβ||y−Xβ||+τ||β||1minβ||y−Xβ||+τ||β||1 \min_\beta ||y - X \beta|| + \tau||\beta||_1 Apakah ada asumsi distribusi tentang ϵϵ\epsilon ? Dalam skenario OLS, orang akan berharap bahwa ϵϵ\epsilon independen dan terdistribusi normal. Apakah masuk akal …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.