Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Apa yang dikatakan oleh matriks kovariansi non positif yang pasti tentang data saya?
Saya memiliki sejumlah pengamatan multivariat dan ingin mengevaluasi kepadatan probabilitas di semua variabel. Diasumsikan bahwa data terdistribusi secara normal. Pada jumlah variabel yang rendah semuanya berfungsi seperti yang saya harapkan, tetapi pindah ke jumlah yang lebih besar menghasilkan matriks kovarians menjadi tidak pasti positif. Saya telah mengurangi masalah di Matlab …

1
Diagnostik residual dalam model regresi berbasis MCMC
Saya baru-baru ini memulai model campuran regresi pas dalam kerangka Bayesian, menggunakan algoritma MCMC (fungsi MCMCglmm dalam R sebenarnya). Saya percaya saya telah mengerti bagaimana cara mendiagnosis konvergensi proses estimasi (jejak, alur geweke, autokorelasi, distribusi posterior ...). Salah satu hal yang mengejutkan saya dalam kerangka Bayesian adalah bahwa banyak upaya …

4
Perbedaan antara analisis regresi dan analisis varians?
Pertanyaan ini dimigrasikan dari Mathematics Stack Exchange karena dapat dijawab di Cross Validated. Bermigrasi 7 tahun yang lalu . Saya belajar sekarang tentang analisis regresi dan analisis varians. Dalam analisis regresi, Anda memiliki satu variabel tetap dan Anda ingin tahu bagaimana variabel berjalan dengan variabel lainnya. Dalam analisis ragam yang …
21 regression 

3
Membandingkan dan membandingkan, nilai-p, tingkat signifikansi dan kesalahan tipe I
Saya bertanya-tanya apakah ada yang bisa memberikan ikhtisar singkat tentang definisi dan penggunaan nilai-p, tingkat signifikansi dan kesalahan tipe I. Saya mengerti bahwa nilai-p didefinisikan sebagai "probabilitas untuk memperoleh statistik uji setidaknya sama ekstrimnya dengan yang kami amati", sementara tingkat signifikansi hanyalah nilai batas yang sewenang-wenang untuk mengukur apakah nilai-p …

4
Pentingnya prediktor dalam regresi berganda: Partial vs koefisien standar
Saya bertanya-tanya apa hubungan yang tepat antara parsial dan koefisien dalam model linier dan apakah saya harus menggunakan hanya satu atau keduanya untuk menggambarkan pentingnya dan pengaruh faktor.R2R2R^2 Sejauh yang saya tahu, dengan summarysaya mendapatkan estimasi koefisien, dan dengan anovajumlah kuadrat untuk setiap faktor - proporsi jumlah kuadrat dari satu …

1
Bagaimana saya bisa menyelaraskan / menyinkronkan dua sinyal?
Saya sedang melakukan beberapa penelitian tetapi telah terjebak pada tahap analisis (seharusnya lebih memperhatikan kuliah statistik saya). Saya telah mengumpulkan dua sinyal simultan: laju aliran terintegrasi untuk volume dan perubahan ekspansi dada. Saya ingin membandingkan sinyal dan akhirnya berharap untuk mendapatkan volume dari sinyal ekspansi dada. Tetapi pertama-tama saya harus …

5
Cara baru penambangan data yang revolusioner?
Kutipan berikut berasal dari Schwager's Hedge Fund Market Wizzards (Mei 2012), sebuah wawancara dengan manajer dana lindung nilai yang sukses secara konsisten Jaffray Woodriff: Untuk pertanyaan: "Apa kesalahan terburuk yang dilakukan orang dalam penambangan data?": Banyak orang berpikir mereka baik-baik saja karena mereka menggunakan data dalam sampel untuk pelatihan dan …

3
Susun / model ansambel dengan tanda sisipan
Saya sering menemukan diri saya melatih beberapa model prediktif berbeda menggunakan caretR. Saya akan melatih mereka semua pada lipatan validasi silang yang sama, menggunakan caret::: createFolds, kemudian memilih model terbaik berdasarkan kesalahan lintas-divalidasi. Namun, prediksi median dari beberapa model sering mengungguli model tunggal terbaik pada set tes independen. Saya sedang …
21 r  caret  ensemble 

3
PCA saat dimensinya lebih besar dari jumlah sampel
Saya telah menemukan sebuah skenario di mana saya memiliki 10 sinyal / orang untuk 10 orang (jadi 100 sampel) berisi 14000 titik data (dimensi) yang harus saya sampaikan ke pengklasifikasi. Saya ingin mengurangi dimensi data ini dan PCA tampaknya menjadi cara untuk melakukannya. Namun, saya hanya dapat menemukan contoh PCA …

3
Langkah pertama untuk data besar ( , )
Misalkan Anda menganalisis kumpulan data besar dengan jumlah milyaran pengamatan per hari, di mana setiap pengamatan memiliki beberapa ribu variabel yang mungkin jarang dan variabel numerik dan kategororial yang berlebihan. Katakanlah ada satu masalah regresi, satu masalah klasifikasi biner yang tidak seimbang, dan satu tugas "mencari tahu prediktor mana yang …

2
"Niat penyelidik" dan nilai ambang / p-nilai
Saya membaca slide "Doing Bayesian Data Analysis" karya John Kruschke , tetapi sebenarnya ada pertanyaan tentang interpretasinya tentang uji-t dan / atau keseluruhan kerangka kerja pengujian signifikansi nol-hipotesis. Dia berpendapat bahwa nilai-p tidak didefinisikan dengan jelas karena mereka bergantung pada niat penyelidik. Secara khusus, ia memberikan contoh (halaman 3-6) dari …

1
Kapan Markov bidang acak
Dalam buku teks mereka, Model Grafis, Keluarga Eksponensial dan Inferensi Variasi , M. Jordan dan M. Wainwright membahas hubungan antara keluarga Eksponensial dan Markov Random Fields (model grafis tidak diarahkan). Saya mencoba memahami hubungan antara mereka dengan pertanyaan-pertanyaan berikut: Apakah semua anggota MRF dari keluarga Eksponensial? Bisakah semua anggota dari …


2
Membandingkan pengelompokan: Indeks Rand vs Variasi Informasi
Saya bertanya-tanya apakah ada yang punya wawasan atau intuisi di balik perbedaan antara Variasi Informasi dan Indeks Rand untuk membandingkan pengelompokan. Saya telah membaca makalah " Membandingkan Clusterings - Sebuah Jarak Berbasis Informasi " oleh Marina Melia (Journal of Multivariate Analysis, 2007), tetapi, selain memperhatikan perbedaan dalam definisi, saya tidak …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.