Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
GLM setelah pemilihan model atau regularisasi
Saya ingin mengajukan pertanyaan ini dalam dua bagian. Keduanya berurusan dengan model linier umum, tetapi yang pertama berkaitan dengan pemilihan model dan yang lainnya berkaitan dengan regularisasi. Latar Belakang: Saya menggunakan model GLM (linier, logistik, regresi gamma) untuk prediksi dan deskripsi. Ketika saya merujuk pada " hal-hal normal yang dilakukan …


1
Metode statistik online yang dapat diskalakan
Ini terinspirasi oleh regresi linier online yang efisien , yang menurut saya sangat menarik. Apakah ada teks atau sumber daya yang dikhususkan untuk komputasi statistik skala besar, di mana komputasi dengan dataset terlalu besar untuk muat dalam memori utama, dan mungkin terlalu beragam untuk dijadikan subsampel secara efektif. Misalnya, apakah …

5
Ukuran jarak terbaik untuk digunakan
Konteks Saya memiliki dua set data yang ingin saya bandingkan. Setiap elemen data dalam kedua set adalah vektor yang berisi 22 sudut (semua antara dan ). Sudut berhubungan dengan konfigurasi pose manusia yang diberikan, sehingga pose ditentukan oleh 22 sudut sendi.π−π−π-\piππ\pi Apa yang akhirnya saya coba lakukan adalah menentukan "kedekatan" …

4
Menganalisis data angin dengan R
Hai, saya menganalisis data angin untuk memperkirakan energi dari turbin angin. Saya telah mengambil data angin 10 tahun dan membuat grafik histogram; tahap kedua saya adalah menyesuaikan distribusi Weibull ke data. Saya menggunakan R dengan paket lmomuntuk menghitung bentuk dan skala Weibul ini adalah kode yang saya gunakan: >library(lmom) wind.moments<-samlmu(as.numeric(pp$WS)) …
12 r  distributions 

4
Menyiapkan Sweave, R, Lateks, Eclipse StatET [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 3 tahun yang lalu . Beberapa hari yang lalu saya melihat posting tentang cara mengatur SweaveR, yang akan memungkinkan pengguna untuk secara langsung mengekspor hal-hal …
12 r 


2
Bagaimana saya tahu metode estimasi parameter mana yang harus dipilih?
Ada beberapa metode untuk estimasi parameter di luar sana. MLE, UMVUE, MoM, decision-theoretic, dan lain-lain semua sepertinya memiliki kasus yang cukup logis mengapa mereka berguna untuk estimasi parameter. Apakah ada satu metode yang lebih baik daripada yang lain, atau apakah itu hanya masalah bagaimana kita mendefinisikan apa penaksir "pas terbaik" …

2
80% dari data yang hilang dalam satu variabel
Ada satu variabel dalam data saya memiliki 80% dari data yang hilang. Data hilang karena tidak ada (yaitu berapa banyak pinjaman bank yang harus dibayar perusahaan). Saya menemukan sebuah artikel yang mengatakan bahwa metode penyesuaian variabel dummy adalah solusi untuk masalah ini. Berarti saya perlu mengubah variabel kontinu ini menjadi …


1
Memfilter dataframe
Masih mempelajari fungsi dasar dalam R, Fungsi subset tampaknya hanya memfilter kondisi berdasarkan kolom tunggal dengan atau tanpa beberapa kondisi? Bagaimana saya bisa dengan mudah menyaring data dari bingkai data? ketika Anda disediakan dengan berbagai kondisi Ketika kondisi perlu diterapkan di kolom yang tersedia. Contoh: Diberi bingkai data yang berisi …
12 r 

2
Uji statistik untuk nilai prediksi positif dan negatif
Saya membaca sebuah makalah dan saya melihat sebuah tabel dengan perbandingan antara PPV (Positive Predictive Value) dan NPV (Negative Predictive Value). Mereka melakukan semacam uji statistik untuk mereka, ini adalah sketsa tabel: PPV NPV p-value 65.9 100 < 0.00001 ... Setiap baris mengacu pada tabel kontingensi tertentu. Tes hipotesis macam …

3
Memahami regresi SVM: fungsi objektif dan "kerataan"
SVM untuk klasifikasi masuk akal bagi saya: Saya mengerti bagaimana meminimalkan menghasilkan margin maksimum. Namun, saya tidak mengerti tujuan itu dalam konteks regresi. Berbagai teks (di sini dan di sini ) menggambarkan ini sebagai memaksimalkan "kerataan." Mengapa kita ingin melakukan itu? Apa dalam regresi yang setara dengan konsep "margin"?| | …
12 regression  svm 

2
Klasifikasi Akinator.com dan Naive Bayes
Konteks: Saya seorang programmer dengan beberapa (setengah terlupakan) pengalaman dalam statistik dari kursus uni. Baru-baru ini saya menemukan http://akinator.com dan menghabiskan beberapa waktu mencoba membuatnya gagal. Dan siapa yang tidak? :) Saya telah memutuskan untuk mencari tahu cara kerjanya. Setelah googling dan membaca posting blog terkait dan menambahkan beberapa (terbatas) …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.