Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
kerugian dan kerugian engsel vs kerugian logistik
Kehilangan engsel dapat didefinisikan menggunakan dan kehilangan log dapat didefinisikan sebagaimaks ( 0 , 1 - ysayawTxsaya)maks(0,1-ysayawTxsaya)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)log ( 1 + exp( - ysayawTxsaya) )catatan(1+exp⁡(-ysayawTxsaya))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) Saya punya pertanyaan berikut: Adakah kerugian kerugian engsel (mis. Peka terhadap outlier seperti yang disebutkan dalam http://www.unc.edu/~yfliu/papers/rsvm.pdf )? Apa perbedaan, kelebihan, kekurangan satu …

4
Interval kepercayaan ketika ukuran sampel sangat besar
Pertanyaan saya dapat diulangi sebagai "bagaimana menilai kesalahan pengambilan sampel menggunakan data besar", terutama untuk publikasi jurnal. Berikut adalah contoh untuk menggambarkan tantangan. Dari kumpulan data yang sangat besar (> 100000 pasien unik dan obat yang diresepkan dari 100 rumah sakit), saya tertarik untuk memperkirakan proporsi pasien yang menggunakan obat …

1
Mengapa model efek campuran mengatasi ketergantungan?
Katakanlah kami tertarik pada bagaimana nilai ujian siswa dipengaruhi oleh jumlah jam belajar siswa tersebut. Untuk mengeksplorasi hubungan ini, kita dapat menjalankan regresi linier berikut: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Tetapi jika kita mengambil sampel murid dari beberapa sekolah yang berbeda, kita mungkin berharap murid …

3
Splines vs Regresi Proses Gaussian
Saya tahu bahwa Gaussian Process Regression (GPR) adalah alternatif untuk menggunakan splines untuk pemasangan model nonlinier yang fleksibel. Saya ingin tahu di mana situasi yang lebih cocok dari yang lain, terutama dalam kerangka regresi Bayesian. Saya sudah melihat Apa keuntungan / kerugian dari menggunakan splines, spline yang dihaluskan, dan emulator …

1
Mengapa menambahkan efek lag meningkatkan penyimpangan rata-rata dalam model hirarki Bayesian?
Latar belakang: Saat ini saya sedang melakukan beberapa pekerjaan membandingkan berbagai model hirarki Bayesian. Data adalah ukuran numerik dari kesejahteraan untuk peserta dan waktu . Saya memiliki sekitar 1.000 peserta dan 5 hingga 10 pengamatan per peserta.ysaya jysayajy_{ij}sayasayaijjj Seperti kebanyakan dataset longitudinal, saya berharap untuk melihat beberapa bentuk auto-korelasi dimana …

2
Hasil yang berbeda dari randomForest via caret dan paket randomForest dasar
Saya agak bingung: Bagaimana hasil dari Model yang terlatih melalui caret berbeda dari model dalam paket aslinya? Saya membaca apakah preprocessing diperlukan sebelum prediksi menggunakan FinalModel dari RandomForest dengan paket caret? tapi saya tidak menggunakan preprocessing di sini. Saya melatih berbagai Random Forests dengan menggunakan paket caret dan tuning untuk …

1
Perbedaan antara regresi logistik dan mesin vektor dukungan?
Saya tahu bahwa regresi logistik menemukan hyperplane yang memisahkan sampel pelatihan. Saya juga tahu bahwa mesin Dukungan vektor menemukan hyperplane dengan margin maksimum. Pertanyaan saya: apakah perbedaan kemudian antara regresi logistik (LR) dan mesin vektor dukungan (SVM) adalah bahwa LR menemukan hyperplane yang memisahkan sampel pelatihan sementara SVM menemukan hyperplane …

2
GLM: memverifikasi pilihan fungsi distribusi dan tautan
Saya memiliki model linier umum yang mengadopsi fungsi distribusi dan log link Gaussian. Setelah memasang model, saya memeriksa residu: QQ plot, residual vs nilai prediksi, histogram residu (mengakui bahwa kehati-hatian diperlukan). Semuanya terlihat bagus. Ini sepertinya menyarankan (kepada saya) bahwa pilihan distribusi Gaussian cukup masuk akal. Atau, setidaknya, bahwa residu …

1
Kapan kita akan menggunakan tantile dan medial, daripada quantile dan median?
Saya tidak dapat menemukan definisi untuk tantile atau medial di Wikipedia atau Wolfram Mathworld, tetapi penjelasan berikut diberikan dalam Bílková, D. dan Mala, I. (2012), " Penerapan metode L-moment ketika memodelkan distribusi pendapatan di Republik Ceko ", Jurnal Statistik Austria , 41 (2), 125–132. Medial adalah nilai (sampel) tantil sama …

1
Mean Sama, Varians Berbeda
Misalkan Anda memiliki delapan pelari berlomba; distribusi waktu masing-masing berjalan adalah Normal dan masing-masing memiliki rata-rata detik, katakanlah. Standar deviasi pelari satu adalah yang terkecil, dua yang terkecil terkecil, ketiga terkecil, dll, dan delapan terbesar. Dua pertanyaan membingungkan saya: (1) Berapa probabilitas yang pertama mengalahkan yang terakhir, dan (2) siapa …

1
Apakah ada perbedaan antara pelatihan autoencoder bertumpuk dan jaringan saraf 2-lapisan?
Katakanlah saya sedang menulis sebuah algoritma untuk membangun 2-layer autoencoder dan 2-layer neural network. Apakah keduanya sama atau berbeda? Apa yang saya pahami adalah bahwa ketika saya membuat autoencoder bertumpuk, saya akan membangun lapis demi lapis. Untuk jaringan saraf, saya akan menginisialisasi semua parameter di netowork, dan kemudian untuk setiap …

1
Dari exp (koefisien) ke Odds Ratio dan interpretasinya dalam Regresi Logistik dengan faktor
Saya menjalankan regresi linear penerimaan ke perguruan tinggi terhadap nilai SAT dan latar belakang keluarga / etnis. Datanya fiksi. Ini adalah tindak lanjut dari pertanyaan sebelumnya, sudah dijawab. Pertanyaannya berfokus pada pengumpulan dan interpretasi rasio odds ketika meninggalkan skor SAT untuk kesederhanaan. Variabelnya adalah Accepted(0 atau 1) dan Background("merah" atau …
14 r  regression  logistic 

2
Dirichlet Proses untuk pengelompokan: bagaimana cara menangani label?
T: Apa cara standar untuk mengelompokkan data menggunakan Proses Dirichlet? Saat menggunakan cluster sampel Gibbs, muncul dan menghilang selama pengambilan sampel. Selain itu, kami memiliki masalah pengidentifikasian karena distribusi posterior tidak berbeda dengan relabeling cluster. Dengan demikian, kita tidak bisa mengatakan mana yang merupakan kluster dari seorang pengguna melainkan bahwa …


2
Pertanyaan tentang Q-Learning menggunakan Neural Networks
Saya telah menerapkan Q-Learning seperti yang dijelaskan dalam, http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf Untuk sekitar. T (S, A) Saya menggunakan struktur jaringan saraf seperti berikut, Aktivasi sigmoid Input, jumlah input + 1 untuk neuron Aksi (Semua Input Ditskala 0-1) Keluaran, keluaran tunggal. Nilai-Q N jumlah M Lapisan Tersembunyi. Metode eksplorasi acak 0 <rand () …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.