Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana memodelkan jumlah variabel acak Bernoulli untuk data dependen?
Saya memiliki pertanyaan yang hampir sama seperti ini: Bagaimana saya bisa memodelkan jumlah variabel acak Bernoulli secara efisien? Tetapi pengaturannya sangat berbeda: S=∑i=1,NXiS=∑i=1,NXiS=\sum_{i=1,N}{X_i} , , ~ 20, p_i ~ 0.1P(Xi=1)=piP(Xi=1)=piP(X_{i}=1)=p_iNNNpipip_i Kami memiliki data untuk hasil variabel acak Bernoulli: Xi,jXi,jX_{i,j} , Sj=∑i=1,NXi,jSj=∑i=1,NXi,jS_j=\sum_{i=1,N}{X_{i,j}} Jika kita memperkirakan pipip_i dengan estimasi kemungkinan maksimum (dan …

1
Regresi polinomial ortogonal multivariat?
Sebagai sarana memotivasi pertanyaan, pertimbangkan masalah regresi di mana kami berusaha memperkirakan menggunakan variabel yang diamatiYYY{a,b}{a,b}\{ a, b \} Ketika melakukan regresi polinomial multivariat, saya mencoba mencari paramitisasi fungsi yang optimal f(y)=c1a+c2b+c3a2+c4ab+c5b2+⋯f(y)=c1a+c2b+c3a2+c4ab+c5b2+⋯f(y)=c_{1}a+c_{2}b+c_{3}a^{2}+c_{4}ab+c_{5}b^{2}+\cdots yang paling cocok dengan data dalam arti kuadrat terkecil. Masalah dengan ini, bagaimanapun, adalah bahwa parameter tidak independen. …

3
Tingkat penerimaan untuk Metropolis-Hastings dengan distribusi kandidat yang seragam
Ketika menjalankan algoritma Metropolis-Hastings dengan distribusi kandidat yang seragam, apa alasan memiliki tingkat penerimaan sekitar 20%? Pemikiran saya adalah: setelah nilai parameter true (atau close to true) ditemukan, maka tidak ada set nilai parameter kandidat baru dari interval seragam yang sama yang akan meningkatkan nilai fungsi kemungkinan. Oleh karena itu, …

1
Apakah perhitungan nol perlu disesuaikan untuk uji rasio kemungkinan model poisson / loglinear?
Jika ada 0 pada tabel kontingensi dan kami menyesuaikan model poisson / loglinear bersarang (menggunakan glmfungsi R ) untuk uji rasio kemungkinan, apakah kita perlu menyesuaikan data sebelum memasang model glm (mis. Tambahkan 1/2 ke semua hitungan)? Jelas beberapa parameter tidak dapat diperkirakan tanpa penyesuaian, tetapi bagaimana penyesuaian / kurangnya …


2
Klasterisasi spasial berbasis aplikasi dengan noise (DBSCAN) clustering di R
pertanyaan ini dimulai dengan " Mengelompokkan data spasial dalam R " dan sekarang telah pindah ke pertanyaan DBSCAN. Sebagai tanggapan terhadap pertanyaan pertama yang disarankan saya mencari informasi tentang DBSCAN dan membaca beberapa dokumen tentang. Pertanyaan baru telah muncul. DBSCAN membutuhkan beberapa parameter, salah satunya adalah "jarak". Karena data saya …
9 r  clustering  spatial 

2
Model Tobit dengan R
Adakah yang tahu di mana menemukan aplikasi dan contoh yang baik (selain manual dan buku yang menerapkan ekonometrika dengan R) menggunakan model tobit dengan paket-paket AER? Edit Saya mencari perintah untuk menghitung efek marginal untuk y (bukan untuk variabel laten y *). Tampaknya ϕ(xβ/σ)βϕ(xβ/σ)β\phi(x\beta/\sigma)\beta , di mana ϕϕ\phi adalah fungsi …



6
Menguji stabilitas dalam rangkaian waktu
Apakah ada metode standar (atau terbaik) untuk pengujian ketika rangkaian waktu tertentu telah stabil? Beberapa motivasi Saya memiliki sistem dinamis stokastik yang menghasilkan nilai pada setiap langkah waktu . Sistem ini memiliki beberapa perilaku transien sampai waktu dan kemudian stabil di sekitar beberapa nilai rata-rata dengan beberapa kesalahan. Tak satu …

4
Apakah urutan variabel penting dalam regresi linier
Saya sedang menyelidiki interaksi antara dua variabel ( dan ). Ada banyak korelasi linier antara variabel-variabel ini denganx1x1x_1x2x2x_2r>0.9r>0.9r>0.9 . Dari sifat masalah saya tidak bisa mengatakan apa-apa tentang penyebabnya (apakah menyebabkan x 2 atau sebaliknya). Saya ingin mempelajari penyimpangan dari garis regresi, untuk mendeteksi outlier. Untuk melakukan ini, saya dapat …

3
Bagaimana cara mengubah nama kolom dalam bingkai data di R? [Tutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 6 tahun yang lalu . names(mydat)[c(name)]<-c("newname") Dari ini, saya tahu bahwa kolom / nama variabel "nama" dari bingkai data mydat diganti dengan "nama baru". Pertanyaan …
9 r 


1
Bagaimana cara menghitung Rasio Kesalahan Standar?
Saya memiliki dua set data dari studi asosiasi genome. Satu-satunya informasi yang tersedia adalah rasio odds dan nilai p untuk set data pertama. Untuk set data kedua saya memiliki Odds Ratio, nilai-p dan frekuensi alel (AFD = penyakit, AFC = kontrol) (mis: 0,321). Saya mencoba melakukan meta-analisis data ini tetapi …

2
Keuntungan mendekati masalah dengan merumuskan fungsi biaya yang dapat dioptimalkan secara global
Ini adalah pertanyaan yang agak umum (yaitu tidak harus spesifik untuk statistik), tetapi saya telah memperhatikan tren dalam pembelajaran mesin dan literatur statistik di mana penulis lebih suka mengikuti pendekatan berikut: Pendekatan 1 : Dapatkan solusi untuk masalah praktis dengan merumuskan fungsi biaya yang memungkinkan (misalnya dari sudut pandang komputasi) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.