Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Residu Pearson
Pertanyaan seorang pemula tentang residu Pearson dalam konteks uji chi-square untuk kebaikan: Serta statistik uji, R's chisq.test fungsi melaporkan residu Pearson: (obs - exp) / sqrt(exp) Saya mengerti mengapa melihat perbedaan mentah antara nilai yang diamati dan yang diharapkan tidak informatif, karena sampel yang lebih kecil akan menghasilkan perbedaan yang …

1
Pertanyaan tentang cara menormalkan koefisien regresi
Tidak yakin apakah normalisasi adalah kata yang tepat untuk digunakan di sini, tetapi saya akan mencoba yang terbaik untuk menggambarkan apa yang ingin saya tanyakan. Estimator yang digunakan di sini adalah kuadrat terkecil. Misalkan Anda memiliki y=β0+β1x1y=β0+β1x1y=\beta_0+\beta_1x_1 , Anda dapat memusatkannya di sekitar rata-rata dengan y=β′0+β1x′1y=β0′+β1x1′y=\beta_0'+\beta_1x_1' mana β′0=β0+β1x¯1β0′=β0+β1x¯1\beta_0'=\beta_0+\beta_1\bar x_1 dan …

1
Batas atas untuk kepadatan kopula?
The Fréchet-Hoeffding atas terikat berlaku untuk fungsi distribusi kerja penghubung dan diberikan oleh C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Apakah ada kesamaan (dalam arti bahwa itu tergantung pada kepadatan marginal) batas atas untuk kepadatan kopula daripada CDF?c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) Referensi apa pun akan sangat dihargai.

1
Kriteria untuk mengatur lebar STL s.window
Menggunakan Runtuk melakukan dekomposisi STL, s.windowmengontrol seberapa cepat komponen musiman dapat berubah. Nilai kecil memungkinkan perubahan lebih cepat. Menetapkan jendela musiman menjadi tak terbatas sama dengan memaksa komponen musiman menjadi periodik (yaitu, identik sepanjang tahun). Pertanyaan saya: Jika saya memiliki deret waktu bulanan (yaitu frekuensi sama dengan ), kriteria apa …

1
Distribusi dengan
Apakah ada informasi di luar sana tentang distribusi yang nnn cumulant th diberikan oleh 1n1n\frac 1 n ? Fungsi penghasil kumulant adalah dalam bentuk κ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx. Saya telah menjalankannya sebagai distribusi terbatas dari beberapa variabel acak tetapi saya belum …

1
Teknik bootstrap yang tepat untuk data cluster?
Saya punya pertanyaan tentang teknik bootstrap yang tepat untuk digunakan dengan data di mana pengelompokan yang kuat hadir. Saya telah ditugaskan untuk mengevaluasi model prediksi efek campuran multivariat pada data klaim asuransi dengan mencetak model baseline saat ini pada data klaim yang lebih baru, untuk menentukan seberapa baik model memprediksi …


2
Matriks informasi yang diamati adalah penduga yang konsisten dari matriks informasi yang diharapkan?
Saya mencoba untuk membuktikan bahwa matriks informasi yang diamati dievaluasi pada estimator kemungkinan maksimum yang konsisten (MLE) yang lemah, adalah estimator yang lemah konsisten dari matriks informasi yang diharapkan. Ini adalah hasil yang dikutip secara luas tetapi tidak ada yang memberikan referensi atau bukti (saya sudah kelelahan saya pikir 20 …

2
Distribusi sebelumnya apa yang bisa / harus digunakan untuk varians dalam model bayesisan hirarkis ketika varians rata-rata menarik?
Dalam makalahnya yang dikutip secara luas, distribusi Prior untuk parameter varians dalam model hierarkis (916 kutipan sejauh ini di Google Cendekia) Gelman mengusulkan bahwa distribusi sebelumnya yang tidak informatif untuk varian dalam model Bayesian hirarkis adalah distribusi seragam dan distribusi t setengah. Jika saya memahami hal-hal yang benar ini berfungsi …

2
Memilih parameter kompleksitas dalam CART
Dalam rutin bagian () untuk membuat model CART, Anda menentukan parameter kompleksitas yang ingin Anda pangkas pohon Anda. Saya telah melihat dua rekomendasi berbeda untuk memilih parameter kompleksitas: Pilih parameter kompleksitas yang terkait dengan kemungkinan kesalahan tervalidasi silang minimum. Metode ini direkomendasikan oleh Quick-R dan HSAUR. Pilih parameter kompleksitas terbesar …
16 r  cart  rpart 

3
Aturan penghentian opsional tidak ada dalam buku teks
Menghentikan aturan memengaruhi hubungan antara nilai-P dan tingkat kesalahan yang terkait dengan keputusan. Sebuah makalah terbaru oleh Simmons et al. 2011 menciptakan istilah derajat kebebasan peneliti untuk menggambarkan kumpulan perilaku yang mereka anggap bertanggung jawab atas banyak laporan dalam literatur psikologi yang telah ditemukan tidak dapat direproduksi. Dari perilaku-perilaku itu, …


2
Proses apa yang dapat menghasilkan data atau parameter Laplace-distributed (eksponensial ganda)?
Banyak distribusi memiliki "mitos asal", atau contoh proses fisik yang mereka gambarkan dengan baik: Anda bisa mendapatkan data yang terdistribusi normal dari sejumlah kesalahan yang tidak berkorelasi melalui Teorema Limit Pusat Anda bisa mendapatkan data yang didistribusikan secara biner dari flip koin independen, atau variabel yang didistribusikan Poisson dari batas …

4
Membingkai distribusi binomial negatif untuk sekuensing DNA
Distribusi binomial negatif telah menjadi model yang populer untuk menghitung data (khususnya jumlah sekuens yang diharapkan dibaca dalam wilayah genom tertentu dari percobaan yang diberikan) dalam bioinformatika. Penjelasannya bervariasi: Beberapa menjelaskannya sebagai sesuatu yang bekerja seperti distribusi Poisson tetapi memiliki parameter tambahan, memungkinkan lebih banyak kebebasan untuk memodelkan distribusi yang …

1
Bagaimana cara mensimulasikan dari Gaussian copula?
Misalkan saya memiliki dua distribusi marginal univariat, katakanlah dan G , yang dapat saya simulasikan. Sekarang, buat distribusi bersama mereka menggunakan Gaussian copula , dilambangkan C ( F , G ; Σ ) . Semua parameter diketahui.FFFGGGC(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) Apakah ada metode non-MCMC untuk mensimulasikan dari copula ini?

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.