Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Mengapa matriks Fisher Information semidefinite positif?
Biarkan . Matriks Informasi Fisher didefinisikan sebagai:θ ∈ Rnθ∈Rn\theta \in R^{n} saya( θ )saya , j= - E[ ∂2catatan( f( X| θ))∂θsaya∂θj∣∣∣θ ]I(θ)i,j=−E[∂2log⁡(f(X|θ))∂θi∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Bagaimana saya bisa membuktikan Matriks Informasi Fisher adalah semidefinit positif?

1
Teorema batas pusat dan hukum dalam jumlah besar
Saya punya pertanyaan yang sangat pemula tentang Central Limit Theorem (CLT): Saya sadar bahwa CLT menyatakan bahwa rata-rata variabel acak iid adalah sekitar normal terdistribusi (untuk , di mana adalah indeks dari penjumlahan) atau variabel acak standar akan memiliki distribusi normal standar.nn → ∞n→∞n \to \inftynnn Sekarang Hukum Angka Besar …

2
Ketidaksepakatan besar dalam estimasi kemiringan ketika kelompok diperlakukan sebagai acak vs tetap dalam model campuran
Saya mengerti bahwa kami menggunakan model efek acak (atau efek campuran) ketika kami percaya bahwa beberapa parameter model bervariasi secara acak di beberapa faktor pengelompokan. Saya memiliki keinginan untuk menyesuaikan model di mana respons telah dinormalisasi dan terpusat (tidak sempurna, tapi cukup dekat) di seluruh faktor pengelompokan, tetapi variabel independen …

4
Bagaimana seseorang bisa mengembangkan aturan penghentian dalam analisis kekuatan dua proporsi independen?
Saya seorang pengembang perangkat lunak yang bekerja pada sistem pengujian A / B. Saya tidak memiliki latar belakang statistik yang solid tetapi telah mengambil pengetahuan selama beberapa bulan terakhir. Skenario pengujian tipikal melibatkan membandingkan dua URL di situs web. Pengunjung mengunjungi LANDING_URLdan kemudian secara acak diteruskan ke salah satu URL_CONTROLatau …

1
Apa perbedaan hutan acak ekstrem dengan hutan acak?
Apakah implementasi ER lebih efisien (mirip Extreme Gradient Boostingdengan peningkatan gradien) - apakah perbedaannya penting dari sudut pandang praktis? Ada paket R yang mengimplementasikannya. Apakah ini algoritma baru yang mengatasi implementasi "generik" (paket RandomForest dari R) tidak hanya dalam hal efisiensi atau juga di beberapa area lain? Extreme Random Forest …

3
Matriks varians-kovarians dalam lmer
Saya tahu bahwa salah satu keuntungan dari model campuran adalah bahwa mereka memungkinkan untuk menentukan matriks varians-kovarians untuk data (simetri gabungan, autoregresif, tidak terstruktur, dll.) Namun, lmerfungsi dalam R tidak memungkinkan spesifikasi mudah dari matriks ini. Adakah yang tahu struktur apa yang lmerdigunakan secara default dan mengapa tidak ada cara …


9
Jarak Mahalanobis berpasangan
Saya perlu menghitung jarak sampel Mahalanobis dalam R antara setiap pasangan pengamatan dalam matriks kovariat . Saya memerlukan solusi yang efisien, yaitu hanya jarak yang dihitung, dan lebih baik diimplementasikan dalam C / RCpp / Fortran dll. Saya berasumsi bahwa , matriks kovarian populasi, tidak diketahui dan menggunakan sampel matriks …
18 r  algorithms  distance 

1
Bagaimana cara menghadapi korelasi yang tinggi di antara para prediktor dalam regresi berganda?
Saya menemukan referensi di artikel yang berbunyi seperti: Menurut Tabachnick & Fidell (1996) variabel independen dengan korelasi bivariat lebih dari 0,70 tidak boleh dimasukkan dalam analisis regresi berganda. Masalah: Saya digunakan dalam desain regresi berganda 3 variabel berkorelasi> 0,80, VIF sekitar 0,2 - .3, Toleransi ~ 4- 5. Saya tidak …

3
Periode dalam sejarah statistik
Sejarah banyak bidang ilmu dapat dibagi menjadi sejumlah kecil interval waktu yang sering dimulai dengan beberapa penemuan penting. Tetapi saya belum pernah melihat yang serupa dalam garis waktu statistik. Jelas, ada beberapa tanggal penting yang dapat dianggap sebagai titik awal periode baru (Pascal + Fermat, Bayes, Pearson, Tukey, ..). Bisakah …
18 history 


1
, Simulasi selama periode Peramalan
Saya punya data deret waktu dan saya menggunakan sebagai model agar sesuai dengan data. The merupakan variabel random indikator yang baik 0 (ketika saya tidak melihat peristiwa langka) atau 1 (ketika saya melihat peristiwa langka). Berdasarkan pengamatan sebelumnya yang saya miliki untuk , saya dapat mengembangkan model untuk menggunakan metodologi …


6
Opsi analisis data di luar inti
Saya telah menggunakan SAS secara profesional selama hampir 5 tahun sekarang. Saya sudah menginstalnya di laptop saya dan sering harus menganalisis dataset dengan 1.000-2.000 variabel dan ratusan ribu pengamatan. Saya telah mencari alternatif untuk SAS yang memungkinkan saya untuk melakukan analisis pada set data berukuran serupa. Saya ingin tahu apa …
18 r  sas  large-data 

5
Apa ringkasan statistik untuk digunakan dengan variabel kategorikal atau kualitatif?
Hanya untuk memperjelas, ketika saya maksud statistik ringkasan, saya merujuk ke Mean, rentang Kuartil Median, Varians, Deviasi Standar. Ketika meringkas univariat yang kategorikal atau kualitatif , mempertimbangkan kasus Nominal dan Ordinal , apakah masuk akal untuk menemukan rata-rata, median, rentang kuartil, varian, dan standar deviasi? Jika ya, ini berbeda dengan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.