Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Memperkirakan parameter distribusi normal: median, bukan rata-rata?
Pendekatan umum untuk memperkirakan parameter distribusi normal adalah dengan menggunakan mean dan sampel standar deviasi / varians. Namun, jika ada beberapa outlier, median dan deviasi median dari median harus jauh lebih kuat, bukan? Pada beberapa set data saya mencoba, distribusi normal diperkirakan oleh tampaknya menghasilkan lebih cocok banyak daripada klasik …

2
Memperkirakan distribusi posterior kovarian gaussian multivariat
Saya perlu "mempelajari" distribusi gaussian bivariat dengan beberapa sampel, tetapi hipotesis yang baik pada distribusi sebelumnya, jadi saya ingin menggunakan pendekatan bayesian. Saya mendefinisikan sebelumnya: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ 0 …

1
Bagaimana cara memperkirakan proses Poisson menggunakan R? (Atau: bagaimana cara menggunakan paket NHPoisson?)
Saya memiliki database peristiwa (yaitu variabel tanggal) dan kovariat terkait. Peristiwa ini dihasilkan oleh proses Poisson non-stasioner dengan parameter menjadi fungsi yang tidak diketahui (tetapi mungkin linier) dari beberapa kovariat. Saya pikir paket NHPoisson ada hanya untuk tujuan ini; tetapi setelah 15 jam penelitian yang gagal, saya masih belum tahu …


2
Menentukan struktur kovarians: pro dan kontra
Apa manfaat menentukan struktur kovarians dalam GLM (daripada memperlakukan semua entri diagonal dalam matriks kovarians sebagai nol)? Selain mencerminkan apa yang diketahui seseorang dari data, lakukan itu meningkatkan kebaikan fit? meningkatkan akurasi prediksi pada data yang disimpan? izinkan kami untuk memperkirakan tingkat kovarian? Berapa biaya menerapkan struktur kovarian? Melakukannya menambahkan …

1
Arti istilah output dalam paket gbm?
Saya menggunakan paket gbm untuk klasifikasi. Seperti yang diharapkan, hasilnya bagus. Tetapi saya mencoba memahami output dari classifier. Ada lima istilah dalam output. `Iter TrainDeviance ValidDeviance StepSize Improve` Adakah yang bisa menjelaskan arti setiap istilah, terutama arti Meningkatkan .

1
Mengapa kita menstabilkan varians?
Saya menemukan transformasi penstabil varian ketika membaca metode Kaggle Essay Eval . Mereka menggunakan transformasi stabilisasi varian untuk mengubah nilai-nilai kappa sebelum mengambil rata-rata mereka dan kemudian mengubahnya kembali. Bahkan setelah membaca wiki pada transformasi penstabilan varian saya tidak bisa mengerti, mengapa kita sebenarnya menstabilkan varian? Apa manfaatnya dengan ini?


1
Memvisualisasikan hasil model campuran
Salah satu masalah yang selalu saya alami dengan model campuran adalah mencari tahu visualisasi data - dari jenis yang bisa berakhir di kertas atau poster - setelah seseorang mendapatkan hasilnya. Saat ini, saya sedang mengerjakan model efek campuran Poisson dengan formula yang terlihat seperti berikut: a <- glmer(counts ~ X …

7
Hutan acak terlalu cocok
Saya mencoba menggunakan Regresi Hutan Acak di scikits-learn. Masalahnya adalah saya mendapatkan kesalahan tes yang sangat tinggi: train MSE, 4.64, test MSE: 252.25. Beginilah tampilan data saya: (biru: data nyata, hijau: diperkirakan): Saya menggunakan 90% untuk pelatihan dan 10% untuk ujian. Ini adalah kode yang saya gunakan setelah mencoba beberapa …

3
Beberapa pertanyaan tentang keacakan statistik
Dari randoness statistik Wikipedia : Keacakan global dan keacakan lokal berbeda. Kebanyakan konsepsi filosofis tentang keacakan bersifat global — karena mereka didasarkan pada gagasan bahwa "dalam jangka panjang" suatu urutan tampak benar-benar acak, bahkan jika sub-urutan tertentu tidak akan terlihat acak. Dalam urutan acak "benar-benar" dari angka-angka yang cukup panjang, …

1
Regresi kesalahan-dalam-variabel: apakah valid untuk menyatukan data dari tiga situs?
Saya baru-baru ini meminta klien datang kepada saya untuk melakukan analisis bootstrap karena pengulas FDA mengatakan bahwa kesalahan mereka dalam regresi variabel tidak valid karena ketika mengumpulkan data dari situs analisis mencakup pengumpulan data dari tiga situs di mana dua situs termasuk beberapa sampel yang sama. LATAR BELAKANG Klien memiliki …


11
Contoh proses yang bukan Poisson?
Saya mencari beberapa contoh bagus situasi yang tidak cocok untuk model dengan distribusi Poisson, untuk membantu saya menjelaskan distribusi Poisson kepada siswa. Orang biasanya menggunakan jumlah pelanggan yang tiba di toko dalam interval waktu sebagai contoh yang dapat dimodelkan oleh distribusi Poisson. Saya mencari contoh tandingan dalam nada yang sama, …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.