Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Jumlah optimal tempat sampah dalam histogram oleh aturan Freedman-Diaconis: perbedaan antara tingkat teoritis dan jumlah aktual
Wikipedia melaporkan bahwa di bawah aturan Freedman dan Diaconis, jumlah optimal tempat sampah dalam histogram, harus tumbuh sebagaikkk k ∼n1 / 3k∼n1/3k\sim n^{1/3} di mana adalah ukuran sampel.nnn Namun, Jika Anda melihat nclass.FDfungsi dalam R, yang mengimplementasikan aturan ini, setidaknya dengan data Gaussian dan ketika , jumlah tampaknya tumbuh pada …

2
Apa topik statistik frequentist yang harus saya ketahui sebelum mempelajari statistik Bayesian?
Saya bertanya-tanya apakah ada bagian dari topik statistik frequentist yang harus diketahui sebelum mulai mempelajari statistik Bayesian. Suatu kali saya membaca bahwa kedua tren itu saling bertentangan; seperti misalnya analisis frequentist sangat didasarkan pada asumsi (hipotesis) yang dibuat lebih dari data yang diamati; sementara statistik Bayesian lebih mengandalkan pembangunan model …

1
Berapa minimum atas semua distribusi unimodal kontinu pada interval terbatas ?
Semua distribusi pada interval terbatas memenuhi:[0,1][0,1][0,1] σ2≤μ(1−μ)σ2≤μ(1−μ)\sigma^2 \le \mu (1-\mu) di mana adalah mean dan varians.μμ\muσ2σ2\sigma^2 Sekarang anggaplah bahwa distribusi adalah unimodal, dalam arti bahwa ia memiliki paling banyak satu lokal maksimum. Berapa nilai minimum yang dapat dimiliki rasio berikut: μ(1−μ)σ2?μ(1−μ)σ2?\frac{\mu (1-\mu)}{\sigma^2}?
8 variance 

3
Penghentian awal vs validasi silang
Saat ini saya menggunakan penghentian awal dalam pekerjaan saya untuk mencegah pemasangan yang berlebihan. Khususnya yang diambil dari Early Stopping But When? . Saya sekarang ingin membandingkan dengan algoritma klasifikasi lain di mana tampak bahwa 10 kali validasi silang digunakan secara luas. Namun saya bingung tentang apakah validasi silang adalah …

1
Keuntungan GLM di simpul terminal pohon regresi?
Jadi saya bermain-main dengan ide menulis algoritma yang menumbuhkan dan memangkas pohon regresi dari data dan kemudian, di terminal node pohon, cocok dengan GLM. Saya sudah mencoba untuk membaca ide tetapi saya tidak bisa menemukan nama yang konsisten untuk teknik ini. Saya sudah membacanya sebagai pohon regresi hibrida (HRT), pohon …

2
Apakah interval prediksi harus mengandung mean?
Saya mengalami masalah besar dengan masalah konseptual yang saya temukan. Katakanlah sebuah perusahaan memiliki distribusi yang sangat miring. Sesuatu yang mirip dengan eksponensial atau lognormal hanya lebih ekstrem. Sekarang berpura-pura distribusi sangat miring sehingga rata-rata distribusi lebih tinggi dari 99% Persentil dari distribusi. (Aka 1-2 nilai ekstrem yang lebih tinggi …

1
Cara menghitung dfbetas secara manual
Saya mencoba untuk meniru apa fungsi dfbetas()tidak dalam R . dfbeta() bukan masalah ... Ini adalah sekumpulan vektor: x <- c(0.512, 0.166, -0.142, -0.614, 12.72) y <- c(0.545, -0.02, -0.137, -0.751, 1.344) Jika saya cocok dengan dua model regresi sebagai berikut: fit1 <- lm(y ~ x) fit2 <- lm(y[-5] ~ …

4
Jika
Salah satu asumsi untuk analisis regresi adalah XXX dan YYYtidak terjalin. Namun ketika saya memikirkannya, menurut saya masuk akal. Berikut ini sebuah contoh. Jika kami memiliki tes dengan 3 bagian (AB dan C). Skor tes keseluruhan sama dengan jumlah skor individu untuk 3 bagian. Sekarang masuk akal untuk mengatakan ituXXX …

1
Pilihan antara regresi kuat yang berbeda di R
Saya menulis sebuah program untuk mengevaluasi real estat dan saya tidak begitu mengerti perbedaan antara beberapa model regresi yang kuat, itu sebabnya saya tidak tahu mana yang harus dipilih. Saya mencoba lmrob, ltsRegdan rlm. untuk kumpulan data yang sama, ketiga metode memberi saya nilai yang berbeda untuk koefisien. Saya pikir …



1
Batas Atas aktif
XXX adalah variabel acak diskrit yang dapat mengambil nilai dari . Karena adalah fungsi cembung, kita dapat menggunakan ketidaksetaraan Jensen untuk menurunkan batas bawah : Apakah mungkin untuk mendapatkan batas atas ?( 0 , 1 )(0,1)(0,1)φ ( x ) = 1 / xφ(x)=1/x\varphi(x)=1/xE[11 - X] ≥11 - E[ X]=11 - …


2
Uji Ulang dan Pengujian Banyak Efek Acak
Saya ingin tahu tentang bagaimana paket lmerTest di R, khususnya fungsi "rand", menangani tes efek acak. Pertimbangkan contoh dari pdf lmerTest tentang CRAN yang menggunakan kumpulan data "wortel" bawaan : #import lme4 package and lmerTest package library(lmerTest) #lmer model with correlation between intercept and slopes #in the random part m …

2
Mengapa ada E dalam algoritma nama EM?
Saya mengerti di mana langkah E terjadi dalam algoritma (seperti yang dijelaskan dalam bagian matematika di bawah). Dalam pikiran saya, kecerdikan kunci dari algoritma adalah penggunaan ketidaksetaraan Jensen untuk membuat batas bawah pada kemungkinan log. Dalam hal itu, mengambil Expectationhanya dilakukan untuk merumuskan kembali kemungkinan log agar sesuai dengan ketidaksetaraan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.