Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana cara menumpuk dua grafik secara vertikal dengan skala x yang sama, tetapi skala y berbeda dalam R?
Salam pembuka, Saat ini saya sedang melakukan hal berikut di R: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Cuplikan dari summary.csv: …

4
Cara menemukan interval kepercayaan untuk jumlah total peristiwa
Saya memiliki detektor yang akan mendeteksi suatu peristiwa dengan beberapa probabilitas p . Jika detektor mengatakan bahwa suatu peristiwa terjadi, maka itu selalu terjadi, jadi tidak ada positif palsu. Setelah saya menjalankannya untuk beberapa waktu, saya mendapatkan k terdeteksi peristiwa. Saya ingin menghitung berapa jumlah kejadian yang terjadi, terdeteksi atau …

2
Visualisasi banyak "histogram" (diagram batang)
Saya mengalami kesulitan untuk memilih cara yang tepat untuk memvisualisasikan data. Katakanlah kita memiliki toko buku yang menjual buku , dan setiap buku memiliki setidaknya satu kategori . Untuk toko buku, jika kami menghitung semua kategori buku, kami memperoleh histogram yang menunjukkan jumlah buku yang termasuk dalam kategori tertentu untuk …





7
Distribusi normal dan transformasi monotonik
Saya pernah mendengar bahwa banyak jumlah yang terjadi di alam terdistribusi secara normal. Ini biasanya dibenarkan menggunakan teorema batas pusat, yang mengatakan bahwa ketika Anda rata-rata sejumlah besar variabel acak iid, Anda mendapatkan distribusi normal. Jadi, misalnya, suatu sifat yang ditentukan oleh efek aditif dari sejumlah besar gen mungkin kira-kira …

2
Apakah implementasi validasi silang memengaruhi hasilnya?
Seperti yang Anda ketahui, ada dua jenis populer validasi silang, K-fold dan subsampling acak (seperti yang dijelaskan dalam Wikipedia ). Namun demikian, saya tahu bahwa beberapa peneliti membuat dan menerbitkan makalah di mana sesuatu yang digambarkan sebagai CV K-fold memang merupakan subsampling acak, jadi dalam praktiknya Anda tidak pernah tahu …




3
Apa yang salah dengan bukti saya tentang Hukum Varians Total?
Menurut Hukum Varians Total, Var(X)=E(Var(X∣Y))+Var(E(X∣Y))Var⁡(X)=E⁡(Var⁡(X∣Y))+Var⁡(E⁡(X∣Y))\operatorname{Var}(X)=\operatorname{E}(\operatorname{Var}(X\mid Y)) + \operatorname{Var}(\operatorname{E}(X\mid Y)) Ketika mencoba membuktikannya, saya menulis Var(X)=E(X−EX)2=E{E[(X−EX)2∣Y]}=E(Var(X∣Y))Var⁡(X)=E⁡(X−E⁡X)2=E⁡{E⁡[(X−E⁡X)2∣Y]}=E⁡(Var⁡(X∣Y)) \begin{equation} \begin{aligned} \operatorname{Var}(X) &= \operatorname{E}(X - \operatorname{E}X)^2 \\ &= \operatorname{E}\left\{\operatorname{E}\left[(X - \operatorname{E}X)^2\mid Y\right]\right\} \\ &= \operatorname{E}(\operatorname{Var}(X\mid Y)) \end{aligned} \end{equation} Apakah ada yang salah?


2
Apakah nilai fungsi kerapatan probabilitas untuk input yang diberikan adalah titik, rentang, atau keduanya?
Posting ini mengatakan PDF digunakan untuk menentukan probabilitas dari variabel acak yang berada dalam rentang nilai tertentu, sebagai lawan dari mengambil satu nilai. Apakah itu benar ini adalah PDF dari distribusi normal standar. φ(x)=12π−−√e−x2/2φ(x)=12πe−x2/2\varphi(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} tancapkan x = 0 ke rumus di atas, saya bisa mendapatkan probabilitas mengambil …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.