Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Apa kontribusi Student (Gosset) dalam merumuskan uji-t?
Sebuah pertanyaan baru - baru ini , pertanyaan terkait , dan sumber yang dikutip , baru-baru ini membuat saya sadar bahwa koreksi untuk perkiraan sampel varians populasi disebut sebagai koreksi Bessel . Bessel meninggal pada tahun 1846 ( kutipan wikipedia ) dan uji-t diterbitkan pada tahun 1908 ( kutipan wikipedia …

2
Buku untuk statistik non parametrik
Apa yang akan menjadi buku yang bagus untuk statistik non-parametrik. Bukan hanya pengantar tetapi tingkat lanjutan. Saya juga melihat sesuatu yang bisa saya gunakan untuk belajar dan bukan untuk referensi. Secara khusus saya mencari buku yang dapat berisi dasar-dasar di balik metode non-parameterik, inferensi non-parameter, metode untuk mengevaluasi non parametrik, …


3
Regresi terhadap teka-teki yang berarti
Dalam bab "Regresi terhadap Mean" dari "Berpikir, Cepat, dan Lambat" oleh Daniel Kahneman, sebuah contoh diberikan dan pembaca diminta untuk meramalkan penjualan masing-masing toko mengingat keseluruhan perkiraan penjualan dan angka penjualan dari tahun sebelumnya . Misalnya (contoh buku ini memiliki 4 toko, saya menggunakan 2 di sini untuk kesederhanaan): Store …

2
Bagaimana saya bisa memvisualisasikan pentingnya input yang berbeda terhadap perkiraan untuk model non-linear black-box?
Saya sedang membangun alat ramalan interaktif (dengan python) sebagai bantuan untuk perkiraan yang dilakukan di organisasi saya. Sampai saat ini proses peramalan sebagian besar digerakkan oleh manusia, dengan peramal mengasimilasi data dalam jaringan saraf alami mereka dan menggunakan usus yang mereka pelajari merasa untuk membuat prediksi. Dari verifikasi perkiraan jangka …

2
Memahami kumis dari boxplot
Saya punya pertanyaan tentang interpretasi kumis dari boxplot. Saya telah membaca yang berikut ini: "Di bagian atas dan bawah dari persegi panjang," kumis "menunjukkan kisaran 1,5 kali jarak antara 0,25- dan 0,75-kuantil", tetapi tidak sepenuhnya memahami apa yang dimaksud dengan "jarak" . Tidak mungkin bahwa massa probabilitas dimaksudkan, karena antara …


2
Asumsi model linier umum
Pada halaman 232 dari "Teman R untuk menerapkan regresi" catatan Fox dan Weisberg Hanya keluarga Gaussian yang memiliki varian konstan, dan dalam semua GLM lainnya, varian bersyarat dari y pada tergantung pada μ ( x )xx\bf{x}μ ( x )μ(x)\mu(x) Sebelumnya, mereka mencatat bahwa varian bersyarat dari Poisson adalah dan bahwa …

1
Mensimulasikan data untuk regresi logistik dengan variabel kategori
Saya mencoba membuat beberapa data uji untuk regresi logistik dan saya menemukan posting ini. Bagaimana mensimulasikan data buatan untuk regresi logistik? Ini adalah jawaban yang bagus tetapi hanya menciptakan variabel kontinu. Bagaimana dengan variabel kategori x3 dengan 5 level (ABCDE) yang dikaitkan dengan y untuk contoh yang sama seperti pada …

3
Menghitung Jaccard atau koefisien asosiasi lainnya untuk data biner menggunakan perkalian matriks
Saya ingin tahu apakah ada cara yang mungkin untuk menghitung koefisien Jaccard menggunakan perkalian matriks. Saya menggunakan kode ini jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) …

2
Kernel SVM mana yang digunakan untuk masalah klasifikasi biner?
Saya seorang pemula ketika datang untuk mendukung mesin vektor. Apakah ada beberapa pedoman yang mengatakan kernel mana (mis. Linear, polinomial) paling cocok untuk masalah tertentu? Dalam kasus saya, saya harus mengklasifikasikan halaman web menurut apakah mereka mengandung beberapa informasi spesifik atau tidak, yaitu saya memiliki masalah klasifikasi biner. Dapatkah Anda …

5
Merupakan data eksperimental
Saya memiliki argumen dengan penasihat saya mengenai visualisasi data. Dia mengklaim bahwa ketika mewakili hasil eksperimen, nilai-nilai harus diplot dengan " penanda " saja, seperti yang disajikan dalam gambar di bawah. Sementara kurva hanya mewakili " model " Saya di sisi lain percaya bahwa kurva dalam banyak kasus tidak perlu …

3
Perbedaan konseptual antara heteroskedastisitas dan non-stasioneritas
Saya mengalami kesulitan untuk membedakan antara konsep skedastik dan stasioner. Seperti yang saya pahami, heteroskedastisitas adalah variabilitas yang berbeda dalam sub-populasi dan non-stasioneritas adalah perubahan mean / varians dari waktu ke waktu. Jika ini adalah pemahaman yang benar (walaupun simplistis), apakah ketidaktentuan hanya merupakan kasus heteroskedastisitas spesifik sepanjang waktu?

1
Kapan memasukkan efek acak dalam suatu model
Saya baru mengenal pemodelan campuran dan saya bingung apakah perlu menggunakan efek acak dalam analisis yang saya lakukan. Nasihat apa pun akan dihargai. penelitian saya menguji seberapa baik indeks kelimpahan mamalia yang baru dikembangkan dapat memprediksi nilai dari indeks padat karya yang lebih mapan. Saya telah mengukur indeks ini di …

1
Menemukan distribusi statistik
Belajar untuk ujian. Tidak dapat menjawab yang ini. Misalkan menjadi iid N ( 0 , 1 ) variabel acak. MenetapkanX1 , saya, X2 , saya, X3 , saya, i = 1 , … , nX1,i,X2,i,X3,i,i=1,…,nX_{1,i},X_{2,i},X_{3,i}, i=1,\ldots,nN( 0 , 1 )N(0,1)\mathcal{N}(0,1) ,Wsaya= ( X1 , saya+ X2 , sayaX3 , saya) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.