Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Apa perbedaan antara interpretasi kurva GINI dan AUC?
kami dulu membuat kurva GINI menggunakan lift yang dibuat dengan bantuan persentase baik dan buruk untuk pemodelan scorecard. Tetapi apa yang telah saya pelajari bahwa kurva ROC dibuat menggunakan matriks Confusion dengan kekhususan (1- True Negative) sebagai sumbu x dan sensitivitas (true positif) sebagai sumbu Y. Jadi hasil GINI dan …
13 roc  gini 


4
Menafsirkan varians efek acak dalam glmer
Saya merevisi makalah tentang penyerbukan, di mana data didistribusikan secara biner (buah matang atau tidak). Jadi saya menggunakan glmersatu efek acak (tanaman individu) dan satu efek tetap (pengobatan). Peninjau ingin tahu apakah tanaman berpengaruh pada set buah - tetapi saya mengalami kesulitan menafsirkan glmerhasilnya. Saya sudah membaca di web dan …


4
Apakah ketimpangan segitiga terpenuhi untuk jarak berbasis korelasi ini?
Untuk pengelompokan hierarkis saya sering melihat dua "metrik" berikut (mereka tidak berbicara) untuk mengukur jarak antara dua variabel acak XXX dan YYY : \newcommand{\Cor}{\mathrm{Cor}} d1(X,Y)d2(X,Y)=1−|Cor(X,Y)|,=1−(Cor(X,Y))2d1(X,Y)=1−|Cor(X,Y)|,d2(X,Y)=1−(Cor(X,Y))2\begin{align} d_1(X,Y) &= 1-|\Cor(X,Y)|, \\ d_2(X,Y) &= 1-(\Cor(X,Y))^2 \end{align} Apakah juga satu memenuhi ketidaksetaraan segitiga? Jika demikian, bagaimana saya harus membuktikannya selain hanya melakukan perhitungan bruteforce? …


1
Kemungkinan Marginal dari Output Gibbs
Saya mereproduksi dari awal hasil di Bagian 4.2.1 dari Kemungkinan Marginal dari Output Gibbs Siddhartha Chib Jurnal Asosiasi Statistik Amerika, Vol. 90, No. 432. (Desember, 1995), hlm. 1313-1321. Ini adalah campuran dari model normals dengan nomor yang diketahui komponen. f ( x | w , μ , σ 2 ) …

3
Autokorelasi residual versus variabel dependen tertinggal
Ketika pemodelan seri waktu satu memiliki kemungkinan untuk (1) memodelkan struktur korelasional dari istilah kesalahan seperti misalnya proses AR (1) (2) termasuk variabel dependen tertinggal sebagai variabel penjelas (di sisi kanan) Saya mengerti bahwa mereka kadang-kadang alasan yang masuk akal (2). Namun, apa alasan metodologis untuk melakukan (1) atau (2) …

2
Menghitung
Saya telah membaca tentang menghitung nilai dalam model campuran dan setelah membaca FAQ R-sig, posting lain di forum ini (saya akan menghubungkan beberapa tetapi saya tidak memiliki reputasi yang cukup) dan beberapa referensi lain yang saya pahami menggunakan dalam konteks model campuran rumit.R 2R2R2R^2R2R2R^2 Namun, saya baru saja menemukan dua …



1
Mengintegrasikan CDF empiris
Saya memiliki distribusi empiris . Saya menghitungnya sebagai berikutG ( x )G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) Saya menyatakan , yaitu, adalah pdf sedangkan adalah cdf.h Gh ( x ) = dG / dxh(x)=dG/dxh(x) = dG/dxhhhGGG Saya sekarang ingin menyelesaikan persamaan untuk batas atas …
13 r  integral  ecdf 


1
Memahami uji Chi-squared dan distribusi Chi-squared
Saya mencoba memahami logika di balik uji chi-squared. Tes Chi-squared adalah . kemudian dibandingkan dengan distribusi Chi-kuadrat untuk mengetahui nilai p.untuk menolak atau tidak hipotesis nol. : pengamatan berasal dari distribusi yang kami gunakan untuk menciptakan nilai yang kami harapkan. Sebagai contoh, kita bisa menguji apakah probabilitas untuk mendapatkan diberikan …

2
Perkiraan kuartil online tanpa menyimpan pengamatan
Saya perlu menghitung kuartil (Q1, median dan Q3) secara real-time pada set besar data tanpa menyimpan pengamatan. Saya pertama kali mencoba algoritma P square (Jain / Chlamtac) tapi saya tidak puas dengan itu (penggunaan cpu terlalu banyak dan tidak yakin dengan presisi setidaknya pada dataset saya). Saya menggunakan sekarang algoritma …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.