Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Haruskah mean digunakan ketika data miring?
Teks pengantar statistik terapan yang sering digunakan membedakan mean dari median (sering dalam konteks statistik deskriptif dan memotivasi peringkasan kecenderungan sentral menggunakan mean, median dan mode) dengan menjelaskan bahwa mean sensitif terhadap pencilan dalam data sampel dan / atau untuk distribusi populasi yang miring, dan ini digunakan sebagai pembenaran untuk …


3
Istilah intersep dalam regresi logistik
Misalkan kita memiliki model regresi logistik berikut: logit ( p ) = β0+ β1x1+ β2x2logit(p)=β0+β1x1+β2x2\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} Apakah peluang acara ketika dan ? Dengan kata lain, ini adalah peluang acara ketika dan berada di level terendah (bahkan jika ini bukan 0)? Misalnya, jika dan hanya mengambil nilai dan …


5
Menemukan titik belok dalam R dari data yang dihaluskan
Saya punya beberapa data yang saya gunakan mulus loess. Saya ingin mencari titik belok pada garis yang dihaluskan. Apakah ini mungkin? Saya yakin seseorang telah membuat metode mewah untuk menyelesaikan ini ... Maksud saya ... setelah semua, itu R! Saya baik-baik saja dengan mengubah fungsi penghalusan yang saya gunakan. Saya …
14 r  smoothing  loess 

3
Bagaimana saya bisa menafsirkan apa yang saya dapatkan dari PCA?
Sebagai bagian dari tugas Universitas, saya harus melakukan pra-pemrosesan data pada kumpulan data mentah multivariat (> 10) yang cukup besar. Saya bukan ahli statistik dalam arti kata, jadi saya agak bingung tentang apa yang terjadi. Permintaan maaf sebelumnya untuk apa yang mungkin merupakan pertanyaan sederhana yang menggelikan - kepalaku berputar …
14 pca 

4
Analisis ROC dan multiROC: bagaimana cara menghitung cutpoint optimal?
Saya mencoba memahami cara menghitung titik potong optimal untuk kurva ROC (nilai di mana sensitivitas dan spesifisitas dimaksimalkan). Saya menggunakan dataset aSAHdari paket pROC. The outcomevariabel dapat dijelaskan oleh dua variabel independen: s100bdan ndka. Menggunakan sintaks Epipaket, saya telah membuat dua model: library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) Output diilustrasikan …

2
Simulasi Regresi Linier Berganda
Saya baru mengenal bahasa R. Saya ingin tahu bagaimana mensimulasikan dari model regresi linier berganda yang memenuhi keempat asumsi regresi. oke terima kasih. Katakanlah saya ingin mensimulasikan data berdasarkan kumpulan data ini: y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) maka saya mendapatkan output: Call: lm(formula = y ~ x1 + x2) Residuals: …

3
Lakukan regresi linier, tetapi paksa solusi untuk melewati beberapa titik data tertentu
Saya tahu bagaimana melakukan regresi linier pada set poin. Yaitu, saya tahu bagaimana menyesuaikan polinomial pilihan saya, dengan kumpulan data yang diberikan, (dalam arti LSE). Namun, yang saya tidak tahu, adalah bagaimana memaksa solusi saya untuk melewati beberapa poin tertentu yang saya pilih. Saya telah melihat ini dilakukan sebelumnya, tetapi …


5
Clustering (k-means, atau sebaliknya) dengan batasan ukuran cluster minimum
Saya perlu mengelompokkan unit ke dalam cluster untuk meminimalkan sum-kuadrat dalam-grup (WSS), tetapi saya perlu memastikan bahwa masing-masing cluster mengandung setidaknya unit. Adakah yang tahu jika ada salah satu fungsi pengelompokan R yang memungkinkan pengelompokan ke dalam cluster tunduk pada batasan ukuran cluster minimum? kmeans () tampaknya tidak menawarkan opsi …
14 r  clustering 



3
Mengapa jaringan saraf memerlukan pemilihan fitur / rekayasa?
Khususnya dalam konteks kompetisi kaggle saya perhatikan bahwa kinerja model adalah semua tentang pemilihan fitur / teknik. Sementara saya dapat sepenuhnya memahami mengapa hal ini terjadi ketika berhadapan dengan algoritma ML yang lebih konvensional / jadul, saya tidak melihat mengapa ini akan menjadi kasus ketika menggunakan jaringan saraf yang dalam. …

2
Mengapa menggunakan tautan logit dalam regresi beta?
Baru-baru ini, saya tertarik untuk mengimplementasikan model regresi beta, untuk hasil yang proporsional. Perhatikan bahwa hasil ini tidak akan masuk ke dalam konteks binomial, karena tidak ada konsep yang bermakna dari "kesuksesan" diskrit dalam konteks ini. Bahkan, hasilnya sebenarnya adalah proporsi durasi; pembilang menjadi jumlah detik saat kondisi tertentu aktif …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.