Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

7
Apakah median lebih adil dari rata-rata?
Baru-baru ini saya membaca saran bahwa Anda harus menggunakan median bukan berarti untuk menghilangkan outlier. Contoh: Artikel berikut ini http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ memiliki 16 ulasan saat ini: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median …
17 mean  median  average 

8
Ukuran kualitas pengelompokan
Saya memiliki algoritma clustering (bukan k-means) dengan input parameter (jumlah cluster). Setelah melakukan pengelompokan, saya ingin mendapatkan ukuran kuantitatif kualitas pengelompokan ini. Algoritma pengelompokan memiliki satu properti penting. Untuk k = 2 jika saya memberi makan titik data N tanpa perbedaan yang signifikan di antara mereka dengan algoritma ini sebagai …
17 clustering 

4
Menghitung ukuran sampel yang dibutuhkan, ketepatan estimasi varians?
Latar Belakang Saya memiliki variabel dengan distribusi yang tidak diketahui. Saya memiliki 500 sampel, tetapi saya ingin menunjukkan ketepatan yang dapat saya gunakan untuk menghitung varians, misalnya untuk menyatakan bahwa ukuran sampel 500 sudah cukup. Saya juga tertarik untuk mengetahui ukuran sampel minimum yang akan diperlukan untuk memperkirakan varians dengan …


2
Mengapa menggunakan penskalaan Platt?
Untuk mengkalibrasi tingkat kepercayaan ke probabilitas dalam pembelajaran yang diawasi (katakanlah untuk memetakan kepercayaan dari SVM atau pohon keputusan menggunakan data yang terlalu banyak) salah satu metode adalah dengan menggunakan Penskalaan Platt (misalnya, Memperoleh Kemungkinan yang Dikalibrasi dari Peningkatan ). Pada dasarnya orang menggunakan regresi logistik untuk memetakan ke . …

2
Analisis Bayesian nonparametrik dalam R
Saya mencari tutorial yang baik tentang pengelompokan data dalam Rmenggunakan proses hierarchical dirichlet (HDP) (salah satu metode Bayesian nonparametrik populer dan terbaru). Ada DPpackage(IMHO, yang paling komprehensif dari semua yang tersedia) Runtuk analisis Bayesian nonparametrik. Tetapi saya tidak dapat memahami contoh-contoh yang diberikan dalam R Newsatau dalam manual referensi paket …

6
R: hitung korelasi berdasarkan kelompok
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Dalam R, saya memiliki kerangka data yang terdiri dari label kelas C (faktor) dan dua pengukuran, M1 dan M2 . Bagaimana cara menghitung korelasi antara M1 …
17 r  correlation 

9
Apa perbedaan antara statistik dan biostatistik?
Terpikir oleh saya bahwa, walaupun saya telah mengumpulkan beberapa ide selama bertahun-tahun tentang perbedaan antara statistik dan biostatistik, saya belum pernah mendengar penjelasan formal. Apa perbedaan antara kedua disiplin ini (saat ini)? Dan mengapa perbedaan ini dimulai sejak awal? EDIT: Saya belum cukup spesifik dalam pertanyaan awal saya. Saya mengerti …



2
Jika lebar kernel variabel sering baik untuk regresi kernel, mengapa mereka umumnya tidak baik untuk estimasi kepadatan kernel?
Pertanyaan ini didorong oleh diskusi di tempat lain . Kernel variabel sering digunakan dalam regresi lokal. Sebagai contoh, loess banyak digunakan dan berfungsi dengan baik sebagai regresi yang lebih lancar, dan didasarkan pada kernel dengan lebar variabel yang beradaptasi dengan data sparsity. Di sisi lain, kernel variabel biasanya dianggap menyebabkan …

4
Menggabungkan dua perkiraan interval / titik kepercayaan
Misalkan seseorang memiliki dua sampel independen dari populasi yang sama, dan metode yang berbeda digunakan pada dua sampel untuk memperoleh estimasi titik dan interval kepercayaan. Dalam kasus-kasus sepele orang yang masuk akal hanya akan mengumpulkan dua sampel dan menggunakan satu metode untuk melakukan analisis, tetapi anggaplah untuk saat ini bahwa …


4
T-test yang kuat untuk mean
Saya mencoba untuk menguji null , terhadap alternatif lokal E [ X ] > 0 , untuk variabel acak X , tunduk pada kemiringan ringan hingga sedang dan kurtosis dari variabel acak. Mengikuti saran oleh Wilcox dalam 'Pengantar Estimasi Kuat dan Pengujian Hipotesis', saya telah melihat tes berdasarkan rata-rata yang …

12
Buku-buku terbaik untuk pengantar analisis data statistik?
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Saya membeli buku ini: Cara Mengukur Apa Pun: Menemukan Nilai Benda Tak Berwujud dalam Bisnis dan Analisis Data Kepala Pertama: Panduan Pelajar untuk Angka Besar, Statistik, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.