Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Buktikan kesetaraan dua rumus berikut untuk korelasi Spearman
Dari wikipedia , korelasi peringkat Spearman dihitung dengan mengubah variabel XiXiX_i dan YiYiY_i menjadi variabel peringkat xixix_i dan yiyiy_i , dan kemudian menghitung korelasi Pearson antara variabel peringkat: Namun, artikel selanjutnya menyatakan bahwa jika tidak ada ikatan antara variabel XiXiX_i dan YiYiY_i , rumus di atas setara dengan di mana …

3
Memperkirakan n dalam masalah pengumpul kupon
Dalam variasi pada masalah pengumpul kupon , Anda tidak tahu jumlah kupon dan harus menentukan ini berdasarkan data. Saya akan menyebut ini sebagai masalah kue keberuntungan: Mengingat jumlah yang tidak diketahui yang berbeda pesan kue keberuntungan nnn , estimasi nnn dengan sampling cookies satu per satu dan menghitung berapa kali …


4
Dari perspektif probabilitas Bayesian, mengapa interval kepercayaan 95% tidak mengandung parameter sebenarnya dengan probabilitas 95%?
Dari halaman Wikipedia tentang interval kepercayaan : ... jika interval kepercayaan dibangun di banyak analisis data terpisah dari percobaan yang diulang (dan mungkin berbeda), proporsi interval tersebut yang mengandung nilai sebenarnya dari parameter akan cocok dengan tingkat kepercayaan ... Dan dari halaman yang sama: Interval kepercayaan tidak memprediksi bahwa nilai …

3
Bobot lebih banyak data terbaru dalam model Random Forest
Saya sedang melatih model klasifikasi dengan Random Forest untuk membedakan antara 6 kategori. Data transaksional saya memiliki sekitar 60k + pengamatan dan 35 variabel. Berikut adalah contoh bagaimana kira-kira terlihat. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 …

3
Dapatkah saya merekonstruksi distribusi normal dari ukuran sampel, dan nilai min dan maks? Saya bisa menggunakan titik tengah untuk proksi mean
Saya tahu ini mungkin sedikit mengikat, secara statistik, tetapi ini adalah masalah saya. Saya memiliki banyak data rentang, yaitu ukuran minimum, maksimum, dan sampel suatu variabel. Untuk beberapa data ini saya juga memiliki nilai rata-rata, tetapi tidak banyak. Saya ingin membandingkan rentang ini satu sama lain untuk mengukur variabilitas masing-masing …


2
Ukuran sampel yang tidak sama: Kapan menyebutnya berhenti
Saya sedang mereview artikel jurnal akademis dan penulis menulis yang berikut sebagai pembenaran untuk tidak melaporkan statistik inferensial (saya mengidentifikasi sifat kedua kelompok): Secara total, 25 dari 2349 (1,1%) responden melaporkan X . Kami menahan diri dari menyajikan analisis yang secara statistik membandingkan kelompok X dengan kelompok Y (2.324 peserta …

3
Memahami pita kepercayaan dari regresi polinomial
Saya mencoba memahami hasil yang saya lihat pada grafik saya di bawah ini. Biasanya, saya cenderung menggunakan Excel dan mendapatkan garis regresi linier tetapi dalam kasus di bawah ini saya menggunakan R dan saya mendapatkan regresi polinomial dengan perintah: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Jadi pertanyaan saya sampai pada …



3
Apakah p = 5,0% signifikan?
Hari ini saya ditanya, apakah nilai p 0,05 (tepat) dianggap signifikan (diberi alpha = 5%) atau tidak. Saya tidak tahu jawabannya dan Google memberikan kedua jawaban: (a) hasilnya signifikan jika p kurang dari 5% dan (b) jika p kurang dari 5% atau sama dengan 5%. Tentu saja, tidak ada situs …

1
Bagaimana cara menilai korelasi antara variabel ordinal dan variabel kontinu dengan benar?
Saya ingin memperkirakan korelasi antara: Variabel ordinal: subjek diminta untuk menilai preferensi mereka untuk 6 jenis buah pada skala 1-5 (mulai dari yang sangat menjijikkan hingga sangat lezat). Rata-rata subjek hanya menggunakan 3 poin skala. Variabel kontinu: subjek yang sama diminta untuk dengan cepat mengidentifikasi buah-buahan ini, yang menghasilkan akurasi …

3
Algoritma pohon regresi dengan model regresi linier di setiap daun
Versi pendek: Saya mencari paket R yang dapat membangun pohon keputusan sedangkan setiap daun di pohon keputusan adalah model Regresi Linier penuh. AFAIK, perpustakaan rpartmembuat pohon keputusan di mana variabel dependen konstan di setiap daun. Apakah ada perpustakaan lain (atau rpartpengaturan yang saya tidak sadari) yang dapat membangun pohon seperti …
14 r  regression  rpart  cart 


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.