Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Partisi pohon di R: party vs rpart
Sudah lama sejak saya melihat pohon partisi. Terakhir kali saya melakukan hal semacam ini, saya suka pesta di R (dibuat oleh Hothorn). Ide inferensi bersyarat melalui pengambilan sampel masuk akal bagi saya. Tetapi rpart juga memiliki daya tarik. Dalam aplikasi saat ini (saya tidak bisa memberikan rincian, tetapi itu melibatkan …
15 r  cart  rpart  partitioning 


3
Apa pendekatan yang baik untuk mengajar R di laboratorium komputer?
Ada beberapa pertanyaan dan set jawaban yang bagus tentang buku-buku pengantar atau pendekatan untuk belajar R misalnya di sini dan di sini . Tetapi saya memiliki masalah yang sedikit berbeda - cara terbaik untuk menjalankan sesi panjang satu jam (atau beberapa sesi seperti itu) di laboratorium komputer yang akan membuat …
15 r  teaching 






4
Apa korelasinya jika standar deviasi satu variabel adalah 0?
Seperti yang saya pahami, kita bisa mendapatkan korelasi dengan menormalkan kovarians menggunakan persamaan ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} dimana adalah standar deviasiXi.σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i Kekhawatiran saya adalah bagaimana jika standar deviasi sama dengan nol? Apakah ada syarat yang menjamin tidak boleh nol? Terima kasih.

2
Meningkatnya jumlah fitur menghasilkan penurunan akurasi tetapi peningkatan sebelum / penarikan
Saya baru belajar Mesin. Saat ini saya menggunakan classifier Naive Bayes (NB) untuk mengklasifikasikan teks kecil dalam 3 kelas sebagai positif, negatif atau netral, menggunakan NLTK dan python. Setelah melakukan beberapa tes, dengan dataset yang terdiri dari 300.000 instance (16.924 positif, 7.477 negatif, dan 275.599 netral), saya menemukan bahwa ketika …

9
Bisakah standar deviasi data non-negatif melebihi rata-rata?
Saya memiliki beberapa jerat 3D triangulasi. Statistik untuk area segitiga adalah: Min 0.000 Maks 2341.141 Berarti 56.317 Std dev 98.720 Jadi, apakah itu berarti sesuatu yang sangat berguna tentang standar deviasi atau menyarankan ada bug dalam menghitungnya, ketika angka-angkanya seperti di atas? Wilayah-wilayah tersebut tentu jauh dari distribusi normal. Dan …


1
Bagaimana cara menghitung pita prediksi untuk regresi non-linear?
The halaman bantuan untuk Prism memberikan penjelasan berikut untuk bagaimana menghitung band prediksi untuk regresi non-linear. Maafkan kutipan panjang, tapi saya tidak mengikuti paragraf kedua (yang menjelaskan bagaimana didefinisikan dan dihitung). Bantuan apa pun akan sangat dihargai.d Y / d PG|xG|xG|xdY/dPdY/dPdY/dP Perhitungan band kepercayaan dan prediksi cukup standar. Baca terus …

5
Apa sumber daya yang baik yang mencakup perbandingan pro dan kontra dari pengklasifikasi yang berbeda?
Apa classifier 2-kelas out-of-the-box terbaik? Ya, saya kira itu adalah pertanyaan jutaan dolar, dan ya, saya menyadari teorema makan siang gratis , dan saya juga membaca pertanyaan sebelumnya: Apa klasifikasi 2-out-of-the-box terbaik untuk aplikasi Anda? dan pengklasifikasi terburuk Tetap saja, saya tertarik membaca lebih banyak tentang masalah ini. Apa sumber …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.