Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Mengungkapkan jawaban dalam hal unit asli, dalam data transformasi Box-Cox
Untuk beberapa pengukuran, hasil analisis disajikan dengan tepat pada skala transformasi. Namun, dalam sebagian besar kasus, diinginkan untuk menyajikan hasil pada skala pengukuran asli (jika tidak, pekerjaan Anda kurang lebih tidak berharga). Sebagai contoh, dalam kasus data yang ditransformasi log, masalah dengan interpretasi pada skala asli muncul karena rata-rata nilai …

1
Intuisi untuk momen yang lebih tinggi dalam statistik sirkuler
Dalam statistik sirkuler, nilai ekspektasi dari variabel acak dengan nilai pada lingkaran didefinisikan sebagai (lihat wikipedia ). Ini adalah definisi yang sangat alami, seperti definisi varians Jadi kita tidak perlu momen kedua untuk mendefinisikan varians!ZZZSSSm1( Z) = ∫SzPZ( θ ) d θm1(Z)=∫SzPZ(θ)dθ m_1(Z)=\int_S z P^Z(\theta)\textrm{d}\theta V a r (Z) = …

3
Menggunakan informasi geometri untuk menentukan jarak dan volume ... berguna?
Saya datang di besar tubuh sastra yang menganjurkan menggunakan Informasi Fisher metrik sebagai metrik lokal alami di ruang distribusi probabilitas dan kemudian mengintegrasikan lebih dari itu untuk menentukan jarak dan volume. Tetapi apakah jumlah "terintegrasi" ini sebenarnya berguna untuk apa saja? Saya tidak menemukan pembenaran teoretis dan sedikit sekali aplikasi …

5
Pemrosesan kognitif / interpretasi teknik visualisasi data
Adakah yang tahu tentang penelitian yang menyelidiki keefektifan (pemahaman?) Dari berbagai teknik visualisasi? Misalnya, seberapa cepat orang memahami satu bentuk visualisasi daripada yang lain? Apakah interaktivitas dengan visualisasi membantu orang mengingat data? Apa pun di sepanjang garis itu. Contoh visualisasi mungkin: plot pencar, grafik, garis waktu, peta, antarmuka interaktif (seperti …

4
Memisahkan dua populasi dari sampel
Saya mencoba memisahkan dua kelompok nilai dari satu set data. Saya dapat berasumsi bahwa salah satu populasi terdistribusi secara normal dan setidaknya setengah dari ukuran sampel. Nilai yang kedua sama-sama lebih rendah atau lebih tinggi dari nilai dari yang pertama (distribusi tidak diketahui). Yang saya coba lakukan adalah menemukan batas …

4
Perangkat lunak anonimisasi data
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Adakah yang mengetahui perangkat lunak anonimisasi data yang baik? Atau mungkin paket untuk R yang melakukan anonimisasi data? Jelas tidak mengharapkan anonimisasi yang tidak dapat dipecahkan …
13 software 

3
Model Efek Campuran Linier
Saya sudah sering mendengar bahwa model LME lebih baik dalam analisis data akurasi (yaitu, dalam eksperimen psikologi), karena mereka dapat bekerja dengan distribusi binomial dan non-normal lainnya yang tidak bisa dilakukan oleh pendekatan tradisional (misalnya, ANOVA). Apa dasar matematika dari model LME yang memungkinkan mereka untuk memasukkan distribusi lain ini, …

5
Pengurangan dimensi SVD untuk deret waktu dengan panjang berbeda
Saya menggunakan Dekomposisi Nilai Singular sebagai teknik reduksi dimensi. Mengingat Nvektor dimensiD , idenya adalah untuk mewakili fitur-fitur dalam ruang yang ditransformasi dari dimensi yang tidak berkorelasi, yang memadatkan sebagian besar informasi data dalam vektor eigen ruang ini dalam urutan kepentingan yang menurun. Sekarang saya mencoba menerapkan prosedur ini ke …

5
Kapan harus menggunakan banyak model untuk prediksi?
Ini adalah pertanyaan yang cukup umum: Saya biasanya menemukan bahwa menggunakan beberapa model berbeda mengungguli satu model ketika mencoba untuk memprediksi deret waktu dari sampel. Apakah ada tulisan bagus yang menunjukkan bahwa kombinasi model akan mengungguli model tunggal? Apakah ada praktik terbaik dalam menggabungkan beberapa model? Beberapa referensi: Hui Zoua, …



1
Dalam Random Forest, mengapa subset acak fitur dipilih di level node daripada di level tree?
Pertanyaan Saya: Mengapa hutan acak mempertimbangkan himpunan bagian acak dari fitur untuk pemisahan pada tingkat simpul dalam setiap pohon daripada di tingkat pohon ? Latar Belakang: Ini adalah pertanyaan sejarah. Tin Kam Ho menerbitkan makalah ini tentang membangun "hutan keputusan" dengan secara acak memilih subset fitur yang akan digunakan untuk …

1
Apakah akurasi aturan penilaian yang tidak tepat dalam pengaturan klasifikasi biner?
Saya baru-baru ini belajar tentang aturan penilaian yang tepat untuk pengklasifikasi probabilistik. Beberapa utas di situs web ini telah menekankan bahwa akurasi adalah aturan penilaian yang tidak tepat dan tidak boleh digunakan untuk mengevaluasi kualitas prediksi yang dihasilkan oleh model probabilistik seperti regresi logistik. Namun, beberapa makalah akademis yang saya …


11
Apakah standar deviasi sama sekali salah? Bagaimana Anda bisa menghitung std untuk ketinggian, jumlah dan lain-lain (angka positif)?
Katakanlah saya menghitung ketinggian (dalam cm) dan angkanya harus lebih tinggi dari nol. Berikut daftar sampelnya: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 Dalam contoh ini, menurut distribusi normal, 99,7% dari nilai harus antara ± 3 kali standar deviasi dari rata-rata. Namun, bahkan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.