Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



3
Apakah ada perpustakaan yang tersedia untuk metode seperti CART menggunakan prediktor & respons jarang?
Saya bekerja dengan beberapa set data besar menggunakan paket gbm di R. Baik matriks prediktor saya dan vektor respons saya cukup jarang (yaitu sebagian besar entri adalah nol). Saya berharap untuk membangun pohon keputusan menggunakan algoritma yang mengambil keuntungan dari jarangnya ini, seperti yang dilakukan di sini ). Dalam makalah …

7
Teknik reduksi data untuk mengidentifikasi jenis negara
Saya mengajar kursus geografi ekonomi pengantar. Untuk membantu siswa saya mengembangkan pemahaman yang lebih baik tentang jenis negara yang ditemukan dalam ekonomi dunia kontemporer dan apresiasi teknik pengurangan data, saya ingin membangun sebuah tugas yang menciptakan tipologi berbagai jenis negara (misalnya, berpenghasilan tinggi nilai tambah, harapan umur panjang mfg, pengekspor …

1
Kesalahan melaporkan dengan representasi median dan grafis?
Saya telah menggunakan beragam tes untuk data tesis saya, mulai dari ANOVA parametrik dan uji-t hingga tes Kruskal-Wallis non-parametrik dan Mann-Whitney, serta ANOVA 2 arah yang ditransformasikan dengan pangkat, dan GzLM dengan biner, poisson dan data proporsional. Sekarang saya harus melaporkan semuanya saat saya menuliskan semua ini di hasil saya. …

2
Apa kekuatan uji F regresi?
Uji-F klasik untuk subset variabel dalam regresi multilinear memiliki bentuk di manaSSE(R)adalah jumlah kesalahan kuadrat di bawah 'berkurang' model, yang sarang di dalam 'besar' modelB, dandfadalah derajat kebebasan dari dua model. Di bawah hipotesis nol bahwa variabel tambahan dalam model 'besar' tidak memiliki kekuatan penjelas linear, statistik didistribusikan sebagai F …

1
Memodifikasi simulasi linear balistik akumulator (LBA) di R
Model "Linear Ballistic Accumulator" (LBA) adalah model yang agak berhasil untuk perilaku manusia dalam tugas keputusan cepat yang dipercepat. Donkin et al (2009, PDF ) menyediakan kode yang memungkinkan memperkirakan parameter model yang diberikan data perilaku manusia, dan saya telah menyalin kode ini (dengan beberapa perubahan format kecil) ke intisari …


2
Signifikansi probabilitas transisi awal dalam model markov tersembunyi
Apa manfaat dari memberikan nilai awal tertentu untuk probabilitas transisi dalam Model Markov Tersembunyi? Akhirnya sistem akan mempelajarinya, jadi apa gunanya memberikan nilai selain yang acak? Apakah algoritma yang mendasari membuat perbedaan seperti Baum-Welch? Jika saya mengetahui probabilitas transisi di awal dengan sangat akurat, dan tujuan utama saya adalah untuk …



1
Apa ini "koefisien korelasi maksimum"?
Statistik pemrosesan gambar yang khas adalah penggunaan fitur tekstur Haralick , yaitu 14. Saya bertanya-tanya tentang ke-14 fitur ini: Diberikan peta adjacency (yang kita dapat dengan mudah melihat distribusi empiris dari dua integer ), didefinisikan sebagai: akar kuadrat dari nilai eigen kedua , dimana adalah:i , j < 256 Q …

2
Apakah ada cara untuk menjelaskan prediksi dari model hutan acak?
Katakanlah saya punya model klasifikasi prediksi berdasarkan hutan acak (menggunakan paket randomForest di R). Saya ingin mengaturnya agar pengguna akhir dapat menentukan item untuk menghasilkan prediksi, dan itu akan menampilkan kemungkinan klasifikasi. Sejauh ini, tidak masalah. Tetapi akan berguna / keren untuk dapat menampilkan sesuatu seperti grafik kepentingan variabel, tetapi …

3
Mengukur ketergantungan non-linear
Kovarian antara dua variabel acak mendefinisikan ukuran seberapa dekat mereka terkait secara linear satu sama lain. Tetapi bagaimana jika distribusi bersama itu berbentuk sirkuler? Tentunya ada struktur dalam distribusi. Bagaimana struktur ini diekstraksi?

4
Bagaimana menghasilkan matriks korelasi acak yang memiliki sekitar entri off-diagonal yang terdistribusi normal dengan deviasi standar yang diberikan?
Saya ingin menghasilkan matriks korelasi acak sehingga distribusi elemen off-diagonal yang tampak kurang seperti biasa. Bagaimana saya bisa melakukannya? Motivasinya adalah ini. Untuk satu set data deret waktu, distribusi korelasi sering terlihat cukup dekat dengan normal. Saya ingin menghasilkan banyak matriks korelasi "normal" untuk mewakili situasi umum dan menggunakannya untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.