Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Mengapa lme ​​dan aov mengembalikan hasil yang berbeda untuk tindakan berulang ANOVA di R?
Saya mencoba untuk beralih dari menggunakan ezpaket ke lmeuntuk tindakan berulang ANOVA (karena saya berharap saya akan dapat menggunakan kontras kustom dengan lme). Mengikuti saran dari posting blog ini saya dapat mengatur model yang sama menggunakan keduanya aov(seperti halnya ez, ketika diminta) dan lme. Namun, sedangkan dalam contoh yang diberikan …

3
Apakah urutan variabel penjelas penting ketika menghitung koefisien regresi mereka?
Awalnya saya pikir urutannya tidak penting, tetapi kemudian saya membaca tentang proses ortogonisasi gram-schmidt untuk menghitung beberapa koefisien regresi, dan sekarang saya sedang berpikir dua kali. Menurut proses gram-schmidt, variabel penjelas selanjutnya diindeks di antara variabel-variabel lainnya, semakin kecil vektor residualnya karena vektor residual variabel sebelumnya dikurangi dari itu. Akibatnya, …

3
Persamaan dalam berita: Menerjemahkan model multi-level ke khalayak umum
The New York Times memiliki komentar panjang tentang sistem evaluasi guru 'nilai tambah' yang digunakan untuk memberikan umpan balik kepada pendidik Kota New York. Lede adalah persamaan yang digunakan untuk menghitung skor - disajikan tanpa konteks. Strategi retoris tampaknya intimidasi melalui matematika: Teks lengkap artikel ini tersedia di: http://www.nytimes.com/2011/03/07/education/07winerip.html Penulis, …

7
Algoritma untuk secara dinamis memonitor kuantil
Saya ingin memperkirakan jumlah beberapa data. Data tersebut sangat besar sehingga tidak dapat ditampung dalam memori. Dan data tidak statis, data baru terus berdatangan. Adakah yang tahu algoritma untuk memonitor kuantil data yang diamati sejauh ini dengan memori dan komputasi yang sangat terbatas? Saya menemukan algoritma P2 berguna, tetapi tidak …

13
Buku teks ekonometrika?
Buku teks ekonometrika yang bagus mana yang akan Anda rekomendasikan? Sunting: ada beberapa buku di luar sana, dengan berbagai tingkat kecanggihan matematika. Sebaiknya Anda mengetahui seberapa teknis buku yang Anda rekomendasikan.

4
Mengoreksi nilai p untuk beberapa tes di mana tes berkorelasi (genetika)
Saya memiliki nilai p dari banyak tes dan ingin tahu apakah sebenarnya ada sesuatu yang signifikan setelah mengoreksi beberapa pengujian. Komplikasinya: tes saya tidak independen. Metode yang saya pikirkan (varian dari Fisher's Product Method, Zaykin et al., Genet Epidemiol , 2002) membutuhkan korelasi antara nilai-nilai p. Untuk memperkirakan korelasi ini, …




2
Bagaimana memahami "nonlinier" seperti dalam "pengurangan dimensi nonlinier"?
Saya mencoba untuk memahami perbedaan antara metode reduksi dimensionalitas linier (misalnya, PCA) dan yang nonlinier (misalnya, Isomap). Saya tidak begitu mengerti apa arti linearitas (non) dalam konteks ini. Saya membaca dari Wikipedia itu Sebagai perbandingan, jika PCA (algoritma reduksi dimensionalitas linier) digunakan untuk mengurangi dataset yang sama ini menjadi dua …

2
Bagaimana K12 'CNN Krizhevsky mendapatkan 253.440 neuron di lapisan pertama?
Dalam Alex Krizhevsky, et al. Klasifikasi imagenet dengan jaringan saraf convolutional yang mendalam mereka menyebutkan jumlah neuron di setiap lapisan (lihat diagram di bawah). Input jaringan adalah 150.528-dimensi, dan jumlah neuron dalam lapisan jaringan yang tersisa diberikan oleh 253.440–186.624–64.889–64.889–43.264–4096–4096–1000. Tampilan 3D Jumlah neuron untuk semua lapisan setelah yang pertama jelas. …

4
Mensimulasikan distribusi seragam pada disk
Saya mencoba mensimulasikan injeksi titik acak di dalam lingkaran, sehingga setiap bagian dari lingkaran memiliki kemungkinan yang sama memiliki cacat. Saya mengharapkan penghitungan per area dari distribusi yang dihasilkan untuk mengikuti distribusi Poisson jika saya memecah lingkaran menjadi persegi area yang sama. Karena hanya membutuhkan penempatan titik dalam area melingkar, …


7
bagaimana cara merepresentasikan geografi atau kode pos dalam model pembelajaran mesin atau sistem rekomendasi?
Saya sedang membangun model dan saya pikir bahwa lokasi geografis cenderung sangat baik dalam memprediksi variabel target saya. Saya memiliki kode pos masing-masing pengguna saya. Saya tidak sepenuhnya yakin tentang cara terbaik untuk memasukkan kode pos sebagai fitur prediktor dalam model saya. Meskipun kode pos adalah angka, itu tidak berarti …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.