Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Apa peran MDS dalam statistik modern?
Saya baru-baru ini menemukan skala multidimensi. Saya mencoba memahami alat ini dengan lebih baik dan perannya dalam statistik modern. Jadi, inilah beberapa pertanyaan panduan: Pertanyaan apa yang dijawabnya? Peneliti mana yang sering tertarik menggunakannya? Apakah ada teknik statistik lain yang melakukan fungsi serupa? Teori apa yang dikembangkan di sekitarnya? Bagaimana …

2
Apa nilai " " yang diberikan dalam ringkasan model coxph di R
Berapa nilai diberikan dalam ringkasan model coxph dalam R? Sebagai contoh,R2R2R^2 Rsquare= 0.186 (max possible= 0.991 ) Saya dengan bodohnya memasukkannya sebagai manuskrip sebagai nilai dan pengulas langsung mengatakan bahwa ia tidak mengetahui analog dari statistik dari regresi linier klasik yang sedang dikembangkan untuk model Cox dan jika ada, silakan …

6
Mengapa statistik berguna ketika banyak hal yang penting adalah satu kesempatan?
Saya tidak tahu apakah ini hanya saya, tetapi saya sangat skeptis dengan statistik secara umum. Saya bisa memahaminya dalam permainan dadu, permainan poker, dll. Sangat kecil, sederhana, sebagian besar permainan berulang yang diisi sendiri baik-baik saja. Sebagai contoh, pendaratan koin di tepinya cukup kecil untuk menerima probabilitas bahwa pendaratan kepala …


1
Tes post-hoc setelah Kruskal-Wallis: tes Dunn atau Bonferroni mengoreksi tes Mann-Whitney?
Saya memiliki beberapa variabel terdistribusi non-Gaussian dan saya perlu memeriksa apakah ada perbedaan yang signifikan antara nilai-nilai variabel ini dalam 5 kelompok yang berbeda. Saya telah melakukan analisis varian satu arah Kruskal-Wallis (yang muncul signifikan) dan setelah itu saya harus memeriksa kelompok mana yang berbeda secara signifikan. Karena kelompok-kelompok semacam …

1
Model pengambilan sampel untuk data crowdsourced?
Saya sedang mengerjakan aplikasi survei kesehatan terbuka, yang rencananya akan digunakan di negara berkembang. Ide dasarnya adalah bahwa wawancara survei adalah crowdsourced - mereka dilakukan oleh sukarelawan yang tidak terorganisir yang mengirimkan data formulir wawancara yang mereka lakukan dengan menggunakan perangkat mobile mereka, dan setiap survei disertai dengan data GPS …
18 sampling 

4
Jika grafik ukuran buruk, mengapa mobil memiliki alat pengukur?
Sepertinya para ahli visualisasi data umumnya tidak menyetujui diagram pengukur (lihat di sini: Apa yang Anda sebut grafik yang tampak seperti diagram setengah lingkaran dengan jarum yang menunjukkan persentase? ). Alasan utamanya adalah bagan ukur memiliki rasio data-ke-tinta yang rendah. Sejak saya terkena konsep-konsep ini (beberapa buku Tufte), saya umumnya …

3
Jumlah variabel acak eksponensial mengikuti Gamma, dikacaukan oleh parameter
Saya telah belajar jumlah variabel acak eksponensial mengikuti distribusi Gamma. Tetapi di mana-mana saya membaca parametrization berbeda. Misalnya, Wiki menggambarkan hubungan tersebut, tetapi jangan mengatakan apa arti parameter mereka sebenarnya? Bentuk, skala, nilai, 1 / tingkat? Distribusi eksponensial: xxx ~ exp(λ)exp(λ)exp(\lambda) f(x|λ)=λe−λxf(x|λ)=λe−λxf(x|\lambda )=\lambda {{e}^{-\lambda x}} E[x]=1/λE[x]=1/λE[x]=1/ \lambda var(x)=1/λ2var(x)=1/λ2var(x)=1/{{\lambda}^2} Distribusi gamma: …

2
Mengapa Pemrosesan Bahasa Alami tidak termasuk dalam domain Machine Learning? [Tutup]
Seperti saat ini, pertanyaan ini tidak cocok untuk format tanya jawab kami. Kami berharap jawaban didukung oleh fakta, referensi, atau keahlian, tetapi pertanyaan ini kemungkinan akan mengundang debat, argumen, polling, atau diskusi panjang. Jika Anda merasa bahwa pertanyaan ini dapat diperbaiki dan mungkin dibuka kembali, kunjungi pusat bantuan untuk panduan. …

2
Bagaimana saya bisa mendapatkan ANOVA keseluruhan yang signifikan tetapi tidak ada perbedaan berpasangan yang signifikan dengan prosedur Tukey?
Saya tampil dengan R an ANOVA dan saya mendapat perbedaan yang signifikan. Namun ketika memeriksa pasangan mana yang berbeda secara signifikan menggunakan prosedur Tukey, saya tidak mendapatkan satupun dari mereka. Bagaimana ini bisa terjadi? Ini kodenya: fit5_snow<- lm(Response ~ Stimulus, data=audio_snow) anova(fit5_snow) > anova(fit5_snow) Analysis of Variance Table Response: Response …

2
Bagaimana cara menghitung kebingungan ketidaksepakatan dengan Alokasi Dirichlet Laten?
Saya bingung tentang cara menghitung kebingungan sampel ketidaksepakatan saat melakukan Latent Dirichlet Allocation (LDA). Makalah-makalah tentang topik itu membahasnya, membuat saya berpikir saya kehilangan sesuatu yang jelas ... Kesederhanaan dipandang sebagai ukuran kinerja yang baik untuk LDA. Idenya adalah bahwa Anda menyimpan sampel ketidaksepakatan, melatih LDA Anda pada sisa data, …



2
Variabel kepentingan dari GLMNET
Saya melihat menggunakan laso sebagai metode untuk memilih fitur dan menyesuaikan model prediksi dengan target biner. Di bawah ini adalah beberapa kode yang saya mainkan untuk mencoba metode ini dengan regresi logistik yang teratur. Pertanyaan saya adalah apakah saya mendapatkan sekelompok variabel "signifikan" tetapi apakah saya dapat menentukan urutannya untuk …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.