Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apakah semua algoritma pembelajaran mesin memisahkan data secara linear?
Saya seorang penggemar pemrograman dan pembelajaran mesin. Hanya beberapa bulan yang lalu saya mulai belajar tentang pemrograman pembelajaran mesin. Seperti banyak orang yang tidak memiliki latar belakang ilmu kuantitatif saya juga mulai belajar tentang ML dengan bermain-main dengan algoritma dan dataset dalam paket ML yang banyak digunakan (caret R). Beberapa …

6
Kemungkinan - Mengapa berkembang biak?
Saya sedang mempelajari tentang estimasi kemungkinan maksimum dan saya membaca bahwa fungsi kemungkinan adalah produk dari probabilitas setiap variabel. Mengapa ini produknya? Kenapa bukan jumlahnya? Saya telah mencoba mencari di Google tetapi saya tidak dapat menemukan jawaban yang berarti. https://en.wikipedia.org/wiki/Maximum_likelihood

2
apa asumsi uji permutasi?
Sering dinyatakan bahwa tes permutasi tidak memiliki asumsi, namun ini tentu saja tidak benar. Sebagai contoh jika sampel saya entah bagaimana berkorelasi, saya dapat membayangkan bahwa mengubah label mereka tidak akan menjadi hal yang benar untuk dilakukan. Satu-satunya yang saya temukan tentang masalah ini adalah kalimat dari wikipedia ini: "Asumsi …

1
Mengapa distribusi sampel varian merupakan distribusi chi-kuadrat?
Pernyataan Distribusi sampling dari varian sampel adalah distribusi chi-kuadrat dengan derajat kebebasan sama dengan , di mana adalah ukuran sampel (mengingat bahwa variabel bunga yang menarik secara normal didistribusikan).nn - 1n−1n-1nnn Sumber Intuisi saya Ini agak masuk akal bagi saya 1) karena tes chi-square terlihat seperti jumlah kuadrat dan 2) …

3
menafsirkan sumbu y dari plot ketergantungan parsial
Pertanyaan ini dimigrasikan dari Stack Overflow karena dapat dijawab di Cross Validated. Bermigrasi 5 tahun yang lalu . Saya telah membaca topik-topik lain tentang plot ketergantungan parsial dan kebanyakan dari mereka adalah bagaimana Anda benar-benar merencanakannya dengan paket yang berbeda, bukan bagaimana Anda dapat menafsirkannya secara akurat, Jadi: Saya telah …

2
Interpretasi dari kesalahan skala absolut rata-rata (MASE)
Mean absolute scaled error (MASE) adalah ukuran akurasi perkiraan yang diajukan oleh Koehler & Hyndman (2006) . M.A SE= MA EM.A Ei n - s a m p l e ,n ai v eM.SEBUAHSE=M.SEBUAHEM.SEBUAHEsayan-sSebuahmhalle,nSebuahsayaveMASE=\frac{MAE}{MAE_{in-sample, \, naive}} di mana adalah kesalahan absolut rata-rata yang dihasilkan oleh perkiraan aktual; sementara adalah kesalahan …

5
Bagaimana cara membagi dataset untuk prediksi deret waktu?
Saya memiliki data penjualan bersejarah dari toko roti (setiap hari, lebih dari 3 tahun). Sekarang saya ingin membuat model untuk memprediksi penjualan di masa depan (menggunakan fitur seperti hari kerja, variabel cuaca, dll.). Bagaimana saya harus membagi dataset untuk pemasangan dan evaluasi model? Apakah perlu kronologis kereta / validasi / …

2
Mengapa saya mendapatkan varians nol dari efek acak dalam model campuran saya, meskipun ada beberapa variasi dalam data?
Kami telah menjalankan regresi logistik efek campuran menggunakan sintaks berikut; # fit model fm0 <- glmer(GoalEncoding ~ 1 + Group + (1|Subject) + (1|Item), exp0, family = binomial(link="logit")) # model output summary(fm0) Subjek dan Barang adalah efek acak. Kami mendapatkan hasil yang aneh yaitu koefisien dan standar deviasi untuk istilah …

3
Bagaimana cara memimpin yang tidak tepat sebelumnya ke distribusi posterior yang tepat?
Kita tahu bahwa dalam hal distribusi sebelumnya yang tepat, P(θ∣X)=P(X∣θ)P(θ)P(X)P(θ∣X)=P(X∣θ)P(θ)P(X)P(\theta \mid X) = \dfrac{P(X \mid \theta)P(\theta)}{P(X)} ∝P(X∣θ)P(θ)∝P(X∣θ)P(θ) \propto P(X \mid \theta)P(\theta) . Pembenaran biasa untuk langkah ini adalah bahwa distribusi marginal , , konstan terhadap dan dengan demikian dapat diabaikan ketika menurunkan distribusi posterior.XXXP(X)P(X)P(X)θθ\theta Namun, dalam kasus prior yang tidak …


3
Mengapa kemungkinan maksimum dan kemungkinan tidak diharapkan?
Mengapa begitu umum untuk mendapatkan estimasi kemungkinan maksimum dari parameter, tetapi Anda hampir tidak pernah mendengar tentang perkiraan parameter kemungkinan yang diharapkan (yaitu, berdasarkan pada nilai yang diharapkan daripada mode fungsi kemungkinan)? Apakah ini terutama karena alasan historis, atau karena alasan teknis atau teoretis yang lebih substantif? Apakah akan ada …

5
Bagaimana cara menjaga analisis eksplorasi dataset besar?
Ketika saya memulai analisis eksplorasi pada set data besar (banyak sampel, banyak variabel), saya sering menemukan diri saya dengan ratusan variabel turunan, dan ton plot yang berbeda, dan tidak ada cara nyata untuk melacak apa yang terjadi di mana. Kode berakhir seperti spaghetti, karena tidak ada arah sejak awal ... …

2
Mengelompokkan matriks biner
Saya memiliki matriks semi-kecil fitur biner dimensi 250k x 100. Setiap baris adalah pengguna dan kolom adalah "tag" biner dari beberapa perilaku pengguna, misalnya "likes_cats". user 1 2 3 4 5 ... ------------------------- A 1 0 1 0 1 B 0 1 0 1 0 C 1 0 0 1 …


3
Memahami paradoks Simpson: teladan Andrew Gelman dengan merosotnya pendapatan untuk jenis kelamin dan tinggi badan
Andrew Gelman dalam salah satu posting blognya mengatakan: Saya tidak berpikir kontrafaktual atau hasil potensial diperlukan untuk paradoks Simpson. Saya mengatakan ini karena seseorang dapat mengatur paradoks Simpson dengan variabel yang tidak dapat dimanipulasi, atau manipulasi yang tidak secara langsung menarik. Paradoks Simpson adalah bagian dari masalah yang lebih umum …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.