Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
lme () dan lmer () memberikan hasil yang bertentangan
Saya telah bekerja dengan beberapa data yang memiliki beberapa masalah dengan pengukuran berulang. Dengan melakukan itu saya memperhatikan perilaku yang sangat berbeda antara lme()dan lmer()menggunakan data pengujian saya dan ingin tahu mengapa. Kumpulan data palsu yang saya buat memiliki pengukuran tinggi dan berat badan untuk 10 subjek, masing-masing diambil dua …

3
Menemukan cara untuk mensimulasikan angka acak untuk distribusi ini
Saya mencoba untuk menulis sebuah program dalam R yang mensimulasikan angka acak semu dari distribusi dengan fungsi distribusi kumulatif: F(x)=1−exp(−ax−bp+1xp+1),x≥0F(x)=1−exp⁡(−ax−bp+1xp+1),x≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 di manaa,b>0,p∈(0,1)a,b>0,p∈(0,1)a,b>0, p \in (0,1) Saya mencoba inverse transform sampling tetapi kebalikannya tampaknya tidak dapat dipecahkan secara analitis. Saya akan senang jika Anda bisa …

2
FPR (false positive rate) vs FDR (false discovery rate)
Kutipan berikut berasal dari makalah penelitian terkenal Statistik signifikansi untuk studi luas genom oleh Storey & Tibshirani (2003): Sebagai contoh, tingkat positif palsu 5% berarti bahwa rata-rata 5% dari fitur yang benar-benar nol dalam penelitian akan disebut signifikan. FDR (False Discovery rate) 5% berarti bahwa di antara semua fitur yang …

9
Overfitting dan Underfitting
Saya telah melakukan penelitian tentang overfitting dan underfitting, dan saya telah mengerti apa itu sebenarnya, tetapi saya tidak dapat menemukan alasannya. Apa alasan utama untuk overfitting dan underfitting? Mengapa kita menghadapi dua masalah ini dalam melatih model?



3
Memahami parameter input_shape di LSTM dengan Keras
Saya mencoba menggunakan contoh yang dijelaskan dalam dokumentasi Keras bernama "Stacked LSTM untuk klasifikasi urutan" (lihat kode di bawah) dan tidak dapat menemukan input_shapeparameter dalam konteks data saya. Saya telah memasukkan matriks urutan 25 karakter yang mungkin dikodekan dalam bilangan bulat ke urutan empuk dengan panjang maksimum 31. Sebagai hasilnya, …
20 lstm  keras  shape  dimensions 

4
Apakah probabilitas setiap hari hanyalah cara untuk berurusan dengan yang tidak diketahui (tidak berbicara fisika kuantum di sini)?
Sepertinya dalam probabilitas sehari-hari (bukan fisika kuantum), probabilitas benar-benar hanya pengganti yang tidak diketahui. Ambil flip koin misalnya. Kami mengatakan itu "acak," perubahan kepala 50% dan kemungkinan ekor 50%. Namun, jika saya tahu persis kepadatan, ukuran, dan bentuk koin; kepadatan udara; dengan seberapa besar kekuatan koin itu terbalik; di mana …


5
Contoh di mana prinsip kemungkinan * benar-benar * penting?
Adakah contoh di mana dua tes yang dapat dipertahankan yang berbeda dengan kemungkinan proporsional akan mengarahkan seseorang pada kesimpulan yang sangat berbeda (dan sama-sama dapat dipertahankan), misalnya, di mana nilai-p adalah urutan besaran yang berjauhan, tetapi kekuatan untuk alternatif serupa? Semua contoh yang saya lihat sangat konyol, membandingkan binomial dengan …

1
Dari Bayesian Networks ke Neural Networks: bagaimana regresi multivarian dapat ditransformasikan ke jaringan multi-output
Saya sedang berurusan dengan Model Linear Hierarchical Bayesian , di sini jaringan menggambarkannya. YYY merupakan penjualan harian suatu produk di supermarket (diamati). XXX adalah matriks regresi yang diketahui, termasuk harga, promosi, hari dalam seminggu, cuaca, hari libur. 1SSS adalah tingkat persediaan laten yang tidak diketahui dari setiap produk, yang menyebabkan …

4
Jika beberapa perbandingan “direncanakan”, apakah Anda masih perlu mengoreksi beberapa perbandingan?
Saya meninjau makalah yang telah melakukan> 15 tes Chi Square 2x2 terpisah. Saya telah menyarankan bahwa mereka perlu mengoreksi beberapa perbandingan, tetapi mereka telah menjawab mengatakan bahwa semua perbandingan telah direncanakan, dan karena itu ini tidak perlu. Saya merasa ini tidak boleh benar tetapi tidak dapat menemukan sumber daya yang …

1
Apakah ada penjelasan intuitif mengapa regresi logistik tidak akan berfungsi untuk kasus pemisahan sempurna? Dan mengapa menambahkan regularisasi akan memperbaikinya?
Kami memiliki banyak diskusi bagus tentang pemisahan sempurna dalam regresi logistik. Seperti, Regresi logistik dalam R menghasilkan pemisahan sempurna (fenomena Hauck-Donner). Sekarang apa? dan model regresi logistik tidak bertemu . Saya pribadi masih merasa itu tidak intuitif mengapa itu akan menjadi masalah dan mengapa menambahkan regularisasi akan memperbaikinya. Saya membuat …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.