Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

6
Jika interval kredibel memiliki flat sebelumnya, apakah interval kepercayaan 95% sama dengan interval kredibel 95%?
Saya sangat baru dalam statistik Bayesian, dan ini mungkin pertanyaan konyol. Namun: Pertimbangkan interval yang kredibel dengan prior yang menentukan distribusi seragam. Misalnya, dari 0 hingga 1, di mana 0 hingga 1 mewakili kisaran penuh dari nilai yang mungkin dari suatu efek. Dalam hal ini, apakah interval kredibel 95% sama …

7
Mengapa akurasi validasi berfluktuasi?
Saya memiliki CNN empat lapis untuk memprediksi respons terhadap kanker menggunakan data MRI. Saya menggunakan aktivasi ReLU untuk memperkenalkan nonlinier. Akurasi dan kehilangan kereta secara monoton meningkat dan menurun. Tapi, akurasi pengujian saya mulai berfluktuasi liar. Saya sudah mencoba mengubah tingkat belajar, mengurangi jumlah lapisan. Tapi, itu tidak menghentikan fluktuasi. …

1
Penyalahgunaan validasi silang (melaporkan kinerja untuk nilai hyperparameter terbaik)
Baru-baru ini saya menemukan makalah yang mengusulkan menggunakan pengklasifikasi k-NN pada dataset tertentu. Para penulis menggunakan semua sampel data yang tersedia untuk melakukan validasi silang k-fold untuk nilai k yang berbeda dan melaporkan hasil validasi silang dari konfigurasi hyperparameter terbaik. Sepengetahuan saya, hasil ini bias, dan mereka seharusnya mempertahankan set …

4
Benarkah bootstrap persentil tidak boleh digunakan?
Dalam catatan OpenCourseWare MIT untuk 18,05 Pengantar Probabilitas dan Statistik, Musim Semi 2014 (saat ini tersedia di sini ), ini menyatakan: Metode persentil bootstrap menarik karena kesederhanaannya. Namun itu tergantung pada distribusi bootstrap dari berdasarkan sampel tertentu yang merupakan perkiraan yang baik untuk distribusi sebenarnya dari . Rice mengatakan tentang …

2
Apakah kita memerlukan gradient descent untuk menemukan koefisien model regresi linier?
Saya mencoba mempelajari pembelajaran mesin menggunakan materi Coursera . Dalam kuliah ini, Andrew Ng menggunakan algoritma gradient descent untuk menemukan koefisien model regresi linier yang akan meminimalkan fungsi kesalahan (fungsi biaya). Untuk regresi linier, apakah kita perlu gradient descent? Tampaknya saya dapat secara analitis membedakan fungsi kesalahan dan menetapkannya ke …

3
Bagaimana Naive Bayes a Linear Classifier?
Saya telah melihat utas lainnya di sini, tetapi saya pikir jawabannya tidak memuaskan pertanyaan yang sebenarnya. Apa yang terus saya baca adalah bahwa Naif Bayes adalah pengklasifikasi linier (mis: sini ) (sedemikian rupa sehingga menarik batas keputusan linier) menggunakan demonstrasi peluang log. Namun, saya mensimulasikan dua awan Gaussian dan memasang …


4
Kapan estimasi bootstrap dari bias valid?
Sering diklaim bahwa bootstrap dapat memberikan perkiraan bias dalam estimator. Jika adalah estimasi untuk beberapa statistik, dan adalah replika bootstrap (dengan ), maka estimasi bootstrap dari bias adalah yang tampaknya sangat sederhana dan kuat, sampai-sampai mengganggu ketenangan. ~ t ii∈{1,⋯,N}biast≈1t^t^\hat tt~sayat~i\tilde t_ii ∈ { 1 , ⋯ , N}i∈{1,⋯,N}i\in\{1,\cdots,N\}b i …
31 bootstrap  bias 

2
Kepentingan relatif dari seperangkat alat prediksi dalam klasifikasi hutan acak dalam R
Saya ingin menentukan kepentingan relatif dari set variabel terhadap randomForestmodel klasifikasi dalam R. importanceFungsi ini menyediakan MeanDecreaseGinimetrik untuk setiap prediktor individu - apakah sesederhana menjumlahkan ini di setiap prediktor dalam set? Sebagai contoh: # Assumes df has variables a1, a2, b1, b2, and outcome rf <- randomForest(outcome ~ ., data=df) …

3
Mean Squared Error dan Sisa Jumlah Squares
Melihat definisi Wikipedia tentang: Mean Squared Error (MSE) Jumlah Sisa Kuadrat (RSS) Sepertinya saya itu MSE = 1NRSS = 1N∑ ( fsaya- ysaya)2MSE=1NRSS=1N∑(fsaya-ysaya)2\text{MSE} = \frac{1}{N} \text{RSS} = \frac{1}{N} \sum (f_i -y_i)^2 di mana NNN adalah jumlah sampel dan fsayafsayaf_i adalah estimasi kami untuk ysayaysayay_i . Namun, tidak ada artikel Wikipedia …
31 residuals  mse 

2
format data libsvm [ditutup]
Saya menggunakan alat libsvm ( http://www.csie.ntu.edu.tw/~cjlin/libsvm/ ) untuk mendukung klasifikasi vektor. Namun, saya bingung tentang format data input. Dari README: Format file data pelatihan dan pengujian adalah: <label> <index1>:<value1> <index2>:<value2> ... . . . Setiap baris berisi instance dan diakhiri dengan karakter '\ n'. Untuk klasifikasi, <label>adalah bilangan bulat yang …

3
Apakah mungkin untuk menghitung AIC dan BIC untuk model regresi laso?
Apakah mungkin untuk menghitung nilai AIC atau BIC untuk model regresi laso dan model yang diregulasi lainnya di mana parameter hanya sebagian memasukkan persamaan. Bagaimana seseorang menentukan derajat kebebasan? Saya menggunakan R agar sesuai dengan model regresi laso dengan glmnet()fungsi dari glmnetpaket, dan saya ingin tahu bagaimana menghitung nilai AIC …
31 r  model-selection  lasso  aic  bic 

3
Distribusi apa yang diikuti oleh data saya?
Katakanlah saya memiliki 1000 komponen dan saya telah mengumpulkan data tentang berapa kali kegagalan ini dicatat dan setiap kali mereka mencatat kegagalan, saya juga melacak berapa lama waktu yang dibutuhkan tim saya untuk memperbaiki masalah. Singkatnya, saya telah merekam waktu untuk memperbaiki (dalam detik) untuk masing-masing dari 1000 komponen ini. …

2
Residu mentah versus residu terstandarisasi versus residu pelajar - apa yang harus digunakan kapan?
Ini terlihat seperti pertanyaan serupa dan tidak mendapat banyak tanggapan. Menghilangkan tes seperti Cook's D, dan hanya melihat residu sebagai suatu kelompok, saya tertarik pada bagaimana orang lain menggunakan residu ketika menilai good-of-fit. Saya menggunakan residu mentah: dalam plot QQ, untuk menilai normalitas dalam sebaran versus residual, untuk pemeriksaan bola …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.