Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Optimalkan SVM untuk menghindari false-negative dalam klasifikasi biner
Saya melatih classifier biner SVM menggunakan Scikit belajar. Karena sifat masalah saya, saya perlu menghindari negatif palsu. Karena tidak ada yang gratis, saya oke mendapatkan tingkat positif palsu yang lebih tinggi untuk mengurangi jumlah negatif palsu. Bagaimana kita bisa melakukan itu (idealnya dengan Scikit belajar)? Dengan kata lain, bagaimana kita …


1
Teknik untuk mendeteksi overfitting
Saya memiliki wawancara kerja untuk posisi ilmu data. Selama wawancara, saya ditanya apa yang harus saya lakukan untuk memastikan modelnya tidak overfitting. Jawaban pertama saya adalah menggunakan validasi silang untuk menilai kinerja model. Namun, pewawancara mengatakan bahwa bahkan validasi silang tidak dapat mengidentifikasi overfitting sepenuhnya. Lalu saya menyebutkan regularisasi, tetapi …

2
Apakah status acak parameter untuk disetel?
Masalah yang cukup sering terjadi dalam percobaan saya adalah model bervariasi dalam kinerja ketika keadaan acak untuk algoritma diubah. Jadi pertanyaannya sederhana, haruskah saya mengambil status acak sebagai hiperparameter? Mengapa demikian? Jika model saya mengungguli orang lain dengan keadaan acak berbeda, haruskah saya menganggap model itu lebih sesuai dengan keadaan …

1
Momen / mgf cosinus vektor pengarah?
Adakah yang bisa menyarankan bagaimana saya dapat menghitung momen kedua (atau seluruh fungsi menghasilkan momen) dari cosinus dari dua vektor acak gaussian , masing-masing didistribusikan sebagai , independen satu sama lain? IE, momen untuk variabel acak berikutx,yx,yx,yN(0,Σ)N(0,Σ)\mathcal N (0,\Sigma) ⟨x,y⟩∥x∥∥y∥⟨x,y⟩‖x‖‖y‖\frac{\langle x, y\rangle}{\|x\|\|y\|} Pertanyaan terdekat adalah fungsi menghasilkan Momen dari produk …

3
Data pelatihan tidak seimbang - tetapi apakah set validasi saya juga harus?
Saya telah memberi label data yang terdiri dari 10.000 contoh positif, dan 50.000 contoh negatif, sehingga totalnya 60000 contoh. Jelas data ini tidak seimbang. Sekarang katakanlah saya ingin membuat set validasi saya, dan saya ingin menggunakan 10% dari data saya untuk melakukannya. Pertanyaan saya adalah sebagai berikut: Haruskah saya memastikan …

1
Terikat perbedaan antara Korelasi Spearman dan Korelasi Kendall
Saya mencoba untuk membuktikan atau membantah bahwa perbedaan antara Korelasi Spearman dan Korelasi Kendall tidak lebih dari 1 (atau kurang, semakin ketat semakin meriahnya). Saya berasumsi tidak ada ikatan. Dalam upaya untuk menyangkal hasil menggunakan contoh penghitung, saya memeriksa semua kemungkinan untuk vektor dengan panjang 8. Mendapat beberapa gambar cantik …

2
Statistik lengkap untuk dalam
Saya ingin tahu apakah statistik selesai untuk dalam pengaturan .T(X1,…,Xn)=∑ni=1(Xi−X¯n)2n−1T(X1,…,Xn)=∑i=1n(Xi−X¯n)2n−1T(X_1,\ldots,X_n)=\frac{\sum_{i=1}^n (X_i-\bar{X}_n)^2}{n-1}σ2σ2\sigma^2N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2) Apakah ini tergantung pada apakah sebelumnya diketahui atau tidak? Jika selesai untuk , maka oleh Lehmann-Scheffé itu UMVUE . Tetapi jika diketahui, kita dapat mempertimbangkan yang variansnya sama dengan Cramer-Rao terikat , dan benar-benar kurang dari , jadi tidak …

2
Persamaan dan perbedaan antara model IRT dan model regresi Logistik
Terlepas dari kesamaan mendasar seperti kedua model ini, probabilitas keberhasilan daripada memodelkan variabel respons secara langsung; Saya percaya bahwa ada jawaban yang lebih andal yang menunjukkan perbedaan dan persamaan di antara model-model ini. Satu perbedaannya adalah, dalam logistik seseorang dapat menggunakan tipe dan jumlah variabel independen yang berbeda; sedangkan dalam …

1
Nilai yang diharapkan dari rasio variabel acak berkorelasi?
Untuk variabel acak independen dan , apakah ada bentuk ekspresi tertutup untukαα\alphaββ\beta E [αα2+β2√]E[αα2+β2]\mathbb E \left[ \frac{\alpha}{\sqrt{\alpha^2 + \beta^2}} \right] dalam hal nilai dan varian yang diharapkan dari dan ? Jika tidak, adakah batas bawah yang baik dari harapan itu?αα\alphaββ\beta Pembaruan: Saya mungkin juga menyebutkan bahwa dan . Saya dapat …

1
mengenai format output untuk segmentasi semantik
Saat membaca makalah segmentasi semantik serta implementasi yang sesuai, saya menemukan bahwa beberapa pendekatan menggunakan softmax sementara yang lain menggunakan sigmoid untuk pelabelan tingkat piksel. Misalnya, sehubungan dengan kertas u-net , output adalah peta fitur dengan dua saluran. Saya telah melihat beberapa implementasi menggunakan softmax pada dua keluaran saluran ini. …

1
Mengapa kemungkinan marjinal sulit / sulit untuk diperkirakan?
Saya memiliki pertanyaan yang pada dasarnya mendasar untuk ditanyakan di sini yang telah mengganggu saya untuk sementara waktu. Melalui sebagian besar bacaan saya tentang statistik bayesian, dinyatakan tanpa basa-basi bahwa kemungkinan marjinal sering sulit dipecahkan atau sulit diperkirakan. Mengapa? Alasan yang sering dinyatakan mencakup pernyataan tentang sifat dimensi tinggi dari …

2
Apakah Random Forest pilihan yang baik untuk Klasifikasi data yang tidak seimbang? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 3 tahun yang lalu . Terlepas dari pendekatan variabilitas data yang mirip dan terus meningkat, dapatkah hutan acak "sebagai …

1
Pendekatan rata-rata model - rata-rata estimasi koefisien vs prediksi model?
Saya punya pertanyaan dasar tentang pendekatan untuk pemodelan rata-rata menggunakan kriteria IT untuk model berat dalam satu set kandidat. Sebagian besar sumber yang saya baca tentang model rata-rata menganjurkan rata-rata estimasi koefisien parameter berdasarkan bobot model (baik menggunakan 'rata-rata alami' atau metode 'rata-rata nol'). Namun, saya mendapat kesan bahwa rata-rata …

2
Cara menghitung intersep dan koefisien secara manual dalam regresi logistik
Saya sedang belajar tentang Regresi Logistik. Tapi saya terjebak dalam menghitung intersep ( ) dan koefisien ( ). Saya sudah mencarinya melalui internet, tetapi hanya mendapatkan tutorial menggunakan Microsoft Excel atau fungsi bawaan di R. Saya mendengarnya bisa diselesaikan dengan Kemungkinan Maksimum, tapi saya tidak mengerti bagaimana menggunakannya, karena saya …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.