Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

1
Kategorisasi pendekatan untuk menangani kelas yang tidak seimbang
Apa cara terbaik untuk mengkategorikan pendekatan yang telah dikembangkan untuk mengatasi masalah kelas ketidakseimbangan? Artikel ini mengelompokkannya menjadi: Preprocessing: termasuk metode oversampling, undersampling dan hybrid, Pembelajaran sensitif biaya: termasuk metode langsung dan meta-learning yang selanjutnya dibagi menjadi thresholding dan sampling, Teknik ensemble: mencakup ansambel yang sensitif terhadap biaya dan pemrosesan …



5
Tutorial tentang model topik dan LDA
Saya ingin tahu apakah Anda memiliki tutorial yang baik (cepat dan langsung) tentang model topik dan LDA, mengajar secara intuitif cara mengatur beberapa parameter, apa artinya dan jika mungkin, dengan beberapa contoh nyata.

2
Mengapa regresi Gradient Boosting memprediksi nilai negatif ketika tidak ada nilai y negatif di set pelatihan saya?
Seperti yang saya meningkatkan jumlah pohon di scikit belajar 's GradientBoostingRegressor, saya mendapatkan prediksi yang lebih negatif, meskipun tidak ada nilai negatif dalam pelatihan saya atau pengujian set. Saya memiliki sekitar 10 fitur, yang sebagian besar adalah biner. Beberapa parameter yang saya tuning adalah: jumlah pohon / iterasi; kedalaman belajar; …


2
Hasil LightGBM berbeda tergantung pada urutan data
Saya memiliki dua dataset A dan B yang persis sama dalam hal jumlah kolom, nama kolom, dan nilai-nilai. Satu-satunya perbedaan adalah urutan kolom-kolom itu. Saya kemudian melatih model LightGBM pada masing-masing dua set data dengan langkah-langkah berikut Bagilah setiap dataset ke dalam pelatihan dan pengujian (gunakan seed dan rasio acak …

3
Mengapa RNN biasanya memiliki lapisan tersembunyi yang lebih sedikit daripada CNN?
CNN dapat memiliki ratusan lapisan tersembunyi dan karena mereka sering digunakan dengan data gambar, memiliki banyak lapisan menangkap lebih banyak kompleksitas. Namun, sejauh yang saya lihat, RNN biasanya memiliki beberapa layer misalnya 2-4. Misalnya, untuk klasifikasi elektrokardiogram (EKG), saya telah melihat makalah menggunakan LSTM dengan 4 lapisan dan CNN dengan …

1
Bagaimana cara menggunakan SMOTE di Java Weka API?
Saya mencoba membangun model klasifikasi menggunakan Java Weka API. Dataset pelatihan saya memiliki masalah ketidakseimbangan kelas. Untuk alasan ini, saya ingin menggunakan SMOTE untuk mengurangi masalah ketidakseimbangan kelas. Tapi, saya tidak tahu cara menggunakannya di Java Weka API.

3
Apakah "kurva" dianggap "linier"?
Dalam regresi linier, kami menyesuaikan polinomial dengan sekumpulan titik data. Dalam buku Bishop tentang Pengenalan Pola & Pembelajaran Mesin, ada beberapa contoh di mana yang cocok adalah kurva atau garis lurus. Saya agak bingung apakah kurva linear atau tidak. Istilah linear berarti bahwa fit harus berupa fungsi linear atau polinomial …



1
Seberapa jauh seseorang bisa unggul? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 2 tahun yang lalu . dalam bisnis saya, kami menangani semua analitik melalui Excel. Ini termasuk sebagian besar penjadwalan, …

2
Mengapa ukuran-F lebih disukai untuk tugas klasifikasi?
Mengapa ukuran-F biasanya digunakan untuk tugas-tugas klasifikasi (diawasi), sedangkan indeks-G (atau indeks Fowlkes-Mallows) umumnya digunakan untuk tugas-tugas pengelompokan (tanpa pengawasan)? Ukuran-F adalah rata-rata harmonik dari presisi dan daya ingat . G-ukur (atau indeks Fowlkes-Mallows) adalah rata-rata geometris dari presisi dan daya ingat . Di bawah ini adalah plot dari berbagai …

1
Apa definisi dimensi VC yang tepat?
Saya mempelajari pembelajaran mesin dari kuliah Andrew Ng Stanford dan baru saja menemukan teori dimensi VC. Menurut ceramah dan apa yang saya mengerti, definisi dimensi VC dapat diberikan sebagai, Jika Anda dapat menemukan satu set nnn poin, sehingga dapat dihancurkan oleh classifier (yaitu mengklasifikasikan semua kemungkinan 2n2n2^n label dengan benar) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.