Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

2
Memecahkan sistem persamaan dengan data jarang
Saya mencoba menyelesaikan serangkaian persamaan yang memiliki 40 variabel independen (x1, ..., x40) dan satu variabel dependen (y). Jumlah total persamaan (jumlah baris) adalah ~ 300, dan saya ingin menyelesaikan set 40 koefisien yang meminimalkan total jumlah kesalahan kuadrat antara y dan nilai prediksi. Masalah saya adalah bahwa matriks sangat …


4
Teknik Ekstraksi Fitur - Meringkas Urutan Data
Saya sering membangun model (klasifikasi atau regresi) di mana saya memiliki beberapa variabel prediktor yang berurutan dan saya telah berusaha untuk menemukan rekomendasi teknik untuk merangkumnya dengan cara terbaik untuk dimasukkan sebagai prediktor dalam model. Sebagai contoh konkret, katakanlah model sedang dibangun untuk memprediksi jika pelanggan akan meninggalkan perusahaan dalam …

4
Algoritma untuk menghasilkan aturan klasifikasi
Jadi kami memiliki potensi untuk aplikasi pembelajaran mesin yang cocok dengan cukup rapi ke dalam domain masalah tradisional yang diselesaikan oleh pengklasifikasi, yaitu, kami memiliki seperangkat atribut yang menggambarkan item dan "ember" yang akhirnya dimasukkan. Namun, daripada membuat model probabilitas seperti di Naif Bayes atau pengklasifikasi serupa, kami ingin output …

3
Bisakah algoritma pengurangan peta yang ditulis untuk MongoDB porting ke Hadoop nanti?
Di perusahaan kami, kami memiliki database MongoDB yang berisi banyak data tidak terstruktur, di mana kami perlu menjalankan algoritma pengurangan peta untuk menghasilkan laporan dan analisis lainnya. Kami memiliki dua pendekatan untuk dipilih untuk mengimplementasikan analisis yang diperlukan: Salah satu pendekatan adalah mengekstraksi data dari MongoDB ke cluster Hadoop dan …


2
Putus sekolah di lapisan LSTM mana?
Menggunakan multi-layer LSTMdengan dropout, apakah disarankan untuk meletakkan dropout pada semua layer yang tersembunyi serta output layer padat? Dalam makalah Hinton (yang mengusulkan Dropout) ia hanya menempatkan Dropout pada layer Dense, tapi itu karena lapisan dalam yang tersembunyi bersifat convolutional. Jelas, saya dapat menguji untuk model spesifik saya, tetapi saya …

1
Bagaimana cara menggunakan Scikit-Learn Label Propagation pada data terstruktur grafik?
Sebagai bagian dari penelitian saya, saya tertarik untuk melakukan propagasi label pada grafik. Saya terutama tertarik pada dua metode ini: Xiaojin Zhu dan Zoubin Ghahramani. Belajar dari data berlabel dan tidak berlabel dengan propagasi label. Laporan Teknis CMU-CALD-02-107, Universitas Carnegie Mellon, 2002 http://pages.cs.wisc.edu/~jerryzhu/pub/CMU-CALD-02-107.pdf Dengyong Zhou, Olivier Bousquet, Thomas Navin Lal, …

3
Apa perbedaan antara vektorizer hashing dan vektorizer tfidf
Saya mengubah kumpulan dokumen teks menjadi vektor kata untuk setiap dokumen. Saya sudah mencoba ini menggunakan TfidfVectorizer dan HashingVectorizer Saya mengerti bahwa a HashingVectorizertidak mempertimbangkan IDFskor seperti halnya a TfidfVectorizer. Alasan saya masih bekerja dengan a HashingVectorizeradalah fleksibilitas yang diberikannya ketika berhadapan dengan dataset besar, seperti yang dijelaskan di sini …

3
Apakah TensorFlow perpustakaan Machine Learning yang lengkap?
Saya baru mengenal TensorFlow dan saya perlu memahami kemampuan dan kekurangan TensorFlow sebelum saya dapat menggunakannya. Saya tahu bahwa ini adalah kerangka kerja pembelajaran yang mendalam, tetapi terlepas dari itu algoritma pembelajaran mesin lainnya dapat kita gunakan dengan aliran tensor. Sebagai contoh, bisakah kita menggunakan SVM atau hutan acak menggunakan …





2
Bagaimana mengkonversi data kategorikal menjadi data numerik di Pyspark
Saya menggunakan notebook Ipython untuk bekerja dengan aplikasi pyspark. Saya memiliki file CSV dengan banyak kolom kategorikal untuk menentukan apakah pendapatan berada di bawah atau di atas kisaran 50k. Saya ingin melakukan algoritma klasifikasi mengambil semua input untuk menentukan kisaran pendapatan. Saya perlu membuat kamus variabel untuk memetakan variabel dan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.