Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

4
Sarankan set data pelatihan penggolong teks
Kumpulan data mana yang tersedia secara bebas yang dapat saya gunakan untuk melatih classifier teks? Kami mencoba untuk meningkatkan keterlibatan pengguna kami dengan merekomendasikan konten yang paling terkait untuknya, jadi kami pikir. Jika kami mengklasifikasikan konten kami berdasarkan kantong kata yang telah ditentukan, kami dapat merekomendasikan kepadanya untuk melibatkan konten …

1
Penambangan Data Relasional tanpa ILP
Saya memiliki dataset besar dari database relasional yang saya perlukan untuk membuat model klasifikasi. Biasanya untuk situasi ini saya akan menggunakan Pemrograman Logika Induktif (ILP), tetapi karena keadaan khusus saya tidak bisa melakukan itu. Cara lain untuk mengatasi hal ini adalah dengan mencoba menggabungkan nilai ketika saya memiliki hubungan asing. …



4
Matematika PhD (Nonlinear Programming) beralih ke Ilmu Data?
Saya seorang Ph.D. siswa yang tertarik untuk pergi ke industri sebagai Ilmuwan Data setelah lulus. Saya akan memberikan sedikit latar belakang tentang pendidikan saya sebelum mengajukan pertanyaan saya, sehingga lebih dipahami: Kursus Matematika: Ini sebagian besar dalam matematika murni: topologi, analisis fungsional, dll, tetapi juga termasuk yang lebih diterapkan (di …


1
Apa itu "VGG54" dan "VGG22" yang berasal dari CNN VGG19?
Dalam makalah Photo-Realistic Single Image Resolusi Super Menggunakan Jaringan Generatif Adversarial oleh Christian Ledig et al., Jarak antara gambar (digunakan dalam fungsi kehilangan) dihitung dari peta fitur yang diekstraksi dari jaringan VGG19. Dua yang digunakan dalam artikel ini (agak membingungkan) disebut VGG22 dan VGG54. Apa saja peta fitur ini? Apa …

1
Perbedaan antara interpolasi () dan fillna () dalam panda
Karena metode interpolasi dan fillna melakukan pekerjaan yang sama untuk mengisi nilai-nilai na. Apa perbedaan mendasar antara keduanya. Apa pentingnya memiliki dua metode yang berbeda ini ?? Adakah yang bisa menjelaskan saya dalam istilah awam. Saya sudah mengunjungi melalui dokumentasi resmi dan ingin tahu bedanya

2
Bagaimana autoencoder digunakan untuk pengelompokan?
Misalkan saya memiliki satu set sinyal domain waktu dengan sama sekali tidak ada label . Saya ingin mengelompokkannya dalam 2 atau 3 kelas. Autoencoder adalah jaringan tanpa pengawasan yang belajar mengompresi input. Jadi diberi input , bobot dan , bias dan , dan output , kita dapat menemukan hubungan berikut:x(i)x(i)x^{(i)}W1W1W_1W2W2W_2b1b1b_1b2b2b_2x^(i)x^(i)\hat{x}^{(i)} …

3
Meningkatkan kecepatan penyaringan dataframe Pandas
Saya memiliki dataset dengan 19 kolom dan sekitar 250rb baris. Saya telah bekerja dengan kumpulan data yang lebih besar, tetapi kali ini, Pandas memutuskan untuk bermain dengan saraf saya. Saya mencoba untuk membagi dataset asli menjadi 3 sub-dataframe berdasarkan beberapa aturan sederhana. Namun, butuh waktu lama untuk mengeksekusi kode. Sekitar …

1
Bisakah pelatihan label kepercayaan diri digunakan untuk meningkatkan akurasi prediksi?
Saya memiliki data pelatihan yang diberi label dengan nilai biner. Saya juga telah mengumpulkan kepercayaan dari masing-masing label ini yaitu 0,8 keyakinan akan berarti bahwa 80% dari pekerja manusia setuju pada label itu. Apakah mungkin untuk menggunakan data kepercayaan ini untuk meningkatkan akurasi classifier saya? Akankah cara berikut ini berhasil? …

2
Cara melatih model untuk memprediksi acara 30 menit sebelumnya, dari jadwal waktu multi-dimensi
Para ahli di bidang saya mampu memprediksi kemungkinan kejadian (binary spike yellow) 30 menit sebelum itu terjadi . Frekuensi di sini adalah 1 detik, tampilan ini mewakili beberapa jam nilai data, saya telah dilingkari hitam di mana pola "jahat" seharusnya . Interaksi antara dimensi ada, oleh karena itu dimensi tidak …

4
Apakah rekayasa fitur masih bermanfaat saat menggunakan XGBoost?
Saya sedang membaca materi yang terkait dengan XGBoost. Tampaknya metode ini tidak memerlukan penskalaan variabel karena didasarkan pada pohon dan yang satu ini dapat menangkap pola non-linearitas kompleks, interaksi. Dan itu dapat menangani variabel numerik dan kategoris dan juga tampaknya bahwa variabel redundan tidak terlalu mempengaruhi metode ini. Biasanya, dalam …


1
Hitung kesamaan cosinus di Apache Spark
Saya memiliki DataFrame dengan IDF dari kata-kata tertentu yang dihitung. Sebagai contoh (10,[0,1,2,3,4,5],[0.413734499590671,0.4244680552337798,0.4761400657781007, 1.4004620708967006,0.37876590175292424,0.48374466516332]) .... and so on Sekarang berikan pertanyaan Q, saya bisa menghitung TF-IDF dari permintaan ini. Bagaimana cara menghitung kesamaan cosinus dari kueri dengan semua dokumen dalam kerangka data (ada hampir sejuta dokumen) Saya bisa melakukannya secara …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.