Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

3
Klasifikasi teks tidak terstruktur
Saya akan mengklasifikasikan dokumen teks tidak terstruktur, yaitu situs web dengan struktur yang tidak diketahui. Jumlah kelas yang saya klasifikasikan terbatas (pada titik ini, saya yakin tidak ada lebih dari tiga). Adakah yang menyarankan agar saya bisa mulai? Apakah pendekatan "kantong kata" layak dilakukan di sini? Kemudian, saya bisa menambahkan …

2
Data sentimen untuk Emoji
Untuk bereksperimen, kami ingin menggunakan Emoji yang tertanam di banyak Tweet sebagai data dasar / pelatihan untuk analisis senitmen kuantitatif sederhana. Tweet biasanya terlalu tidak terstruktur untuk NLP untuk bekerja dengan baik. Bagaimanapun, ada 722 Emoji di Unicode 6.0, dan mungkin 250 Emoji lain akan ditambahkan di Unicode 7.0. Apakah …

3
Model basis data yang efisien untuk menyimpan data yang diindeks oleh n-gram
Saya sedang mengerjakan sebuah aplikasi yang membutuhkan pembuatan database n-gram yang sangat besar yang ada dalam corpus teks besar. Saya membutuhkan tiga jenis operasi yang efisien: Pencarian dan penyisipan diindeks oleh n-gram itu sendiri, dan permintaan untuk semua n-gram yang berisi sub-n-gram. Bagi saya ini kedengarannya seperti database harus pohon …
12 nlp  databases 

3
Memprediksi kondisi medis selanjutnya dari kondisi masa lalu dalam data klaim
Saat ini saya bekerja dengan sejumlah besar data klaim asuransi kesehatan yang mencakup beberapa klaim laboratorium dan farmasi. Namun, informasi paling konsisten dalam kumpulan data terdiri dari diagnosis (ICD-9CM) dan kode prosedur (CPT, HCSPCS, ICD-9CM). Tujuan saya adalah: Identifikasi kondisi prekursor yang paling berpengaruh (komorbiditas) untuk kondisi medis seperti penyakit …

3
Mengukur kinerja berbagai pengklasifikasi dengan ukuran sampel yang berbeda
Saat ini saya menggunakan beberapa pengklasifikasi yang berbeda pada berbagai entitas yang diekstraksi dari teks, dan menggunakan presisi / mengingat sebagai ringkasan seberapa baik kinerja masing-masing pengklasifikasi yang terpisah di seluruh dataset yang diberikan. Saya bertanya-tanya apakah ada cara yang berarti untuk membandingkan kinerja pengklasifikasi ini dengan cara yang sama, …

1
Apa perbedaan antara metode kompresi global dan universal?
Saya mengerti bahwa metode kompresi dapat dibagi menjadi dua set utama: global lokal Set pertama berfungsi terlepas dari data yang sedang diproses, yaitu, mereka tidak bergantung pada karakteristik data apa pun, dan dengan demikian tidak perlu melakukan preprocessing pada bagian mana pun dari dataset (sebelum kompresi itu sendiri). Di sisi …

2
Algoritma Pencocokan Preferensi
Ada proyek sampingan yang sedang saya kerjakan di mana saya perlu menyusun solusi untuk masalah berikut. Saya memiliki dua kelompok orang (klien). Grup Abermaksud untuk membeli dan grup Bbermaksud untuk menjual produk yang ditentukan X. Produk ini memiliki serangkaian atribut x_i, dan tujuan saya adalah untuk memfasilitasi transaksi antara Adan …

3
Apakah Amazon RedShift menggantikan Hadoop untuk data ~ 1XTB?
Ada banyak hype di sekitar Hadoop dan ekosistemnya. Namun, dalam praktiknya, di mana banyak set data berada dalam kisaran terabyte, apakah tidak lebih masuk akal untuk menggunakan Amazon RedShift untuk menanyakan set data besar, daripada menghabiskan waktu dan upaya membangun cluster Hadoop? Juga, bagaimana Amazon Redshift dibandingkan dengan Hadoop sehubungan …

9
Apa saja aplikasi pembelajaran mesin yang mudah dipelajari? [Tutup]
Ditutup . Pertanyaan ini didasarkan pada pendapat . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga dapat dijawab dengan fakta dan kutipan dengan mengedit posting ini . Ditutup 5 tahun yang lalu . Menjadi baru dalam pembelajaran mesin pada umumnya, saya ingin mulai bermain-main dan melihat …

2
Pengorbanan antara Storm dan Hadoop (MapReduce)
Dapatkah seseorang dengan ramah memberi tahu saya tentang pertukaran yang terlibat ketika memilih antara Storm dan MapReduce di Hadoop Cluster untuk pemrosesan data? Tentu saja, selain dari yang sudah jelas, bahwa Hadoop (pemrosesan melalui MapReduce dalam Hadoop Cluster) adalah sistem pemrosesan batch, dan Storm adalah sistem pemrosesan waktu-nyata. Saya telah …

3
Instans vs. core saat menggunakan EC2
Bekerja pada apa yang sering disebut proyek "data menengah", saya dapat memparalelkan kode saya (kebanyakan untuk pemodelan dan prediksi dalam Python) pada sistem tunggal di mana saja dari 4 hingga 32 core. Sekarang saya sedang mencari peningkatan skala pada EC2 (mungkin dengan StarCluster / IPython, tetapi terbuka untuk saran lain …
12 parallel  clusters  aws 

2
Bisakah jaringan saraf menghitung
Dalam semangat lelucon Tensorflow Fizz Buzz dan XOr yang terkenal, saya mulai berpikir, apakah mungkin merancang jaringan saraf yang mengimplementasikan fungsi y=x2y=x2y = x^2 ? Diberikan beberapa representasi dari angka (misalnya sebagai vektor dalam bentuk biner, sehingga angka 5tersebut diwakili sebagai [1,0,1,0,0,0,0,...]), jaringan saraf harus belajar untuk mengembalikan kuadratnya - …

3
Apakah ada aturan praktis untuk mendesain jaringan saraf?
Saya tahu bahwa arsitektur jaringan saraf sebagian besar didasarkan pada masalah itu sendiri dan jenis input / output, tetapi masih - selalu ada "yang persegi" ketika mulai membangun satu. Jadi pertanyaan saya adalah - diberikan dataset input MxN (M adalah jumlah catatan, N adalah jumlah fitur) dan kelas keluaran C …

1
Fitur penting dengan fitur kategoritas kardinalitas tinggi untuk regresi (variabel dependen numerik)
Saya mencoba menggunakan fitur penting dari Random Forests untuk melakukan beberapa pilihan fitur empiris untuk masalah regresi di mana semua fitur bersifat kategoris dan banyak dari mereka memiliki banyak tingkatan (pada urutan 100-1000). Mengingat bahwa pengodean satu-panas membuat variabel dummy untuk setiap level, kepentingan fitur adalah untuk setiap level dan …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.