Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini


2
Kapan harus memilih regresi linier atau Pohon Keputusan atau regresi Hutan Acak? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 4 tahun yang lalu . Saya sedang mengerjakan suatu proyek dan saya mengalami kesulitan dalam menentukan algoritma mana yang …
10 machine-learning  algorithms  random-forest  linear-regression  decision-trees  machine-learning  predictive-modeling  forecast  r  clustering  similarity  data-mining  dataset  statistics  text-mining  text-mining  data-cleaning  data-wrangling  machine-learning  classification  algorithms  xgboost  data-mining  dataset  dataset  regression  graphs  svm  unbalanced-classes  cross-validation  optimization  hyperparameter  genetic-algorithms  visualization  predictive-modeling  correlation  machine-learning  predictive-modeling  apache-spark  statistics  normalization  apache-spark  map-reduce  r  correlation  confusion-matrix  r  data-cleaning  classification  terminology  dataset  image-classification  machine-learning  regression  apache-spark  machine-learning  data-mining  nlp  parsing  machine-learning  dimensionality-reduction  visualization  clustering  multiclass-classification  evaluation  unsupervised-learning  machine-learning  machine-learning  data-mining  supervised-learning  unsupervised-learning  machine-learning  data-mining  classification  statistics  predictive-modeling  data-mining  clustering  python  pandas  machine-learning  dataset  data-cleaning  data  bigdata  software-recommendation 


3
Bagaimana cara mengklasifikasikan teks dengan mempertimbangkan urutan kata, alih-alih hanya menggunakan pendekatan bag-of-words?
Saya telah membuat classifier Naif Bayes yang menggunakan teknik bag-of-words untuk mengklasifikasikan posting spam pada papan pesan. Ini bekerja, tapi saya pikir saya bisa mendapatkan hasil yang lebih baik jika model saya mempertimbangkan urutan kata dan frasa. (mis: 'cewek' dan 'live' mungkin tidak memicu skor spam yang tinggi, meskipun 'cewek …

3
Data Perdagangan NASDAQ
Saya mencoba mencari data stok untuk dipraktikkan, apakah ada sumber daya yang bagus untuk ini? Saya menemukan ini: ftp://emi.nasdaq.com/ITCH/ tetapi hanya memiliki tahun berjalan. Saya sudah memiliki cara untuk menguraikan protokol, tetapi ingin memiliki lebih banyak data untuk dibandingkan. Tidak harus dalam format yang sama, asalkan memiliki statistik harga, perdagangan, …

4
Data multi-kelas miring
Saya memiliki dataset yang berisi ~ 100.000 sampel dari 50 kelas. Saya telah menggunakan SVM dengan kernel RBF untuk melatih dan memprediksi data baru. Masalahnya adalah dataset cenderung condong ke kelas yang berbeda. Misalnya, Kelas 1 - 30 (masing-masing 3%), Kelas 31 - 45 (~ masing-masing 0,6%), Kelas 46 - …



5
Cara membuat daftar stopword yang bagus
Saya mencari beberapa petunjuk tentang cara membuat daftar stopwords. Adakah yang tahu / bisakah seseorang merekomendasikan metode yang bagus untuk mengekstrak daftar stopword dari dataset itu sendiri untuk preprocessing dan filtering? Data: sejumlah besar input teks manusia dengan panjang variabel (pencarian dan seluruh kalimat (hingga 200 karakter)) selama beberapa tahun. …



2
Apakah normalisasi batch berarti bahwa sigmoids bekerja lebih baik daripada ReLU?
Normalisasi batch dan ReLU adalah solusi untuk masalah gradien yang hilang. Jika kita menggunakan normalisasi batch, haruskah kita menggunakan sigmoids? Atau adakah fitur ReLU yang menjadikannya berharga bahkan ketika menggunakan batchnorm? Saya kira normalisasi yang dilakukan dalam batchnorm akan mengirimkan nol aktivasi negatif. Apakah itu berarti bahwa batchnorm menyelesaikan masalah …


1
Mengapa model Keras saya belajar mengenali latar belakang?
Saya mencoba untuk melatih implementasi Keras Deeplabv3 + ini pada Pascal VOC2012, menggunakan model yang sudah dilatih sebelumnya (yang juga dilatih tentang dataset itu). Saya mendapat hasil yang aneh dengan akurasi dengan cepat konvergen ke 1.0: 5/5 [==============================] - 182s 36s/step - loss: 26864.4418 - acc: 0.7669 - val_loss: 19385.8555 …

2
apa teknik mesin / pembelajaran mendalam / nlp yang digunakan untuk mengklasifikasikan kata-kata yang diberikan sebagai nama, nomor ponsel, alamat, email, negara bagian, county, kota dll
Saya mencoba membuat model cerdas yang dapat memindai serangkaian kata atau string dan mengklasifikasikannya sebagai nama, nomor ponsel, alamat, kota, negara, negara, dan entitas lainnya menggunakan pembelajaran mesin atau pembelajaran mendalam. Saya telah mencari pendekatan, tetapi sayangnya saya tidak menemukan pendekatan yang harus diambil. Saya telah mencoba dengan model tas …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.