Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

1
RNN menggunakan beberapa seri waktu
Saya mencoba membuat jaringan saraf menggunakan deret waktu sebagai input, untuk melatihnya berdasarkan jenis masing-masing seri. Saya membaca bahwa menggunakan RNNs Anda dapat membagi input ke dalam batch dan menggunakan setiap titik dari rangkaian waktu menjadi neuron individu dan akhirnya melatih jaringan. Apa yang saya coba lakukan adalah menggunakan beberapa …
14 time-series  rnn 


5
Apakah pustaka R dan / atau Python modern membuat SQL usang?
Saya bekerja di kantor di mana SQL Server adalah tulang punggung dari semua yang kami lakukan, dari pemrosesan data hingga pembersihan hingga munging. Kolega saya mengkhususkan diri dalam penulisan fungsi kompleks dan prosedur tersimpan untuk memproses data yang masuk secara metodis sehingga dapat distandarisasi dan digunakan dalam laporan, visualisasi, dan …
14 python  r  data-cleaning  data  sql 

3
Doc2vec (gensim) - Bagaimana saya bisa menyimpulkan label kalimat yang tidak terlihat?
https://radimrehurek.com/gensim/models/doc2vec.html Misalnya, jika kita telah melatih doc2vec dengan "aaaaaAAAAAaaaaaa" - "label 1" "BbbbbbBBBBBbbbb" - "label 2" dapatkah kita menyimpulkan "aaaaAAAAaaaaAA" ​​adalah label 1 menggunakan Doc2vec? Saya tahu Doc2vec dapat melatih vektor kata dan label label. Dengan menggunakan vektor ini, dapatkah kita menyimpulkan kalimat yang tidak terlihat (kombinasi kata-kata terlatih) di …
14 gensim 

1
Apa perbedaan antara jaringan Bayes (dinamis) dan HMM?
Saya telah membaca bahwa HMM, Filter Partikel dan filter Kalman adalah kasus khusus dari jaringan Bayes yang dinamis. Namun, saya hanya tahu HMM dan saya tidak melihat perbedaan pada jaringan Bayes yang dinamis. Bisakah seseorang tolong jelaskan? Akan lebih baik jika jawaban Anda bisa mirip dengan yang berikut, tetapi untuk …


3
Kapan nilai-p menipu?
Apa kondisi data yang harus kita waspadai, di mana nilai-p mungkin bukan cara terbaik untuk menentukan signifikansi statistik? Apakah ada tipe masalah spesifik yang termasuk dalam kategori ini?


1
Pohon keputusan: melintasi pohon dengan bijaksana (terbaik-pertama) dan bijaksana
Masalah 1: Saya bingung dengan deskripsi LightGBM mengenai cara pohon diperluas. Mereka menyatakan: Sebagian besar algoritma pembelajaran pohon keputusan menumbuhkan pohon berdasarkan level (kedalaman), seperti gambar berikut: Pertanyaan 1 : Algoritma "paling" mana yang diimplementasikan dengan cara ini? Sejauh yang saya tahu C4.5 dan CART menggunakan DFS. XGBoost menggunakan BFS. …


4
Bagaimana cara menginisialisasi model word2vec baru dengan bobot model pra-terlatih?
Saya menggunakan Perpustakaan Gensim dalam python untuk menggunakan dan melatih model word2vector. Baru-baru ini, saya melihat inisialisasi bobot model saya dengan beberapa model word2vec yang sudah dilatih sebelumnya seperti (model pretrained GoogleNewDataset). Saya telah berjuang dengan itu beberapa minggu. Sekarang, saya hanya mencari bahwa di gesim ada fungsi yang dapat …

8
Apakah Python cocok untuk data besar
Saya membaca di posting ini Apakah bahasa R cocok untuk Big Data yang merupakan data besar 5TB, dan sementara itu melakukan pekerjaan yang baik dalam memberikan informasi tentang kelayakan bekerja dengan jenis data di Rdalamnya memberikan informasi yang sangat sedikit tentang Python. Saya bertanya-tanya apakah Pythondapat bekerja dengan data sebanyak …
14 bigdata  python 


2
Seberapa pas model berpasangan berpasangan di xgBoost?
Sejauh yang saya tahu, untuk melatih pembelajaran membuat peringkat model, Anda perlu memiliki tiga hal dalam dataset: label atau relevansi grup atau id permintaan vektor fitur Misalnya, dataset Microsoft Learning to Rank menggunakan format ini (label, id grup, dan fitur). 1 qid:10 1:0.031310 2:0.666667 ... 0 qid:10 1:0.078682 2:0.166667 ... …
14 search  ranking  xgboost  gbm 

3
Apa arti dari fungsi model.predict dari Keras?
Saya telah membangun model LSTM untuk memprediksi pertanyaan duplikat pada dataset resmi Quora. Label uji adalah 0 atau 1. 1 menunjukkan pasangan pertanyaan duplikat. Setelah membangun model menggunakan model.fit, saya menguji model menggunakan model.predictpada data uji. Outputnya adalah array nilai seperti di bawah ini: [ 0.00514298] [ 0.15161049] [ 0.27588326] …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.