Ilmu Data data

1

Mengapa xgboost jauh lebih cepat daripada sklearn GradientBoostingClassifier?

Saya mencoba untuk melatih model peningkatan gradien lebih dari 50k contoh dengan 100 fitur numerik. XGBClassifiermenangani 500 pohon dalam waktu 43 detik pada mesin saya, sementara GradientBoostingClassifierhanya menangani 10 pohon (!) dalam 1 menit dan 2 detik :( Saya tidak repot-repot mencoba menumbuhkan 500 pohon karena akan memakan waktu berjam-jam. …

29 scikit-learn xgboost gbm data-mining classification data-cleaning machine-learning reinforcement-learning data-mining bigdata dataset nlp language-model stanford-nlp machine-learning neural-network deep-learning randomized-algorithms machine-learning beginner career xgboost loss-function neural-network software-recommendation naive-bayes-classifier classification scikit-learn feature-selection r random-forest cross-validation data-mining python scikit-learn random-forest churn python clustering k-means machine-learning nlp sentiment-analysis machine-learning programming python scikit-learn nltk gensim visualization data csv neural-network deep-learning descriptive-statistics machine-learning supervised-learning text-mining orange data parameter-estimation python pandas scraping r clustering k-means unsupervised-learning

1

Bagaimana cara parameter validation_split fungsi Keras 'berfungsi?

Pemecahan validasi dalam fungsi model Keras Sequential didokumentasikan sebagai berikut di https://keras.io/models/ berikutnyaential / : validation_split: Mengambang antara 0 dan 1. Fraksi data pelatihan yang akan digunakan sebagai data validasi. Model akan memisahkan sebagian kecil dari data pelatihan ini, tidak akan melatihnya, dan akan mengevaluasi kerugian dan metrik model apa …

17 keras data cross-validation

5

membuat peta panas seaborn lebih besar

Saya membuat corr()df dari df asli. The corr()df keluar 70 X 70 dan tidak mungkin untuk memvisualisasikan heatmap tersebut ... sns.heatmap(df). Jika saya mencoba untuk menampilkan corr = df.corr(), tabel tidak cocok dengan layar dan saya bisa melihat semua korelasinya. Apakah ini cara untuk mencetak keseluruhan dfterlepas dari ukurannya atau …

16 visualization pandas plotting machine-learning neural-network svm decision-trees svm efficiency python linear-regression machine-learning nlp topic-model lda named-entity-recognition naive-bayes-classifier association-rules fuzzy-logic kaggle deep-learning tensorflow inception classification feature-selection feature-engineering machine-learning scikit-learn tensorflow keras encoding nlp text-mining nlp rnn python neural-network feature-extraction machine-learning predictive-modeling python r linear-regression clustering r ggplot2 neural-network neural-network training python neural-network deep-learning rnn predictive-modeling databases sql programming distribution dataset cross-validation neural-network deep-learning rnn machine-learning machine-learning python deep-learning data-mining tensorflow visualization tools sql embeddings orange feature-extraction unsupervised-learning gan machine-learning python data-mining pandas machine-learning data-mining bigdata apache-spark apache-hadoop deep-learning python convnet keras aggregation clustering k-means r random-forest decision-trees reference-request visualization data pandas plotting neural-network keras rnn theano deep-learning tensorflow inception predictive-modeling deep-learning regression sentiment-analysis nlp encoding deep-learning python scikit-learn lda convnet keras predictive-modeling regression overfitting regression svm prediction machine-learning similarity word2vec information-retrieval word-embeddings neural-network deep-learning rnn

4

Apakah panda sekarang lebih cepat daripada data.tabel?

https://github.com/Rdatatable/data.table/wiki/Benchmarks-%3A-Grouping Benchmark data.table belum diperbarui sejak 2014. Saya mendengar di suatu tempat yang Pandassekarang lebih cepat daripada data.table. Apakah ini benar? Adakah yang melakukan benchmark? Saya belum pernah menggunakan Python sebelumnya tetapi akan mempertimbangkan beralih jika pandasbisa mengalahkan data.table?

16 python r pandas data data.table

1

Bagaimana titik pemisahan untuk variabel kontinu di pohon keputusan?

Saya punya dua pertanyaan terkait pohon keputusan: Jika kita memiliki atribut kontinu, bagaimana kita memilih nilai pemisahan? Contoh: Usia = (20,29,50,40 ....) Bayangkan bahwa kita memiliki atribut kontinyu yang memiliki nilai-nilai dalam R . Bagaimana saya bisa menulis algoritma yang menemukan titik split v , agar ketika kita membagi f …

14 classification data decision-trees

5

Apakah pustaka R dan / atau Python modern membuat SQL usang?

Saya bekerja di kantor di mana SQL Server adalah tulang punggung dari semua yang kami lakukan, dari pemrosesan data hingga pembersihan hingga munging. Kolega saya mengkhususkan diri dalam penulisan fungsi kompleks dan prosedur tersimpan untuk memproses data yang masuk secara metodis sehingga dapat distandarisasi dan digunakan dalam laporan, visualisasi, dan …

14 python r data-cleaning data sql

3

Apakah ada model bahasa out-of-the-box yang bagus untuk python?

Saya membuat prototipe aplikasi dan saya membutuhkan model bahasa untuk menghitung kebingungan pada beberapa kalimat yang dihasilkan. Apakah ada model bahasa terlatih dalam python yang bisa saya gunakan? Sesuatu yang sederhana seperti model = LanguageModel('en') p1 = model.perplexity('This is a well constructed sentence') p2 = model.perplexity('Bunny lamp robert junior pancake') …

11 python nlp language-model r statistics linear-regression machine-learning classification random-forest xgboost python sampling data-mining orange predictive-modeling recommender-system statistics dimensionality-reduction pca machine-learning python deep-learning keras reinforcement-learning neural-network image-classification r dplyr deep-learning keras tensorflow lstm dropout machine-learning sampling categorical-data data-imputation machine-learning deep-learning machine-learning-model dropout deep-network pandas data-cleaning data-science-model aggregation python neural-network reinforcement-learning policy-gradients r dataframe dataset statistics prediction forecasting r k-means python scikit-learn labels python orange cloud-computing machine-learning neural-network deep-learning rnn recurrent-neural-net logistic-regression missing-data deep-learning autoencoder apache-hadoop time-series data preprocessing classification predictive-modeling time-series machine-learning python feature-selection autoencoder deep-learning keras tensorflow lstm word-embeddings predictive-modeling prediction machine-learning-model machine-learning classification binary theory machine-learning neural-network time-series lstm rnn neural-network deep-learning keras tensorflow convnet computer-vision

2

Berapa banyak data yang cukup untuk melatih model pembelajaran mesin saya?

Saya telah bekerja pada pembelajaran mesin dan bioinformatika untuk sementara waktu, dan hari ini saya berbicara dengan seorang kolega tentang masalah umum utama dari penambangan data. Rekan saya (yang ahli dalam pembelajaran mesin) mengatakan bahwa, menurut pendapatnya, aspek praktis yang paling penting dari pembelajaran mesin adalah bagaimana memahami apakah Anda …

11 machine-learning data-mining dataset data-cleaning data

2

Bagaimana cara melakukan Regresi Logistik dengan sejumlah besar fitur?

Saya memiliki dataset dengan 330 sampel dan 27 fitur untuk setiap sampel, dengan masalah kelas biner untuk Regresi Logistik. Menurut "aturan jika sepuluh" saya membutuhkan setidaknya 10 peristiwa untuk setiap fitur untuk dimasukkan. Padahal, saya memiliki dataset yang tidak seimbang, dengan 20% kelas positif dan 80% kelas negatif. Itu memberi …

10 machine-learning python predictive-modeling logistic-regression data

3

Hubungan antara belit dalam matematika dan CNN

Saya sudah membaca penjelasan konvolusi dan memahaminya sampai batas tertentu. Adakah yang bisa membantu saya memahami bagaimana operasi ini berhubungan dengan konvolusi dalam Jaring Saraf Konvolusional? Apakah fungsi seperti filter gyang menerapkan bobot?

10 machine-learning neural-network deep-learning cnn convolution machine-learning ensemble-modeling machine-learning classification data-mining clustering machine-learning feature-selection convnet pandas graphs ipython machine-learning apache-spark multiclass-classification naive-bayes-classifier multilabel-classification machine-learning data-mining dataset data-cleaning data machine-learning data-mining statistics correlation machine-learning data-mining dataset data-cleaning data beginner career python r visualization machine-learning data-mining nlp stanford-nlp dataset linear-regression time-series correlation anomaly-detection ensemble-modeling data-mining machine-learning python data-mining recommender-system machine-learning cross-validation model-selection scoring prediction sequential-pattern-mining categorical-data python tensorflow image-recognition statistics machine-learning data-mining predictive-modeling data-cleaning preprocessing classification deep-learning tensorflow machine-learning algorithms data keras categorical-data reference-request loss-function classification logistic-regression apache-spark prediction naive-bayes-classifier beginner nlp word2vec vector-space-models scikit-learn decision-trees data programming

2

Kapan harus memilih regresi linier atau Pohon Keputusan atau regresi Hutan Acak? [Tutup]

Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 4 tahun yang lalu . Saya sedang mengerjakan suatu proyek dan saya mengalami kesulitan dalam menentukan algoritma mana yang …

10 machine-learning algorithms random-forest linear-regression decision-trees machine-learning predictive-modeling forecast r clustering similarity data-mining dataset statistics text-mining text-mining data-cleaning data-wrangling machine-learning classification algorithms xgboost data-mining dataset dataset regression graphs svm unbalanced-classes cross-validation optimization hyperparameter genetic-algorithms visualization predictive-modeling correlation machine-learning predictive-modeling apache-spark statistics normalization apache-spark map-reduce r correlation confusion-matrix r data-cleaning classification terminology dataset image-classification machine-learning regression apache-spark machine-learning data-mining nlp parsing machine-learning dimensionality-reduction visualization clustering multiclass-classification evaluation unsupervised-learning machine-learning machine-learning data-mining supervised-learning unsupervised-learning machine-learning data-mining classification statistics predictive-modeling data-mining clustering python pandas machine-learning dataset data-cleaning data bigdata software-recommendation

4

Menafsirkan Pohon Keputusan dalam konteks kepentingan fitur

Saya mencoba memahami bagaimana memahami sepenuhnya proses pengambilan keputusan dari model klasifikasi pohon keputusan yang dibangun dengan sklearn. 2 aspek utama yang saya lihat adalah representasi graphviz dari pohon dan daftar fitur penting. Yang tidak saya mengerti adalah bagaimana pentingnya fitur ditentukan dalam konteks pohon. Sebagai contoh, berikut adalah daftar …

9 machine-learning visualization scikit-learn data decision-trees

2

Cara menghapus seluruh baris jika nilai dalam kolom adalah NaN [ditutup]

Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Data Science Stack Exchange. Ditutup 2 tahun yang lalu . Saya ingin menghapus semua baris yang berisi nilai NaN yang berkaitan dengan kolom. Mari kita asumsikan saya memiliki …

8 machine-learning python data-cleaning data

Pertanyaan yang diberi tag «data»