Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini


4
Jumlah zaman dalam implementasi Gensim Word2Vec
Ada iterparameter dalam gensimimplementasi Word2Vec class gensim.models.word2vec.Word2Vec (kalimat = Tidak ada, ukuran = 100, alpha = 0,025, window = 5, min_count = 5, max_vocab_size = Tidak ada, sampel = 0, seed = 1, pekerja = 1, min_alpha = 0,0001, sg = 1, hs = 1, negatif = 0, cbow_mean = …

3
Bingkai Data Pandas ke DMatrix
Saya mencoba menjalankan xgboost di scikit belajar. Dan saya hanya menggunakan Panda untuk memuat data ke dalam dataframe. Bagaimana saya bisa menggunakan panda df dengan xgboost. Saya bingung dengan rutin DMatrix yang diperlukan untuk menjalankan xgboost algo.

3
Bagaimana cara menggunakan LeakyRelu sebagai fungsi aktivasi dalam urutan DNN dalam keras? Kapan kinerja lebih baik daripada Relu?
Bagaimana Anda menggunakan LeakyRelu sebagai fungsi aktivasi dalam urutan DNN di keras? Jika saya ingin menulis sesuatu yang mirip dengan: model = Sequential() model.add(Dense(90, activation='LeakyRelu')) Apa solusinya? Masukkan LeakyRelu mirip dengan Relu? Pertanyaan kedua adalah: apa pengaturan umum terbaik untuk menyetel parameter LeakyRelu? Kapan kinerjanya secara signifikan lebih baik daripada …

4
AlphaGo (dan program game lainnya menggunakan penguatan-pembelajaran) tanpa database manusia
Saya bukan spesialis masalah ini, dan pertanyaan saya mungkin sangat naif. Ini berasal dari esai untuk memahami kekuatan dan keterbatasan pembelajaran penguatan seperti yang digunakan dalam program AlphaGo. Program AlphaGo telah dibangun menggunakan, antara lain (penjelajahan Monte-Carlo pohon, dll.), Jaringan saraf yang dilatih dari database besar game go yang dimainkan …

2
Mengapa Algoritma Genetika tidak digunakan untuk mengoptimalkan jaringan saraf?
Dari pemahaman saya, Algoritma Genetika adalah alat yang ampuh untuk optimasi multi-tujuan. Selain itu, pelatihan Neural Networks (terutama yang dalam) sulit dan memiliki banyak masalah (fungsi biaya non-cembung - minimum lokal, menghilang dan meledak gradien dll). Juga saya secara konseptual melatih NN dengan GA layak. Saya bertanya-tanya, mengapa mereka tidak …



1
Berapa banyak fitur untuk sampel menggunakan Hutan Acak
The Wikipedia halaman yang kutipan "The Elements of statistik Learning" kata: Biasanya, untuk masalah klasifikasi dengan fitur , ⌊ √halhalp fitur p ⌋digunakan di setiap pemisahan.⌊ hlm-√⌋⌊hal⌋\lfloor \sqrt{p}\rfloor Saya mengerti bahwa ini adalah tebakan berpendidikan yang cukup baik dan mungkin dikonfirmasi oleh bukti empiris, tetapi apakah ada alasan lain mengapa …

1
XGBRegressor vs xgboost.train perbedaan kecepatan yang sangat besar?
Jika saya melatih model saya menggunakan kode berikut: import xgboost as xg params = {'max_depth':3, 'min_child_weight':10, 'learning_rate':0.3, 'subsample':0.5, 'colsample_bytree':0.6, 'obj':'reg:linear', 'n_estimators':1000, 'eta':0.3} features = df[feature_columns] target = df[target_columns] dmatrix = xg.DMatrix(features.values, target.values, feature_names=features.columns.values) clf = xg.train(params, dmatrix) selesai dalam waktu sekitar 1 menit. Jika saya melatih model saya menggunakan metode …

1
Heatmap pada peta dengan Python
Mode Analytics memiliki fitur peta panas yang bagus ( https://community.modeanalytics.com/gallery/geographic-heat-map/ ). Tetapi tidak kondusif untuk membandingkan peta (hanya satu per laporan). Apa yang mereka perbolehkan adalah data dapat ditarik dengan mudah ke dalam notebook python yang dibungkus. Dan kemudian gambar apa pun dalam python dapat dengan mudah ditambahkan ke laporan. …

1
Konversikan panda kolom int ke stempel waktu tipe data
Saya memiliki kerangka data yang antara lain berisi kolom jumlah milidetik yang dilalui sejak 1970-1-1. Saya perlu mengubah kolom ints ini menjadi data timestamp, jadi saya akhirnya dapat mengonversinya menjadi kolom data datetime dengan menambahkan seri kolom timestamp ke seri yang seluruhnya terdiri dari nilai datetime untuk 1970-1-1. Saya tahu …


2
Regresi linier dengan fungsi biaya non-simetris?
Saya ingin memprediksi beberapa nilai dan saya mencoba untuk mendapatkan beberapa prediksi yang mengoptimalkan antara serendah mungkin, tetapi masih lebih besar dariY(x)Y(x)Y(x)Y^(x)Y^(x)\hat Y(x)Y(x)Y(x)Y(x)cost{Y(x)≳Y^(x)}>>cost{Y^(x)≳Y(x)}cost{Y(x)≳Y^(x)}>>cost{Y^(x)≳Y(x)}\text{cost}\left\{ Y(x) \gtrsim \hat Y(x) \right\} >> \text{cost}\left\{ \hat Y(x) \gtrsim Y(x) \right\} Saya pikir regresi linier sederhana harus baik-baik saja. Jadi saya agak tahu bagaimana menerapkan ini …

5
Fitur penting dengan scikit-learn Random Forest menunjukkan Standar Deviasi yang sangat tinggi
Saya menggunakan scikit-learn Random Forest Classifier dan saya ingin merencanakan kepentingan fitur seperti dalam contoh ini . Namun hasil saya benar-benar berbeda, dalam arti fitur penting standar deviasi hampir selalu lebih besar daripada fitur penting itu sendiri (lihat gambar terlampir). Mungkinkah memiliki perilaku seperti itu, atau apakah saya melakukan beberapa …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.