Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

3
Analisis jaringan dataset klasik
Ada beberapa dataset klasik untuk tugas klasifikasi / regresi pembelajaran mesin. Yang paling populer adalah: Set Data Bunga Iris ; Set Data Titanic ; Mobil Tren Motor ; dll. Tetapi apakah ada yang tahu dataset serupa untuk analisis jaringan / teori grafik? Lebih konkret - Saya mencari dataset standar Gold …
10 dataset  graphs 

2
Validasi silang: K-fold vs Sub-sampling acak berulang
Saya ingin tahu jenis model cross-validasi mana yang akan dipilih untuk masalah klasifikasi: K-fold atau sub-sampling acak (bootstrap sampling)? Tebakan terbaik saya adalah menggunakan 2/3 dari kumpulan data (yaitu ~ 1000 item) untuk pelatihan dan 1/3 untuk validasi. Dalam hal ini K-fold hanya memberikan tiga iterasi (lipatan), yang tidak cukup …


4
Bagaimana cara men-debug analisis data?
Saya telah menemukan masalah berikut, yang saya rekomendasikan agak khas. Saya punya beberapa data besar, katakanlah, beberapa juta baris. Saya menjalankan beberapa analisis non-sepele, misalnya query SQL yang terdiri dari beberapa sub-query. Saya mendapatkan beberapa hasil, dengan menyatakan, misalnya, bahwa properti X meningkat dari waktu ke waktu. Sekarang, ada dua …

1
Pengelompokan data pelanggan disimpan dalam ElasticSearch
Saya memiliki banyak profil pelanggan yang disimpan dalam sebuah cluster elasticsearch . Profil ini sekarang digunakan untuk membuat grup target untuk langganan email kami. Grup target sekarang dibentuk secara manual menggunakan kemampuan pencarian faceted elasticsearch (seperti dapatkan semua pelanggan pria berusia 23 tahun dengan satu mobil dan 3 anak). Bagaimana …

2
Debugging Neural Networks
Saya telah membangun jaringan saraf tiruan dalam python menggunakan fungsi optimisasi scipy.optimize.minimize (Conjugate gradient). Saya telah menerapkan pemeriksaan gradien, mengecek semuanya dll dan saya cukup yakin itu berfungsi dengan benar. Saya telah menjalankannya beberapa kali dan mencapai 'Pengoptimalan berhasil dihentikan' namun ketika saya meningkatkan jumlah lapisan tersembunyi, biaya hipotesis meningkat …

2
Apa metode yang paling efisien untuk optimasi hyperparameter di scikit-learn?
Gambaran umum proses optimisasi hyperparameter di scikit-learn ada di sini . Pencarian kisi-kisi yang mendalam akan menemukan set hiperparameter yang optimal untuk suatu model. Downside adalah bahwa pencarian grid lengkap lambat. Pencarian acak lebih cepat dari pencarian kotak tetapi memiliki variasi yang tidak perlu tinggi. Ada juga strategi tambahan dalam …

2
Apakah max_depth dalam scikit setara dengan pemangkasan di pohon keputusan?
Saya menganalisis classifier yang dibuat menggunakan pohon keputusan. Ada parameter tuning yang disebut max_depth di pohon keputusan scikit. Apakah ini setara dengan pemangkasan pohon keputusan? Jika tidak, bagaimana saya bisa memangkas pohon keputusan menggunakan scikit? dt_ap = tree.DecisionTreeClassifier(random_state=1, max_depth=13) boosted_dt = AdaBoostClassifier(dt_ap, random_state=1) boosted_dt.fit(X_train, Y_train)


2
Apakah Normalisasi Batch masuk akal untuk fungsi aktivasi ReLU?
Normalisasi Batch dijelaskan dalam makalah ini sebagai normalisasi input ke fungsi aktivasi dengan skala dan variabel bergeserγγ\gamma dan ββ\beta. Makalah ini terutama menjelaskan menggunakan fungsi aktivasi sigmoid, yang masuk akal. Namun, bagi saya tampaknya memberi makan input dari distribusi normal yang dihasilkan oleh normalisasi batch menjadi fungsi aktivasi ReLU darim …

3
Hubungan antara belit dalam matematika dan CNN
Saya sudah membaca penjelasan konvolusi dan memahaminya sampai batas tertentu. Adakah yang bisa membantu saya memahami bagaimana operasi ini berhubungan dengan konvolusi dalam Jaring Saraf Konvolusional? Apakah fungsi seperti filter gyang menerapkan bobot?
10 machine-learning  neural-network  deep-learning  cnn  convolution  machine-learning  ensemble-modeling  machine-learning  classification  data-mining  clustering  machine-learning  feature-selection  convnet  pandas  graphs  ipython  machine-learning  apache-spark  multiclass-classification  naive-bayes-classifier  multilabel-classification  machine-learning  data-mining  dataset  data-cleaning  data  machine-learning  data-mining  statistics  correlation  machine-learning  data-mining  dataset  data-cleaning  data  beginner  career  python  r  visualization  machine-learning  data-mining  nlp  stanford-nlp  dataset  linear-regression  time-series  correlation  anomaly-detection  ensemble-modeling  data-mining  machine-learning  python  data-mining  recommender-system  machine-learning  cross-validation  model-selection  scoring  prediction  sequential-pattern-mining  categorical-data  python  tensorflow  image-recognition  statistics  machine-learning  data-mining  predictive-modeling  data-cleaning  preprocessing  classification  deep-learning  tensorflow  machine-learning  algorithms  data  keras  categorical-data  reference-request  loss-function  classification  logistic-regression  apache-spark  prediction  naive-bayes-classifier  beginner  nlp  word2vec  vector-space-models  scikit-learn  decision-trees  data  programming 



3
Konsumsi memori CNN
Saya ingin dapat memperkirakan apakah model yang diusulkan cukup kecil untuk dilatih pada GPU dengan jumlah memori tertentu Jika saya memiliki arsitektur CNN sederhana seperti ini: Input: 50x50x3 C1: 32 3x3 kernel, dengan padding (saya kira pada kenyataannya theyre sebenarnya 3x3x3 diberikan kedalaman input?) P1: 2x2 dengan langkah 2 C2: …

3

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.