Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

3
Apa regresi yang digunakan untuk menghitung hasil pemilihan dalam sistem multi partai?
Saya ingin membuat prediksi untuk hasil pemilihan parlemen. Output saya akan menjadi% yang diterima masing-masing pihak. Ada lebih dari 2 pihak sehingga regresi logistik bukan pilihan yang layak. Saya bisa membuat regresi terpisah untuk masing-masing pihak tetapi dalam hal ini hasilnya akan dalam beberapa cara independen satu sama lain. Itu …

2
Konsekuensi dari Penskalaan Fitur
Saat ini saya menggunakan SVM dan meningkatkan fitur pelatihan saya ke kisaran [0,1]. Saya pertama kali cocok / mengubah set pelatihan saya dan kemudian menerapkan transformasi yang sama untuk set pengujian saya. Sebagai contoh: ### Configure transformation and apply to training set min_max_scaler = MinMaxScaler(feature_range=(0, 1)) X_train = min_max_scaler.fit_transform(X_train) ### …

4
Menggunakan Clustering dalam pemrosesan teks
Hai, ini adalah pertanyaan pertama saya di tumpukan Ilmu Data. Saya ingin membuat algoritma untuk klasifikasi teks. Misalkan saya punya satu set besar teks dan artikel. Mari kita katakan sekitar 5000 teks biasa. Saya pertama kali menggunakan fungsi sederhana untuk menentukan frekuensi keempat kata karakter di atas. Saya kemudian menggunakan …

3
Hubungan antara KS, AUROC, dan Gini
Statistik validasi model umum seperti uji Kolmogorov-Smirnov (KS), AUROC , dan koefisien Gini semuanya terkait secara fungsional. Namun, pertanyaan saya berkaitan dengan pembuktian bagaimana semua ini terkait. Saya ingin tahu apakah ada yang bisa membantu saya membuktikan hubungan ini. Saya belum dapat menemukan apa pun secara online, tetapi saya benar-benar …

2
Pembukuan menjalankan dan hasil percobaan
Saya seorang peneliti dan saya suka menguji solusi yang layak, jadi saya cenderung menjalankan banyak eksperimen. Misalnya, jika saya menghitung skor kesamaan antara dokumen, saya mungkin ingin mencoba banyak langkah. Bahkan, untuk setiap ukuran saya mungkin perlu melakukan beberapa kali pengujian untuk menguji efek dari beberapa parameter. Sejauh ini, saya …

3
Pembelajaran fitur tanpa pengawasan untuk NER
Saya telah mengimplementasikan sistem NER dengan menggunakan algoritma CRF dengan fitur buatan tangan saya yang memberikan hasil yang cukup baik. Masalahnya adalah saya menggunakan banyak fitur berbeda termasuk tag POS dan lemmas. Sekarang saya ingin membuat NER yang sama untuk bahasa yang berbeda. Masalahnya di sini adalah saya tidak bisa …

1
t-SNE Implementasi Python: Kullback-Leibler divergence
t-SNE, seperti pada [1], bekerja dengan secara progresif mengurangi divergensi Kullback-Leibler (KL), sampai kondisi tertentu terpenuhi. Pembuat t-SNE menyarankan untuk menggunakan KL divergence sebagai kriteria kinerja untuk visualisasi: Anda dapat membandingkan divergensi Kullback-Leibler yang dilaporkan oleh t-SNE. Sangat baik untuk menjalankan t-SNE sepuluh kali, dan pilih solusi dengan divergensi KL …


4
Bekerja dengan cluster HPC
Di universitas saya, kami memiliki cluster komputasi HPC. Saya menggunakan cluster untuk melatih pengklasifikasi dan sebagainya. Jadi, biasanya, untuk mengirim pekerjaan ke cluster, (misalnya skrip python scikit-learn), saya perlu menulis skrip Bash yang berisi (antara lain) perintah seperti qsub script.py. Namun, saya merasa proses ini sangat menyebalkan. Biasanya yang terjadi …


3
Data Sains berorientasi dataset / pertanyaan penelitian untuk tesis MSc Statistik
Saya ingin menjelajahi 'ilmu data'. Istilah ini agak samar bagi saya, tetapi saya berharap ini membutuhkan: pembelajaran mesin (bukan statistik tradisional); dataset yang cukup besar sehingga Anda harus menjalankan analisis pada cluster. Apa saja dataset dan masalah yang baik, yang dapat diakses oleh ahli statistik dengan latar belakang pemrograman, yang …

3
Bagaimana cara memproses pertanyaan bahasa alami?
Saya ingin tahu tentang permintaan bahasa alami. Stanford memiliki perangkat lunak yang kuat untuk memproses bahasa alami . Saya juga melihat perpustakaan Apache OpenNLP , dan Arsitektur Umum untuk Rekayasa Teks . Ada sejumlah besar kegunaan untuk pemrosesan bahasa alami dan yang membuat dokumentasi proyek-proyek ini sulit untuk diserap dengan …
11 nlp 


1
scikit-pelajari parameter n_jobs pada penggunaan CPU & memori
Dalam kebanyakan estimator pada scikit-belajar, ada n_jobsparameter dalam fit/ predictmetode untuk menciptakan lapangan kerja paralel menggunakan joblib. Saya perhatikan bahwa pengaturan untuk -1membuat hanya 1 proses Python dan memaksimalkan core, menyebabkan penggunaan CPU mencapai 2500% di atas. Ini sangat berbeda dari pengaturan ke beberapa integer positif> 1, yang menciptakan banyak …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.