Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

1
CARA: Inisialisasi berat jaringan Neural Deep
Mengingat tugas belajar yang sulit (misalnya dimensi tinggi, kompleksitas data yang melekat) Deep Neural Networks menjadi sulit untuk dilatih. Untuk meringankan banyak masalah, orang mungkin: Normalisasi && data kualitas pilihan sendiri pilih algoritma pelatihan yang berbeda (misalnya RMSprop alih-alih Gradient Descent) pilih fungsi Biaya gradien yang lebih curam (mis. Cross …



1
Output Regresi Linier XGBo salah
Saya seorang pemula untuk XGBoost, jadi maafkan ketidaktahuan saya. Berikut adalah kode python: import pandas as pd import xgboost as xgb df = pd.DataFrame({'x':[1,2,3], 'y':[10,20,30]}) X_train = df.drop('y',axis=1) Y_train = df['y'] T_train_xgb = xgb.DMatrix(X_train, Y_train) params = {"objective": "reg:linear"} gbm = xgb.train(dtrain=T_train_xgb,params=params) Y_pred = gbm.predict(xgb.DMatrix(pd.DataFrame({'x':[4,5]}))) print Y_pred Output adalah: [ …

1
Pengguna-produk positif (data klik) tersedia. Bagaimana cara menghasilkan negatif (data tanpa klik)?
Sangat umum di pemberi rekomendasi bahwa kami memiliki data produk pengguna yang memiliki label sebagai contoh "klik". Untuk mempelajari modelnya, saya perlu data klik dan tanpa klik. Pendekatan sederhana untuk menghasilkan adalah mengambil pasangan produk-pengguna yang tidak ditemukan dalam data klik. Namun, itu mungkin menyesatkan. Contoh: user1, product1 (click) user2, …

2
Apa yang harus dilakukan ketika menguji data memiliki lebih sedikit fitur daripada data pelatihan?
Katakanlah kita memperkirakan penjualan toko dan data pelatihan saya memiliki dua set fitur: Satu tentang penjualan toko dengan tanggal (bidang "Toko" tidak unik) Satu tentang jenis toko (bidang "Toko" unik di sini) Jadi matriksnya akan terlihat seperti ini: +-------+-----------+------------+---------+-----------+------+-------+--------------+ | Store | DayOfWeek | Date | Sales | Customers | …

2
Bagaimana para ilmuwan menghasilkan parameter dan topologi Hidden Markov Model yang benar untuk digunakan?
Saya mengerti bagaimana Model Markov Tersembunyi digunakan dalam sekuens genom, seperti menemukan gen. Tapi saya tidak mengerti bagaimana membuat model Markov tertentu. Maksud saya, berapa banyak negara yang seharusnya dimiliki oleh model? Berapa banyak kemungkinan transisi? Haruskah model memiliki loop? Bagaimana mereka tahu bahwa model mereka optimal? Apakah mereka membayangkan, …

1
Berapa banyak data pelatihan yang dibutuhkan word2vec?
Saya ingin membandingkan perbedaan antara kata yang sama yang disebutkan dalam berbagai sumber. Artinya, bagaimana penulis berbeda dalam penggunaan kata-kata yang tidak jelas, seperti "demokrasi". Rencana singkat adalah Ambil buku-buku yang menyebutkan istilah "demokrasi" sebagai teks biasa Di setiap buku, ganti democracydengandemocracy_%AuthorName% Latih word2vecmodel di buku-buku ini Hitung jarak antara …

1
Seberapa fleksibel hubungan antara fungsi tujuan dan fungsi aktivasi lapisan keluaran?
Tampaknya standar dalam banyak paket jaringan saraf untuk memasangkan fungsi tujuan yang akan diminimalkan dengan fungsi aktivasi di lapisan output. Sebagai contoh, untuk lapisan output linier yang digunakan untuk regresi adalah standar (dan seringkali hanya pilihan) untuk memiliki fungsi tujuan kesalahan kuadrat. Pasangan lain yang biasa adalah output logistik dan …

1
Bagaimana cara menghitung jangka waktu delta dari Lapisan Konvolusional, mengingat syarat dan berat delta dari Lapisan Konvolusional sebelumnya?
Saya mencoba untuk melatih jaringan saraf tiruan dengan dua lapisan convolutional (c1, c2) dan dua lapisan tersembunyi (c1, c2). Saya menggunakan pendekatan backpropagation standar. Dalam pass mundur saya menghitung istilah kesalahan lapisan (delta) berdasarkan kesalahan lapisan sebelumnya, bobot lapisan sebelumnya dan gradien aktivasi sehubungan dengan fungsi aktivasi lapisan saat ini. …

3
Apakah ontologi dan Web Semantik mati? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 2 tahun yang lalu . Apakah Web Semantik mati? Apakah ontologi sudah mati? Saya mengembangkan rencana kerja untuk tesis …

1
Apakah Anda harus menormalkan data saat membuat pohon keputusan menggunakan R?
Jadi, kumpulan data kami minggu ini memiliki 14 atribut dan setiap kolom memiliki nilai yang sangat berbeda. Satu kolom memiliki nilai di bawah 1 sementara kolom lainnya memiliki nilai yang terdiri dari tiga hingga empat digit penuh. Kami mempelajari normalisasi minggu lalu dan sepertinya Anda seharusnya menormalkan data ketika mereka …
10 r  beginner 

2
Memperkuat Hash Sensitifitas Lokalitas
Saya mencoba membangun hash sensitif lokalitas kosinus sehingga saya dapat menemukan kandidat pasangan barang yang serupa tanpa harus membandingkan setiap pasangan yang memungkinkan. Saya memilikinya pada dasarnya bekerja, tetapi sebagian besar pasangan dalam data saya tampaknya memiliki kesamaan cosinus dalam kisaran -0,2 hingga +0,2 jadi saya mencoba untuk memotongnya dengan …

2
Berapa banyak waktu yang diperlukan untuk mengklasifikasi scikit?
Saya berencana untuk menggunakan classifier scikit linear support vector machine (SVM) untuk klasifikasi teks pada corpus yang terdiri dari 1 juta dokumen berlabel. Apa yang saya rencanakan untuk lakukan adalah, ketika pengguna memasukkan beberapa kata kunci, classifier pertama akan mengklasifikasikannya dalam kategori, dan kemudian pencarian informasi berikutnya akan terjadi di …

2
Keturunan gradien stokastik berdasarkan pada operasi vektor?
mari kita asumsikan bahwa saya ingin melatih algoritma regresi penurunan gradien stokastik menggunakan dataset yang memiliki sampel N. Karena ukuran dataset sudah diperbaiki, saya akan menggunakan kembali data T kali. Pada setiap iterasi atau "zaman", saya menggunakan masing-masing sampel pelatihan tepat satu kali setelah secara acak memesan kembali seluruh rangkaian …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.