Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

3
Komputasi paralel dan terdistribusi
Apa perbedaan antara komputasi paralel dan terdistribusi? Ketika datang ke skalabilitas dan efisiensi, sangat umum untuk melihat solusi berurusan dengan perhitungan dalam kelompok mesin, dan kadang-kadang disebut sebagai pemrosesan paralel, atau sebagai pemrosesan terdistribusi. Dengan cara tertentu, perhitungannya tampaknya selalu paralel, karena ada hal-hal yang berjalan bersamaan. Tetapi apakah perhitungan …

1
propagasi kembali di CNN
Saya memiliki CNN berikut: Saya mulai dengan gambar input berukuran 5x5 Kemudian saya menerapkan konvolusi menggunakan kernel 2x2 dan melangkah = 1, yang menghasilkan fitur peta ukuran 4x4. Lalu saya menerapkan 2x2 max-pooling dengan stride = 2, yang mengurangi fitur map menjadi ukuran 2x2. Kemudian saya menerapkan sigmoid logistik. Kemudian …

5
Prediksi kesamaan kalimat
Saya mencari untuk memecahkan masalah berikut: Saya memiliki satu set kalimat sebagai dataset saya, dan saya ingin dapat mengetikkan kalimat baru, dan menemukan kalimat yang paling mirip dengan yang ada di dataset. Contohnya akan terlihat seperti: Kalimat baru: " I opened a new mailbox" Prediksi berdasarkan dataset: Sentence | Similarity …

1
Apa keuntungan menjaga ukuran bets menjadi kekuatan 2?
Sementara melatih model dalam pembelajaran mesin, mengapa kadang-kadang menguntungkan untuk menjaga ukuran bets menjadi kekuatan 2? Saya pikir akan lebih baik menggunakan ukuran yang paling pas di memori GPU / RAM Anda. Jawaban ini mengklaim bahwa untuk beberapa paket, kekuatan 2 lebih baik sebagai ukuran batch. Dapatkah seseorang memberikan penjelasan …

2
Mengelompokkan pengunjung unik berdasarkan agen pengguna, ip, session_id
Diberikan data akses situs web dalam formulir session_id, ip, user_agent, dan cap waktu opsional, mengikuti kondisi di bawah ini, bagaimana cara terbaik Anda mengelompokkan sesi menjadi pengunjung unik? session_id: adalah id yang diberikan kepada setiap pengunjung baru. Itu tidak kedaluwarsa, namun jika pengguna tidak menerima cookie / menghapus cookie / …
15 clustering 

6
Keras - Mentransfer pembelajaran - mengubah bentuk tensor input
Posting ini tampaknya menunjukkan bahwa apa yang ingin saya capai tidak mungkin. Namun, saya tidak yakin dengan ini - mengingat apa yang telah saya lakukan, saya tidak melihat mengapa apa yang ingin saya lakukan tidak dapat dicapai ... Saya memiliki dua dataset gambar di mana satu memiliki gambar bentuk (480, …
15 keras 

4
Pohon keputusan vs. KNN
Dalam kasus apa lebih baik menggunakan pohon Keputusan dan kasus lainnya KNN? Mengapa menggunakan salah satunya dalam kasus tertentu? Dan yang lainnya dalam kasus yang berbeda? (Dengan melihat fungsinya, bukan pada algoritma) Adakah yang punya penjelasan atau referensi tentang ini?



2
Bagaimana cara kerja SelectKBest?
Saya melihat tutorial ini: https://www.dataquest.io/mission/75/improving-your-submission Pada bagian 8, menemukan fitur terbaik, itu menunjukkan kode berikut. import numpy as np from sklearn.feature_selection import SelectKBest, f_classif predictors = ["Pclass", "Sex", "Age", "SibSp", "Parch", "Fare", "Embarked", "FamilySize", "Title", "FamilyId"] # Perform feature selection selector = SelectKBest(f_classif, k=5) selector.fit(titanic[predictors], titanic["Survived"]) # Get the raw …


1
PyTorch vs. Tensorflow bersemangat
Google baru-baru ini termasuk dalam tensorflow nightly membangun mode Eager -nya , API penting untuk mengakses kemampuan komputasi tensorflow. Bagaimana tensorflow ingin dibandingkan dengan PyTorch? Beberapa aspek yang dapat memengaruhi perbandingan dapat: Keuntungan dan kerugian dari keinginan karena warisan grafik statis (misalnya nama dalam node). Keterbatasan intrinsik salah satu dari …

3
GAN (jaringan permusuhan generatif) mungkin untuk teks juga?
Apakah GAN - jaringan permusuhan generatif - baik hanya untuk gambar, atau dapat digunakan untuk teks juga? Seperti, latih jaringan untuk menghasilkan teks yang bermakna dari ringkasan. UPD - kutipan dari penemu GAN Ian Goodfellow. GAN belum diterapkan ke NLP karena GAN hanya didefinisikan untuk data bernilai riil. ( 2016 …
14 gan 


1
Apakah pengambilan sampel bertingkat diperlukan (hutan acak, Python)?
Saya menggunakan Python untuk menjalankan model hutan acak pada dataset tidak seimbang saya (variabel target adalah kelas biner). Ketika membagi dataset pelatihan dan pengujian, saya kesulitan apakah akan menggunakan pengambilan sampel bertingkat (seperti kode yang ditunjukkan) atau tidak. Sejauh ini, saya mengamati dalam proyek saya bahwa kasus bertingkat akan mengarah …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.