Ilmu Data

T&J untuk profesional sains Data, spesialis Pembelajaran Mesin, dan mereka yang tertarik untuk belajar lebih banyak tentang bidang ini

3
Apakah arah tepi pada Bayes Network tidak relevan?
Hari ini, dalam sebuah ceramah dikatakan bahwa arah tepi dalam jaringan Bayes tidak terlalu penting. Mereka tidak harus mewakili kausalitas. Jelas bahwa Anda tidak dapat mengganti satu pun tepi di jaringan Bayes. Misalnya, mari dengan dan . Jika Anda akan beralih ke , maka tidak lagi bersifat acyclical dan karenanya …


1
Konvergensi dalam metode Hartigan-Wong k-means dan algoritma lainnya
Saya telah mencoba untuk memahami berbagai algoritma pengelompokan k-means terutama yang diterapkan dalam statspaket Rbahasa. Saya mengerti algoritma Lloyd dan algoritma online MacQueen. Cara saya memahaminya adalah sebagai berikut: Algoritma Lloyd: Awalnya pengamatan acak 'k' dipilih yang akan berfungsi sebagai centroid dari kelompok 'k'. Kemudian langkah-langkah berikut terjadi dalam iterasi …
10 r  clustering  k-means 

1
Analisis log server menggunakan pembelajaran mesin
Saya ditugaskan tugas ini untuk menganalisis log server dari aplikasi kami yang berisi log pengecualian, log basis data, log peristiwa, dll. Saya baru mempelajari mesin, kami menggunakan Spark dengan pencarian elastis dan Sparks MLlib (atau PredictionIO). Contoh yang diinginkan hasilnya akan dapat diprediksi berdasarkan log pengecualian yang dikumpulkan untuk dapat …

1
Teks-Klasifikasi-Masalah: Apakah Word2Vec / NN pendekatan terbaik?
Saya mencari untuk merancang suatu sistem yang diberi paragraf teks akan dapat mengkategorikannya dan mengidentifikasi konteksnya: Terlatih dengan paragraf teks yang dibuat pengguna (seperti komentar / pertanyaan / jawaban) Setiap item dalam set pelatihan akan ditandai. Jadi untuk mis ("kategori 1",, "paragraf teks") Akan ada ratusan kategori Apa yang akan …

1
Mengubah AutoEncoders
Saya baru saja membaca makalah Geoff Hinton tentang mentransformasikan autoencoder Hinton, Krizhevsky dan Wang: Transforming Auto-encoders . Dalam Jaringan Saraf Tiruan dan Pembelajaran Mesin, 2011. dan ingin bermain-main dengan sesuatu seperti ini. Tetapi setelah membacanya saya tidak bisa mendapatkan cukup detail dari koran tentang bagaimana saya benar-benar menerapkannya. Apakah ada …

2
Pembelajaran Kooperatif Penguatan
Saya sudah memiliki implementasi berfungsi untuk agen tunggal yang mengerjakan masalah penetapan harga dinamis dengan tujuan memaksimalkan pendapatan. Masalah yang sedang saya tangani, bagaimanapun, melibatkan beberapa produk berbeda yang merupakan pengganti satu sama lain, sehingga penetapan harga mereka secara dinamis dengan pembelajar mandiri tampaknya tidak benar, karena harga satu memengaruhi …

5
LSTM atau paket RNN lainnya untuk R
Saya melihat beberapa hasil yang mengesankan dari model LSTM yang memproduksi teks seperti Shakespeare. Saya bertanya-tanya apakah ada paket LSTM untuk R. Saya mencari di Google untuk itu tetapi hanya menemukan paket untuk Python dan Julia. (mungkin ada beberapa masalah kinerja yang menjelaskan mengapa program ini lebih disukai daripada R) …
10 r  neural-network  rnn 



1
Spark, secara optimal membagi RDD tunggal menjadi dua
Saya memiliki dataset besar yang perlu saya bagi menjadi beberapa kelompok sesuai dengan parameter tertentu. Saya ingin pekerjaan diproses seefisien mungkin. Saya dapat membayangkan dua cara untuk melakukannya Opsi 1 - Buat peta dari RDD asli dan filter def customMapper(record): if passesSomeTest(record): return (1,record) else: return (0,record) mappedRdd = rddIn.map(lambda …

3
Model ruang vektor cosinus tf-idf untuk menemukan dokumen serupa
Memiliki kumpulan lebih dari jutaan dokumen Untuk dokumen yang diberikan ingin mencari dokumen serupa menggunakan cosinus seperti dalam model ruang vektor d1⋅d2/(||d1||||d2||)d1⋅d2/(||d1||||d2||)d_1 \cdot d_2 / ( ||d_1|| ||d_2|| ) Semua tf telah dinormalisasi menggunakan frekuensi augmented, untuk mencegah bias terhadap dokumen yang lebih panjang seperti dalam tf-idf ini : tf(t,d)=0.5+0.5f(t,d)max{f(t,d):t∈d}tf(t,d)=0.5+0.5f(t,d)max{f(t,d):t∈d}tf(t,d)=0.5+0.5\frac{f(t,d)}{\mathrm{max}\{f(t,d): …


4
Bagaimana cara mengikis halaman web imdb?
Saya mencoba mempelajari pengikisan web menggunakan Python sendiri sebagai bagian dari upaya mempelajari analisis data. Saya mencoba untuk mengikis halaman web imdb yang url-nya adalah sebagai berikut: http://www.imdb.com/search/title?sort=num_votes,desc&start=1&title_type=feature&year=1950,2012 Saya menggunakan modul BeautifulSoup. Berikut ini adalah kode yang saya gunakan: r = requests.get(url) # where url is the above url bs …

1
Beberapa label dalam algoritma pembelajaran terawasi
Saya memiliki kumpulan teks dengan topik yang sesuai. Misalnya "A rapper Tupac was shot in LA"dan diberi label sebagai ["celebrity", "murder"]. Jadi pada dasarnya setiap vektor fitur dapat memiliki banyak label (bukan jumlah yang sama. Vektor fitur pertama dapat memiliki 3 label, kedua 1, ketiga 5). Jika saya hanya memiliki …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.