Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Apa keuntungan dari menumpuk banyak LSTM?
Apa keuntungannya, mengapa seseorang menggunakan banyak LSTM, ditumpuk satu demi satu, dalam jaringan yang dalam? Saya menggunakan LSTM untuk mewakili urutan input sebagai input tunggal. Jadi, begitu saya memiliki representasi tunggal itu — mengapa saya harus melewatinya lagi? Saya bertanya ini karena saya melihat ini dalam program generasi bahasa alami.

1
Apakah ada hasil yang memberikan bootstrap valid jika dan hanya jika statistiknya lancar?
Sepanjang kami menganggap statistik kami adalah fungsi dari beberapa data yang diambil dari fungsi distribusi ; fungsi distribusi empiris dari sampel kami adalah . Jadi adalah statistik yang dilihat sebagai variabel acak dan adalah versi statistik bootstrap. Kami menggunakan sebagai jarak KSθ(⋅)θ(⋅)\theta(\cdot)X1,…XnX1,…XnX_1, \ldots X_nF θ ( F ) θ ( …

1
Mengapa unit linear yang diperbaiki dianggap non-linear?
Mengapa fungsi aktivasi unit linear yang diperbaiki (ReLU) dianggap non-linear? f( x ) = maks ( 0 , x )f(x)=max(0,x) f(x) = \max(0,x) Mereka linier ketika input positif dan dari pemahaman saya untuk membuka kekuatan representatif dari jaringan yang dalam, aktivasi non-linear adalah suatu keharusan, jika tidak seluruh jaringan dapat …

5
Algoritma pembelajaran mesin untuk menangani data yang hilang
Saya mencoba mengembangkan model prediksi menggunakan data klinis dimensi tinggi termasuk nilai-nilai laboratorium. Ruang data jarang dengan sampel 5k dan 200 variabel. Idenya adalah untuk memberi peringkat variabel menggunakan metode pemilihan fitur (IG, RF dll) dan menggunakan fitur peringkat teratas untuk mengembangkan model prediksi. Sementara pemilihan fitur berjalan baik dengan …

4
Fungsi Variabel Acak Independen
Apakah klaim bahwa fungsi variabel acak independen itu sendiri independen, benar? Saya telah melihat bahwa hasil sering digunakan secara implisit dalam beberapa bukti, misalnya dalam bukti independensi antara mean sampel dan varians sampel dari distribusi normal, tetapi saya belum dapat menemukan pembenaran untuk itu. Tampaknya beberapa penulis menganggapnya seperti yang …

2
Menggambar dari distribusi Dirichlet
Katakanlah kita memiliki distribusi Dirichlet dengan parameter vektor -dimensional . Bagaimana saya bisa menggambar sampel ( vektor dimensi) dari distribusi ini? Saya membutuhkan (mungkin) penjelasan sederhana.KKKα⃗ = [α1,α2, . . . ,αK]α→=[α1,α2,...,αK]\vec\alpha = [\alpha_1, \alpha_2,...,\alpha_K]KKK

2
Intuisi di balik regresi logistik
Baru-baru ini saya mulai mempelajari pembelajaran mesin, namun saya gagal memahami intuisi di balik regresi logistik . Berikut ini adalah fakta tentang regresi logistik yang saya mengerti. Sebagai dasar untuk hipotesis kami menggunakan fungsi sigmoid . Saya mengerti mengapa hal itu merupakan pilihan yang tepat, namun mengapa itu adalah satu-satunya …

3
Bagaimana orang Bayesian membandingkan distribusi?
Jadi, saya pikir saya memiliki pemahaman yang baik tentang dasar-dasar probabilitas dan analisis statistik frequentist (dan seberapa buruk itu dapat digunakan). Dalam dunia yang sering terjadi, masuk akal untuk mengajukan pertanyaan seperti "apakah distribusi ini berbeda dari distribusi itu", karena distribusi diasumsikan nyata, obyektif dan tidak berubah (untuk situasi tertentu, …

5
Haruskah Anda membakukan variabel biner?
Saya memiliki satu set data dengan serangkaian fitur. Beberapa dari mereka adalah biner aktif atau dipecat, tidak aktif atau aktif), dan sisanya bernilai nyata, misalnya .0 = 4564.342(1=(1=(1=0=0=0=4564.3424564.3424564.342 Saya ingin mengumpankan data ini ke algoritme pembelajaran mesin, jadi saya -score semua fitur bernilai nyata. Saya mendapatkannya antara rentang dan sekitar. …

3
Kurva ROC untuk pengklasifikasi diskrit seperti SVM: Mengapa kita masih menyebutnya "kurva", bukan hanya "titik"?
Dalam diskusi: bagaimana membuat kurva roc untuk klasifikasi biner , saya pikir kebingungannya adalah "binary classifier" (yang mana setiap classifier yang memisahkan 2 kelas) adalah untuk Yang yang disebut "discrete classifier" (yang menghasilkan keluaran diskrit 0/1 seperti SVM) dan bukan keluaran kontinu seperti pengklasifikasi JST atau Bayes ... dll. Jadi, …

1
Bagaimana cara validasi silang keluar satu kali bekerja? Bagaimana cara memilih model akhir dari model yang berbeda?
Saya memiliki beberapa data dan saya ingin membangun model (katakanlah model regresi linier) dari data ini. Pada langkah berikutnya, saya ingin menerapkan Validasi Cuti-Sekali-Keluar (LOOCV) pada model jadi lihat seberapa bagus kinerjanya. Jika saya mengerti LOOCV benar, saya membangun model baru untuk setiap sampel saya (set tes) menggunakan setiap sampel …


3
Normalisasi matriks kolom-bijaksana dalam R [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 6 tahun yang lalu . Saya ingin melakukan normalisasi kolom-bijaksana dari matriks dalam R. Mengingat matriks m, saya ingin menormalkan setiap kolom dengan membagi setiap …

2
Subset vektor seri waktu R
Saya memiliki deret waktu dan saya ingin mengelompokkannya sambil menyimpannya sebagai deret waktu, menjaga awal, akhir, dan frekuensi. Misalnya, katakan saya memiliki deret waktu: > qs <- ts(101:110, start=c(2009, 2), frequency=4) > qs Qtr1 Qtr2 Qtr3 Qtr4 2009 101 102 103 2010 104 105 106 107 2011 108 109 110 …
25 r  time-series 

1
Penjelasan faktor koreksi terbatas
Saya mengerti bahwa ketika pengambilan sampel dari populasi terbatas dan ukuran sampel kami lebih dari 5% dari populasi, kita perlu melakukan koreksi pada mean sampel dan kesalahan standar menggunakan rumus ini: FPC= N- nN- 1----√FPC=N-nN-1\hspace{10mm} FPC=\sqrt{\frac{N-n}{N-1}} Di mana adalah ukuran populasi dan adalah ukuran sampel.NNNnnn Saya punya 3 pertanyaan tentang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.