Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Pengurangan dimensi yang diawasi
Saya memiliki satu set data yang terdiri dari sampel berlabel 15K (dari 10 grup). Saya ingin menerapkan pengurangan dimensi menjadi 2 dimensi, yang akan mempertimbangkan pengetahuan label. Ketika saya menggunakan teknik reduksi dimensionalitas tanpa pengawasan "standar" seperti PCA, plot sebar tampaknya tidak ada hubungannya dengan label yang dikenal. Apakah yang …

1
Apa komponen utama yang "diputar" dan "tidak diputar", mengingat bahwa PCA selalu memutar sumbu koordinat?
Sejauh yang saya mengerti, komponen utama diperoleh dengan memutar sumbu koordinat untuk menyelaraskannya dengan arah varian maksimum. Namun demikian, saya terus membaca tentang "komponen utama yang tidak diputar" dan perangkat lunak statistik saya (SAS) memberi saya komponen utama yang diputar-varimax serta komponen yang tidak diputar. Di sini saya bingung: ketika …

1
Cara melatih lapisan deep-network LSTM
Saya menggunakan jaringan lstm dan umpan-maju untuk mengklasifikasikan teks. Saya mengonversi teks menjadi vektor satu-panas dan mengumpankan masing-masing ke dalam lstm sehingga saya dapat meringkasnya sebagai satu representasi. Lalu saya memberinya makan ke jaringan lain. Tapi bagaimana cara melatih lstm? Saya hanya ingin urutan mengklasifikasikan teks - haruskah saya memberinya …

3
Bagaimana tepatnya jaringan saraf convolutional menggunakan konvolusi menggantikan multiplikasi matriks?
Saya sedang membaca Buku Yoshua Bengio tentang pembelajaran mendalam dan dikatakan di halaman 224: Jaringan konvolusional hanyalah jaringan saraf yang menggunakan konvolusi sebagai pengganti perkalian matriks umum dalam setidaknya satu lapisannya. Namun, saya tidak 100% yakin bagaimana "mengganti perkalian matriks dengan konvolusi" dalam arti yang tepat secara matematis. Yang benar-benar …


1
Apa itu statistik F parsial?
Apa itu statistik F parsial? Apakah itu sama dengan parsial F-test? Kapan Anda menghitung statistik F parsial? Saya berasumsi bahwa ini ada hubungannya dengan membandingkan model regresi, tapi saya tidak mengikuti sesuatu (?)

1
Apakah pemasangan model Cox dengan interaksi strata dan strata-kovariat berbeda dari pemasangan dua model Cox?
Dalam Regresi Modeling Strategies oleh Harrell (edisi kedua) ada bagian (S. 20.1.7) membahas model Cox termasuk interaksi antara kovariat yang efek utamanya pada kelangsungan hidup yang ingin kita perkirakan juga (umur dalam contoh di bawah) dan kovariat yang efek utamanya tidak ingin kami perkirakan (jenis kelamin dalam contoh di bawah). …

1
Apa varian jangka panjangnya?
Bagaimana perbedaan jangka panjang dalam bidang analisis deret waktu didefinisikan? Saya mengerti itu digunakan dalam hal ada struktur korelasi dalam data. Jadi proses stokastik kami tidak akan menjadi keluarga X1,X2…X1,X2…X_1, X_2 \dots iid variabel acak tetapi hanya didistribusikan secara identik? Bisakah saya memiliki referensi standar sebagai pengantar konsep dan kesulitan …

3
Apakah Random Forest dan Boosting parametrik atau non-parametrik?
Dengan membaca pemodelan statistik yang sangat baik : Dua budaya (Breiman 2001) , kita dapat mengambil semua perbedaan antara model statistik tradisional (misalnya, regresi linier) dan algoritma pembelajaran mesin (misalnya, Bagging, Random Forest, Boosted trees ...). Breiman mengkritik model data (parametrik) karena didasarkan pada asumsi bahwa pengamatan dihasilkan oleh model …


1
Sebuah pertanyaan terkait dengan Borel-Cantelli Lemma
catatan: Borel-Cantelli Lemma mengatakan itu ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 Kemudian, jika∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty dengan menggunakan Borel-Cantelli Lemma Saya ingin menunjukkan itu pertama, limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n) ada dan …


1
Penaksir yang bias untuk regresi mencapai hasil yang lebih baik daripada yang tidak bias dalam Error In Variables Model
Saya sedang mengerjakan beberapa data sintaksis untuk model Error In Variable untuk beberapa penelitian. Saat ini saya memiliki satu variabel independen, dan saya berasumsi saya tahu varians untuk nilai sebenarnya dari variabel dependen. Jadi, dengan informasi ini, saya dapat mencapai estimator yang tidak bias untuk koefisien variabel dependen. Model: y=0,5x-10+e2x~=x+e1x~=x+e1\tilde{x} …

1
Parameter vs variabel laten
Saya telah bertanya tentang ini sebelumnya dan benar-benar telah berjuang dengan mengidentifikasi apa yang membuat parameter model dan apa yang membuatnya menjadi variabel laten. Jadi melihat berbagai utas tentang topik ini di situs ini, perbedaan utamanya adalah: Variabel laten tidak diamati tetapi memiliki distribusi probabilitas terkait dengan mereka karena mereka …

1
Aditif Kesalahan atau Kesalahan Multiplikasi?
Saya relatif baru dalam hal statistik dan akan sangat menghargai bantuan untuk memahami ini dengan lebih baik. Di bidang saya ada model bentuk yang umum digunakan: Pt= PHai( Vt)αPt=PHai(Vt)αP_t = P_o(V_t)^\alpha Ketika orang-orang mencocokkan model dengan data, mereka biasanya linearkan dan cocok dengan yang berikut catatan(Pt) = log(PHai) +α log(Vt) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.