Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Algoritma EM Praktekkan Masalah
Ini adalah masalah latihan untuk ujian tengah semester. Masalahnya adalah contoh algoritma EM. Saya mengalami masalah dengan bagian (f). Saya membuat daftar bagian (a) - (e) untuk penyelesaian dan jika saya melakukan kesalahan sebelumnya. Misalkan X1,…,XnX1,…,XnX_1,\ldots,X_n menjadi variabel acak eksponensial independen dengan laju θθ\theta . Sayangnya, nilai aktual XXXtidak diamati, …


4
Teknik non-ortogonal analog dengan PCA
Misalkan saya memiliki dataset titik 2D dan saya ingin mendeteksi arah semua maxima lokal dari varians dalam data, misalnya: PCA tidak membantu dalam situasi ini karena merupakan dekomposisi ortogonal dan oleh karena itu tidak dapat mendeteksi kedua garis yang saya indikasikan dengan warna biru, tetapi outputnya mungkin terlihat seperti yang …

2
Analisis kelangsungan hidup di mana kovariat tidak tersedia untuk data yang disensor
Saya melihat waktu yang dibutuhkan oleh hakim untuk mencapai keputusan. Setiap hakim menilai sejumlah pelamar dan dapat menyetujui atau tidak menyetujui aplikasi. Kasus ini selesai ketika hakim menyampaikan laporannya, yang mungkin beberapa saat setelah sidang. Sejumlah kasus masih terbuka pada akhir periode penelitian. Saya ingin memperkirakan waktu rata-rata yang diperlukan …
9 survival 

4
Bagaimana cara melakukan pembelajaran mesin multivarian? (memprediksi beberapa variabel dependen)
Saya mencari untuk memprediksi kelompok item yang akan dibeli seseorang ... yaitu, saya memiliki beberapa variabel dependen colinear. Daripada membangun 7 atau lebih model independen untuk memprediksi probabilitas seseorang membeli masing-masing dari 7 item, dan kemudian menggabungkan hasilnya, metode apa yang harus saya perhatikan untuk memiliki satu model yang menjelaskan …

3
Seleksi k knot dalam regresi smoothing spline yang setara dengan variabel k?
Saya sedang mengerjakan model biaya prediksi di mana usia pasien (kuantitas bilangan bulat yang diukur dalam tahun) adalah salah satu variabel prediktor. Hubungan nonlinear yang kuat antara usia dan risiko rawat inap jelas: Saya sedang mempertimbangkan penghalusan regresi penghalusan hukuman untuk usia pasien. Menurut The Elements of Statistics Learning (Hastie …


2
Dapatkah interval kepercayaan yang sempit di sekitar efek non-signifikan memberikan bukti untuk nol?
Jelas keliru untuk menganggap bahwa kegagalan untuk menolak nol menyiratkan bahwa nol itu benar. Tetapi dalam kasus di mana nol tidak ditolak dan interval kepercayaan yang sesuai (CI) sempit dan berpusat di sekitar 0, apakah ini tidak memberikan bukti untuk nol? Saya memiliki dua pemikiran: Ya, dalam praktiknya ini akan …

4
Apa itu "distribusi yang sepenuhnya positif"?
Saya membaca "Kausalitas" Judea Pearl (edisi kedua 2009) dan di bagian 1.1.5 Independensi Bersyarat dan Graphoids, ia menyatakan: Berikut ini adalah daftar (sebagian) properti yang dipenuhi oleh hubungan independensi bersyarat (X_ || _Y | Z). Simetri: (X_ || _ Y | Z) ==> (Y_ || _X | Z). Dekomposisi: (X_ …


1
Kapan aturan penilaian yang tepat merupakan estimasi generalisasi yang lebih baik dalam pengaturan klasifikasi?
Pendekatan khas untuk memecahkan masalah klasifikasi adalah mengidentifikasi kelas model kandidat, dan kemudian melakukan pemilihan model menggunakan beberapa prosedur seperti validasi silang. Biasanya seseorang memilih model dengan akurasi tertinggi, atau beberapa fungsi terkait yang menyandikan informasi spesifik masalah, seperti .FβFβ\text{F}_\beta Dengan asumsi tujuan akhir adalah untuk menghasilkan classifier yang akurat …

3
Jika
Asumsikan pengaturan berikut: Biarkan Zsaya= min { ksaya, Xsaya} , I = 1 , . . . , nZsaya=min{ksaya,Xsaya},saya=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n . Juga Xsaya∼ U[ asaya, bsaya] ,Sebuahsaya, bsaya> 0Xsaya∼U[Sebuahsaya,bsaya],Sebuahsaya,bsaya>0X_i \sim U[a_i, b_i], \; a_i, b_i >0 . Selain itu ksaya= c asaya+ ( 1 - c ) …

1
Mengapa bentuk fungsional tahap 1 dalam 2SLS tidak penting?
Dalam presentasi hari ini pembicara membuat klaim di atas. Dia mengatakan bahwa bahkan jika tahap pertama tidak ditentukan, koefisien estimasi tahap kedua akan tetap valid. Sebagai mahasiswa pascasarjana yang rendah saya tidak bisa meminta penjelasan, jadi sekarang saya mohon bantuan Anda!

2
SD lebih besar dari rata-rata, skala non-negatif
Saya diberi artikel yang melaporkan penelitian yang sangat mirip dengan yang ingin dijalankan oleh lab saya. Tapi, saya perhatikan bahwa untuk variabel yang diminati, Durasi, SD lebih besar daripada rata-rata ... karena ini adalah durasi yang diukur dalam hitungan menit, itu tidak pernah bisa negatif dan ini tampaknya sangat aneh …

1
Kesetaraan AIC dan nilai-p dalam pemilihan model
Dalam komentar untuk jawaban pertanyaan ini , dinyatakan bahwa menggunakan AIC dalam pemilihan model setara dengan menggunakan p-value 0,154. Saya mencobanya di R, di mana saya menggunakan algoritma seleksi subset "terbelakang" untuk membuang variabel dari spesifikasi lengkap. Pertama, dengan secara berurutan membuang variabel dengan nilai-p tertinggi dan berhenti ketika semua …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.