Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Menggabungkan data dari berbagai sumber
Saya ingin menggabungkan data dari berbagai sumber. Katakanlah saya ingin memperkirakan properti kimia (misalnya koefisien partisi ): Saya memiliki beberapa data empiris, bervariasi karena kesalahan pengukuran di sekitar rata-rata. Dan, kedua, saya memiliki model yang memperkirakan perkiraan dari informasi lain (model juga memiliki beberapa ketidakpastian). Bagaimana saya bisa menggabungkan kedua …

1
Distribusi hasil bagi Rayleigh
Untuk proyek penelitian saya perlu menemukan nilai yang diharapkan dari hasil bagi Rayleigh secara umum: E[wTAw / wTBw].E[wTAw / wTBw].E\,[w^T A w \ / \ w^T B w].Berikut A dan B adalah positif pasti deterministik p x p matriks kovarians, dan w mengikuti distribusi multivariat dengan garis-garis ketinggian melingkar (katakanlah, …

2
Jumlah variabel acak terpotong normal
Misalkan saya punya nnn variabel acak normal independen X1∼ N (μ1,σ21)X2∼ N (μ2,σ22)⋮Xn∼ N (μn,σ2n)X1∼N(μ1,σ12)X2∼N(μ2,σ22)⋮Xn∼N(μn,σn2)X_1 \sim \mathrm{N}(\mu_1, \sigma_1^2)\\X_2 \sim \mathrm{N}(\mu_2, \sigma_2^2)\\\vdots\\X_n \sim \mathrm{N}(\mu_n, \sigma_n^2) dan . Bagaimana saya menandai kerapatan jika distribusi setiap masing -masing terpotong ke dalam ? Dengan kata lain, saya mengambil sampel dari distribusi normal independen, membuang …

2
Regresi Logistik Ordinal dengan Fungsi Tautan yang Berbeda
Pertimbangkan variabel hasil yang memiliki empat kategori terurut yang jelas untuknya. Ini tampaknya seperti penggunaan regresi logistik ordinal yang baik untuk memperkirakan Odds Ratios untuk efek kovariat pada memindahkan subjek satu "langkah" menaiki tangga. Namun subjeknya tersebar merata di seluruh kategori, sehingga muncul pertanyaan: Apakah "asumsi hasil yang langka" untuk …

1
Kesalahan dalam menyesuaikan model regresi kuantil yang disensor
Saya memiliki hasil dengan sensor yang benar seperti ini: y<-c(rep(2.83,3), rep(3.17,4), rep(3.83,4), rep(4.17,5), rep(4.83,8), rep(5.5,3), rep(7.17,5), rep(8.17,7), rep(8.83,12), rep(9.5, 12), rep(9.83,17), rep(10.17,30), rep(10.50,100)) di mana y=10.5nilai sensor benar. Kemudian, saya akan mencoba menggunakan quantreg::crqagar sesuai dengan model regresi kuantil yang disensor dan mulai dengan variabel intervensi biner: set.seed(123) require(quantreg) yc<-rep(10.5, …

1
Bagaimana menemukan kepadatan dari fungsi karakteristik?
Distribusi memiliki fungsi karakteristik ϕ(t)=(1−t2/2)exp(−t2/4), −∞<t<∞ϕ(t)=(1−t2/2)exp⁡(−t2/4), −∞<t<∞\phi(t) = (1-t^2/2)\exp(-t^2/4),\ -\infty \lt t \lt \infty Tunjukkan bahwa distribusi benar - benar kontinu dan tulis fungsi kepadatan distribusi. Mencoba: ∫∞−∞|(1−t2/2)exp(−t2/4)|dt=(−2/t)(1−t2/2)exp(−t2/4)−2exp(−t2/4)|0−∞∫−∞∞|(1−t2/2)exp⁡(−t2/4)|dt=(−2/t)(1−t2/2)exp⁡(−t2/4)−2exp⁡(−t2/4)|−∞0\int_{-\infty}^{\infty}|(1-t^2/2)\exp(-t^2/4)|dt =(-2/t)(1-t^2/2)\exp(-t^2/4)-2\exp(-t^2/4)|_{-\infty}^{0} Hasil serupa untuk karena kuadrat.[0,∞][0,∞][0,\infty]ttt Saya tidak yakin saya melakukan integrasi dengan benar, tetapi jika saya dapat menunjukkan bahwa nilai absolut …

2
Apa pembenaran untuk diskritisasi variabel kontinu tanpa pengawasan?
Sejumlah sumber menunjukkan bahwa ada banyak konsekuensi negatif dari diskritisasi (kategorisasi) variabel kontinu sebelum analisis statistik (sampel referensi [1] - [4] di bawah). Sebaliknya [5] menunjukkan bahwa beberapa teknik pembelajaran mesin diketahui menghasilkan hasil yang lebih baik ketika variabel kontinyu didiskritisasi (juga mencatat bahwa metode diskritisasi yang diawasi berperforma lebih …


1
Komputasi bobot probabilitas terbalik - estimasi kepadatan bersyarat (multivarian)?
Versi umum: Saya perlu memperkirakan f(A|X)f(A|X)f(A | X) dimana AAA dan XXXkontinu dan multivarian. Saya lebih suka melakukannya secara nonparametrik karena saya tidak memiliki bentuk fungsional yang baik dalam pikiran danf^(A|X)f^(A|X)\hat{f}(A | X)perlu sesuatu seperti tidak bias. Saya ingin menggunakan penduga kepadatan kernel bersyarat, tetapi saya sadar saya perlu mengukurXXXpertama. …

1
Mengapa antara dua variabel mewakili proporsi varian bersama?
Pertama, saya menghargai bahwa diskusi tentang umumnya memancing penjelasan tentang (yaitu, koefisien determinasi dalam regresi). Masalah yang ingin saya jawab adalah menggeneralisasikan hal itu pada semua contoh korelasi antara dua variabel.r2r2r^2R2R2R^2 Jadi, saya agak bingung tentang varian yang dibagikan untuk sementara waktu. Saya punya beberapa penjelasan yang ditawarkan tetapi semuanya …


3
Validasi internal melalui bootstrap: Kurva ROC apa yang akan ditampilkan?
Saya menggunakan pendekatan bootstrap untuk validasi internal model multivariat yang dibangun dengan regresi logistik standar ATAU jaring elastis. Prosedur yang saya gunakan adalah sebagai berikut: 1) membangun model menggunakan seluruh dataset, mendapatkan nilai prediksi, dan menghitung AUC (AUC_ap, jelas) 2) menghasilkan 100-500 sampel bootstrap yang berasal dari dataset asli 3) …

1
Spesifikasi data panel
Saya mencoba mencari tahu spesifikasi terbaik untuk dataset saya. Saya mencoba menyelidiki efektivitas zona ekonomi khusus di Polandia dalam arti pertumbuhan ekonomi dalam tiga model panel data yang sama untuk variabel yang dijelaskan: a) tingkat pengangguran terdaftar b) PDB per kapita c) pembentukan modal tetap bruto per kapita . Data …

2
Apakah distribusi pengambilan sampel untuk sampel kecil dari populasi normal normal atau terdistribusi? [Tutup]
Ditutup . Pertanyaan ini membutuhkan detail atau kejelasan . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Tambahkan detail dan jelaskan masalahnya dengan mengedit posting ini . Ditutup 5 tahun yang lalu . Jika saya tahu bahwa populasi terdistribusi secara normal, dan kemudian mengambil sampel kecil dari populasi ini, …

2
Pengelompokan data yang memiliki campuran variabel kontinu dan kategori
Saya memiliki data yang mewakili beberapa aspek perilaku manusia. Saya ingin mengelompokkannya (tanpa pengawasan) ke dalam beberapa profil perilaku. sekarang, beberapa variabel saya adalah kategorikal (dengan 2 kategori atau lebih), dan ada pula yang kontinu (sebagian besar adalah persentase). Beberapa variabel bahkan lebih kompleks karena satu kategori memiliki kontinu lebih …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.