Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Bagaimana saya bisa menghasilkan prediksi dari paket randomSurvivalForest di R?
Saya mencoba menggunakan randomSurvivalForestpaket Runtuk memprediksi acara berikutnya dalam serangkaian acara (menggunakan res <- predict(fit,v)), tetapi yang saya dapatkan adalah total% yang selamat dan kemudian bahaya kumulatif untuk setiap individu di res$ensemble. Bisakah saya menggunakan ini untuk memprediksi / menghasilkan nilai yang cocok dengan yang ada di dalamnya res$time?

4
Bagaimana cara membuat dataset dengan probabilitas bersyarat?
Misalkan penyakit tertentu (DDD) memiliki prevalensi 3100031000\dfrac3{1000}. Juga anggaplah suatu gejala tertentu (SSS) memiliki prevalensi (pada populasi umum = orang dengan penyakit itu D dan orang-orang tanpa penyakit itu [mungkin dengan penyakit lain, tetapi itu tidak penting]) dari 5100051000\dfrac5{1000}. Dalam penelitian sebelumnya, ditemukan bahwa probabilitas bersyaratP(S|D)=30%P(S|D)=30%P(S|D) = 30\% (probabilitas untuk …

1
Rata-rata rata-rata (rata-rata, rata-rata ...)
Pertimbangkan percobaan biologi sel berikut. Kami membandingkan berbeda perawatan sel yang dikultur. Setiap perlakuan direplikasi dalam beberapa sumur (mikrotiter) , diindeks oleh variabel . Untuk mengukur respon terhadap pengobatan dalam baik w , total F_w non-tumpang tindih mikrograf, atau bidang , dicatat. Kemudian, untuk setiap bidang f dalam sumur w …


2
Mengidentifikasi pola berurutan
Saya bekerja dengan data urutan yang merupakan daftar panjang panggilan win-api malware. Saya mencoba memasukkan masalah mengidentifikasi 'perilaku malware' ke dalam salah satu pola pencarian berurutan. Saya memperlakukan setiap panggilan api sebagai Itemet item tunggal. Jumlah item yang mungkin berbeda (panggilan api) cukup besar. Sekarang, ketika saya menerapkan algoritma SPADE …

4
Adakah saran untuk metode pengelompokan untuk jumlah klaster dan jarak non-Euclidean yang tidak diketahui?
Saya memerlukan beberapa saran untuk metode clustering (klasifikasi tanpa pengawasan) untuk proyek konsultasi. Saya mencari metode yang mudah-mudahan memiliki properti berikut: Subjek penelitian saya memiliki tiga sifat. Satu diwakili oleh matriks jarak (non-Euclidean) dan dua lainnya dalam bentuk vektor dalam ruang Euclidean. Matriks jarak berasal dari urutan dan bisa dalam …

1
Apakah hutan keputusan dan hutan acak adalah hal yang sama?
Berdasarkan jawaban pada Cross Validated, saya telah mencari menerapkan hutan acak di .NET / C # untuk mengklasifikasikan dokumen teks. Mencari di sekitar web untuk melihat apakah ada implementasi yang ada, saya menemukan algoritma untuk hutan keputusan di Alglib . Masalahnya, saya sepertinya tidak dapat menemukan sesuatu yang spesifik untuk …

1
Bootstrap dengan sejumlah pengamatan
Katakanlah saya telah mengumpulkan sejumlah kecil (N) pengamatan untuk hipotesis yang ingin saya uji. Saya bisa menggunakan metode bootstrap untuk menghasilkan distribusi sampel untuk hasil rata-rata dari pengamatan N, tapi saya khawatir bahwa model ini bisa rusak ketika N menjadi sangat kecil, memperkenalkan kesalahan ke dalam distribusi sampel itu sendiri. …
8 bootstrap 

2
k-lipat CV dari peramalan seri waktu keuangan - apakah kinerja pada lipatan terakhir lebih relevan?
Saya sedang mengerjakan model peramalan berbasis JST untuk seri waktu keuangan. Saya menggunakan validasi silang 5 kali lipat dan kinerja rata-rata begitu. Kinerja pada flip terakhir (iterasi di mana segmen terakhir dihilangkan dari pelatihan dan digunakan untuk validasi) lebih baik daripada rata-rata. Apakah ini kebetulan / bergantung pada data, atau …

2
Apa yang harus dilakukan jika keandalan antar-penilai rendah (ICC) rendah?
Latar belakang: Delapan dokter masing-masing menilai 54 pasien yang sama pada ukuran persuasif (skala 1-7 Likert). Nilai rata-rata pada ukuran persuasif pada akhirnya akan menjadi ukuran hasil percobaan saya. Reliabilitas antar penilai dikuantifikasi sebagai koefisien korelasi intraclass (ICC), menggunakan model efek acak dua arah dengan konsistensi. Sayangnya, reliabilitas antar penilai …




1
Pisahkan plot di R
Saya memiliki kumpulan data tolok ukur dan sampel di setiap tolok ukur. Saya menjalankan benchmark ini dan subsampel mereka di mesin subjek. 'Individu' yang dipelajari oleh sub-sampel adalah sama untuk setiap mesin subjek, dan tolok ukurnya sama untuk setiap mesin subjek.nnnmmmppp Bagaimana saya menjalankan ANOVA dalam R dalam situasi ini? …
8 r  anova  split-plot 


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.