Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Konvensi notasi untuk variabel acak dan distribusinya
Saya menjadi bingung pada notasi makna yang tepat, serta makna beberapa notasi yang berkaitan dengan variabel acak dan distribusinya. Di bawah ini, saya akan mencantumkan hal-hal yang saya pikir benar, serta hal-hal yang tidak saya mengerti, dan saya akan sangat menyukai masukan / koreksi. Saya telah memberi label setiap poin …

3
Pas multivariat, spline kubik alami
catatan: tanpa jawaban yang benar setelah sebulan, saya telah memposting ulang ke SO Latar Belakang Saya punya model, fff , di mana Y=f(X)Y=f(X)Y=f(\textbf{X}) XX\textbf{X} adalahmatriksn×mn×mn \times m sampel dariparametermmm danYYY adalahvektorn×1n×1n \times 1 dari output model. fff adalah komputasi yang intensif, jadi saya ingin memperkirakanfff menggunakan spline kubik multivariat melalui(X,Y)(X,Y)(X,Y) …

2
Menghitung persentil ke-95: Membandingkan distribusi normal, R Quantile, dan pendekatan Excel
Saya mencoba menghitung persentil ke-95 pada dataset berikut. Saya menemukan beberapa referensi online untuk melakukannya. Pendekatan 1: Berdasarkan data sampel Yang pertama memberitahu saya untuk mendapatkan TOP 95 Percentdataset dan kemudian memilih MINatau AVGdari set yang dihasilkan. Melakukannya untuk dataset berikut memberi saya: AVG: 29162 MIN: 0 Pendekatan 2: Asumsikan …
17 r  dataset  quantiles  sql 


5
Untuk klasifikasi dengan Random Forests di R, bagaimana seharusnya seseorang menyesuaikan ukuran kelas yang tidak seimbang?
Saya mengeksplorasi berbagai metode klasifikasi untuk proyek yang sedang saya kerjakan, dan saya tertarik untuk mencoba Hutan Acak. Saya mencoba mendidik diri sendiri seiring berjalannya waktu, dan akan menghargai setiap bantuan yang diberikan oleh komunitas CV. Saya telah membagi data saya ke dalam set pelatihan / tes. Dari percobaan dengan …


2
Bagaimana cara menginterpretasikan Exp (B) dalam regresi Cox?
Saya seorang mahasiswa kedokteran yang mencoba memahami statistik (!) - jadi harap bersikap lembut! ;) Saya sedang menulis esai yang mengandung cukup banyak analisis statistik termasuk analisis survival (Kaplan-Meier, Log-Rank dan regresi Cox). Saya menjalankan regresi Cox pada data saya mencoba mencari tahu apakah saya dapat menemukan perbedaan yang signifikan …

5
Bagaimana cara menambahkan komponen periodik ke model regresi linier?
Saya memiliki beberapa data frekuensi kumulatif. Garis sepertinya cocok dengan data dengan sangat baik, tetapi ada goyangan siklik / periodik di baris. Saya ingin memperkirakan kapan frekuensi kumulatif akan mencapai nilai tertentu c . Ketika saya memetakan nilai residu vs pas, saya mendapatkan perilaku sinusoidal yang indah.y=ax+by=ax+by=ax+bccc Sekarang, untuk menambahkan …

4
Apa pro dan kontra dari menggunakan metode logrank vs Mantel-Haenszel untuk menghitung Rasio Bahaya dalam analisis survival?
Salah satu cara untuk meringkas perbandingan dua kurva survival adalah dengan menghitung rasio bahaya (HR). Ada (setidaknya) dua metode untuk menghitung nilai ini. Metode logrank. Sebagai bagian dari perhitungan Kaplan-Meier, hitung jumlah peristiwa yang diamati (kematian, biasanya) di masing-masing kelompok ( , dan O b ), dan jumlah peristiwa yang …
17 survival  hazard 

2
Memahami uji-t untuk regresi linier
Saya mencoba mencari cara untuk melakukan beberapa pengujian hipotesis pada regresi linier (hipotesis nol menjadi tidak ada korelasi). Setiap panduan dan halaman tentang subjek yang saya temui tampaknya menggunakan uji-t. Tapi saya tidak mengerti apa arti uji-t untuk regresi linier sebenarnya. Uji-t, kecuali saya memiliki pemahaman yang salah atau model …

2
Mengapa Lasso atau ElasticNet berkinerja lebih baik daripada Ridge ketika fitur-fiturnya dikorelasikan
Saya memiliki 150 fitur, dan banyak di antaranya sangat berkorelasi satu sama lain. Tujuan saya adalah untuk memprediksi nilai variabel diskrit, yang kisarannya 1-8 . Ukuran sampel saya adalah 550 , dan saya menggunakan validasi silang 10 kali lipat . AFAIK, di antara metode regularisasi (Lasso, ElasticNet, dan Ridge), Ridge …


3
Bayesian memperbarui dengan data baru
Bagaimana cara menghitung posterior dengan N ~ (a, b) setelah mengamati n titik data? Saya berasumsi bahwa kita harus menghitung mean sampel dan varians dari titik data dan melakukan semacam perhitungan yang menggabungkan posterior dengan sebelumnya, tapi saya tidak begitu yakin seperti apa rumus kombinasi itu.



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.