Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Tren tingkat kelangsungan hidup dalam studi kasus-kontrol
Saya mengirimkan artikel yang ditolak karena cara yang tidak tepat melakukan analisis kelangsungan hidup. Wasit tidak meninggalkan detail atau penjelasan lain selain: "analisis kelangsungan hidup pada tren waktu membutuhkan cara penyensoran yang lebih canggih." Pertanyaan: Apakah risiko kematian yang berlebihan di kalangan perokok berkurang dalam beberapa dekade terakhir? Data: 25.000 …

6
Bagaimana notasi
Bagaimana notasi dibaca? Apakah X mengikuti distribusi normal? Atau X adalah distribusi normal? Atau mungkin X kira-kira normal ..X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX Bagaimana jika ada beberapa variabel yang mengikuti (atau apa pun kata-katanya) distribusi yang sama? Bagaimana ini ditulis?

1
Apakah interpretasi sparsity ini akurat?
Menurut dokumentasi removeSparseTermsfungsi dari tmpaket, inilah yang diperlukan sparsity: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor of less …

3
Mengidentifikasi fitur yang difilter setelah pemilihan fitur dengan scikit belajar
Ini kode saya untuk metode pemilihan fitur dengan Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Tetapi setelah mendapatkan X baru (variabel dependen - X_new), Bagaimana saya tahu variabel …

1
Cross memvalidasi regresi laso di R
Fungsi R cv.glm (library: boot) menghitung perkiraan kesalahan prediksi validasi silang K-fold untuk model linier umum dan mengembalikan delta. Apakah masuk akal untuk menggunakan fungsi ini untuk regresi laso (library: glmnet) dan jika demikian, bagaimana hal itu dapat dilakukan? Pustaka glmnet menggunakan cross-validation untuk mendapatkan parameter belokan terbaik, tapi saya …

3
hubungan antara
Pertanyaan yang sangat mendasar tentang regresi OLSR2R2R^2 jalankan regresi OLS y ~ x1, kami memiliki , katakanlah 0,3R2R2R^2 jalankan regresi OLS y ~ x2, kami memiliki , katakanlah 0,4R2R2R^2 sekarang kita menjalankan regresi y ~ x1 + x2, berapakah nilai R kuadrat regresi ini? Saya pikir itu jelas untuk regresi …

1
Menguji signifikansi Sharpe Ratio
Apa cara yang tepat untuk menguji signifikansi Rasio Sharpe atau Rasio Informasi? Rasio Sharpe akan didasarkan pada berbagai indeks ekuitas dan mungkin memiliki periode lihat-kembali variabel. Salah satu solusi yang saya lihat dijelaskan hanya menerapkan uji-t Student, dengan df diatur ke panjang periode melihat-kembali. Saya ragu untuk menerapkan metode di …

2
Apa itu bucketization?
Saya sudah berkeliling untuk menemukan penjelasan yang jelas tentang "emberisasi" dalam pembelajaran mesin tanpa hasil. Apa yang saya pahami sejauh ini adalah bahwa bucketisasi mirip dengan kuantisasi dalam pemrosesan sinyal digital di mana serangkaian nilai kontinu diganti dengan satu nilai diskrit. Apakah ini benar? Apa pro dan kontra (selain dampak …




3
Normal dibagi dengan
misalkan dan .W ∼ χ 2 ( s )Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) Jika dan didistribusikan secara independen maka variabel mengikuti distribusi dengan derajat kebebasan .W Y = ZZZZWWW tsY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss Saya mencari bukti dari fakta ini, sebuah referensi cukup baik jika Anda tidak ingin menuliskan argumen yang lengkap.


2
Contoh bagus bagian statistik dalam artikel jurnal akademik terapan
Saya seorang ahli biostatistik yang bekerja di bidang terapan dan saya bertanggung jawab untuk menulis bagian metode statistik untuk makalah yang saya kolaborasi. Dalam membaca banyak makalah akademis, saya telah menemukan banyak contoh bagian statistik yang ditulis dengan buruk (sebagian besar membosankan, tidak informatif, dan kurang presisi, detail, dan pemahaman …

2
Mengevaluasi distribusi prediksi posterior dalam regresi linear Bayesian
Saya bingung bagaimana cara mengevaluasi distribusi prediksi posterior untuk regresi linier Bayesian, melewati kasus dasar yang dijelaskan di sini pada halaman 3, dan disalin di bawah ini. p ( y~∣ y)=∫p(y~∣β,σ2)p(β,σ2∣y)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) Kasus dasar adalah model …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.