Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Dekomposisi Bias-varians: istilah untuk kesalahan perkiraan kuadrat yang diharapkan dikurangi kesalahan yang tidak dapat direduksi
Hastie et al. "Unsur Pembelajaran Statistik" (2009) mempertimbangkan proses menghasilkan data dengan dan .E ( ε ) = 0 Var ( ε ) = σ 2 εY=f(X)+εY=f(X)+ε Y = f(X) + \varepsilon E(ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var(ε)=σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} Mereka menyajikan dekomposisi bias-varians berikut dari kesalahan perkiraan kuadrat yang diharapkan pada titik (hal. 223, rumus 7.9): …

3
PCA terlalu lambat ketika keduanya n, p besar: Alternatif?
Pengaturan Masalah Saya memiliki titik data (gambar) dimensi tinggi (4096), yang saya coba visualisasikan dalam 2D. Untuk tujuan ini, saya menggunakan t-sne dengan cara yang mirip dengan kode contoh berikut oleh Karpathy . The scikit-belajar dokumentasi merekomendasikan menggunakan PCA untuk pertama menurunkan dimensi dari data: Sangat disarankan untuk menggunakan metode …


4
Bagaimana cara menafsirkan kurva survival model bahaya Cox?
Bagaimana Anda menginterpretasikan kurva survival dari model hazard proporsional cox? Dalam contoh mainan ini, anggaplah kita memiliki model hazard proporsional cox pada agevariabel dalam kidneydata, dan menghasilkan kurva survival. library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() Misalnya, pada waktu , pernyataan mana yang benar? atau keduanya salah?200200200 Pernyataan …

1
Bagaimana persen tidak menambahkan hingga seratus mungkin?
Saya membaca makalah ini tentang aquaponik dan beberapa statistik tidak masuk akal berkenaan dengan persen yang tercantum. Metode apa yang memungkinkan persentasi ini ada? Hewan akuatik yang paling umum ditumbuhkan oleh persen adalah nila (69%), ikan hias (43%), lele (25%), hewan air lainnya (18%), bertengger (16%), bluegill (15%), trout ( …

1
Kesalahan yang didistribusikan secara normal dan teorema limit pusat
Dalam Econometrics Pengantar Wooldridge ada kutipan: Argumen yang membenarkan distribusi normal untuk kesalahan biasanya berjalan seperti ini: karena adalah jumlah dari banyak faktor yang tidak teramati yang mempengaruhi , kita dapat menggunakan teorema batas pusat untuk menyimpulkan bahwa memiliki perkiraan distribusi normal.uuuyyyuuu Kutipan ini berkaitan dengan salah satu asumsi model …



2
Inferensi statistik di bawah salah spesifikasi model
Saya punya pertanyaan metodologis umum. Mungkin sudah dijawab sebelumnya, tetapi saya tidak dapat menemukan utas yang relevan. Saya akan menghargai petunjuk untuk kemungkinan duplikat. ( Ini yang sangat bagus, tetapi tanpa jawaban. Ini juga memiliki semangat yang sama, bahkan dengan jawaban, tetapi yang terakhir terlalu spesifik dari sudut pandang saya. …

1
Kemungkinan proses Poisson independen menyalip yang lain
Saya telah menanyakan pertanyaan ini sebelumnya dengan cara lain di stackexchanges lainnya, mohon maaf untuk repost yang agak. Saya telah bertanya kepada profesor saya dan beberapa mahasiswa PhD tentang, tanpa jawaban yang pasti. Saya pertama-tama akan menyatakan masalah, kemudian solusi potensial saya dan masalah dengan solusi saya, sangat menyesal untuk …

4
Pelatihan jaringan saraf untuk regresi selalu memprediksi rata-rata
Saya melatih jaringan saraf convolutional sederhana untuk regresi, di mana tugasnya adalah untuk memprediksi lokasi (x, y) kotak dalam gambar, misalnya: Output dari jaringan memiliki dua node, satu untuk x, dan satu untuk y. Sisa dari jaringan adalah jaringan saraf convolutional standar. Hilangnya adalah standar kuadrat kesalahan antara posisi kotak …


1
Mengapa jarang dilaporkan di surat kabar jenis kotak yang digunakan dalam hasil Anova?
Mengikuti pengalaman singkat saya dalam statistik, tampaknya jenis jumlah kuadrat (tipe I, II, III, IV ...) yang digunakan dalam mendapatkan hasil ANOVA dapat membuat perbedaan dramatis dalam hasil tes (terutama model dengan interaksi dan hilang data). Namun saya belum melihat makalah yang melaporkannya. Kenapa begitu? Saya akan sangat menghargai jika …

2
Apa cara terbaik untuk memperkirakan efek pengobatan rata-rata dalam studi longitudinal?
Dalam studi longitudinal, hasil dari unit berulang kali diukur pada titik waktu dengan total pengukuran tetap kali (tetap = pengukuran pada unit diambil pada waktu yang sama). i t mYi tYitY_{it}sayaiitttmmm Unit ditugaskan secara acak baik untuk perawatan, , atau ke kelompok kontrol, . Saya ingin memperkirakan dan menguji efek …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.