Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Siapa yang pertama kali menggunakan / menemukan nilai-p?
Saya mencoba untuk menulis serangkaian posting blog pada nilai-p dan saya pikir akan menarik untuk kembali ke tempat semuanya dimulai - yang tampaknya merupakan makalah Pearson tahun 1900. Jika Anda terbiasa dengan kertas itu, Anda akan ingat bahwa ini mencakup pengujian good-of-fit. Pearson agak longgar dengan bahasanya ketika datang ke …

13
Apa intuisi di balik rumus untuk probabilitas bersyarat?
Rumus untuk probabilitas bersyarat dari terjadi mengingat bahwa telah terjadi adalah:B P ( AAA\text{A}BB\text{B}P(A | B)=P(A∩B)P(B).P(A | B)=P(A∩B)P(B). P\left(\text{A}~\middle|~\text{B}\right)=\frac{P\left(\text{A} \cap \text{B}\right)}{P\left(\text{B}\right)}. Buku teks saya menjelaskan intuisi di balik ini dalam hal diagram Venn. Mengingat bahwa telah terjadi, satu-satunya cara untuk terjadi adalah untuk peristiwa jatuh di persimpangan dan .A A …


2
Apa perbedaan antara sensor dan pemotongan?
Dalam buku Model Statistik dan Metode untuk Data Seumur Hidup , ada tertulis: Penyensoran: Ketika pengamatan tidak lengkap karena beberapa penyebab acak. Pemotongan: Ketika sifat pengamatan yang tidak lengkap adalah karena proses seleksi sistematis yang melekat pada desain penelitian. Apa yang dimaksud dengan "proses seleksi sistematis yang melekat pada desain …

2
Apakah ada interval kepercayaan nonparametrik yang dapat diandalkan untuk rata-rata distribusi yang miring?
Distribusi yang sangat miring seperti log-normal tidak menghasilkan interval kepercayaan bootstrap yang akurat. Berikut adalah contoh yang menunjukkan bahwa area ekor kiri dan kanan jauh dari ideal 0,025 tidak peduli metode bootstrap apa pun yang Anda coba di R: require(boot) n <- 25 B <- 1000 nsim <- 1000 set.seed(1) …

2
Pembelajaran terawasi, pembelajaran tanpa pengawasan dan pembelajaran penguatan: Dasar-dasar alur kerja
Pembelajaran terawasi 1) Manusia membangun classifier berdasarkan input dan output data 2) Pengklasifikasi tersebut dilatih dengan serangkaian data pelatihan 3) Klasifikasi itu diuji dengan serangkaian data uji 4) Penempatan jika output memuaskan Untuk digunakan ketika, "Saya tahu cara mengklasifikasikan data ini, saya hanya perlu Anda (pengklasifikasi) untuk mengurutkannya." Titik metode: …

3
Analisis Kelas Laten vs. Analisis Cluster - perbedaan inferensi?
Apa perbedaan dalam kesimpulan yang dapat dibuat dari analisis kelas laten (LCA) versus analisis cluster? Apakah benar bahwa LCA mengasumsikan variabel laten yang mendasari yang menimbulkan kelas, sedangkan analisis cluster adalah deskripsi empiris atribut berkorelasi dari algoritma clustering? Tampaknya dalam ilmu sosial, LCA telah mendapatkan popularitas dan dianggap lebih unggul …

7
Inferensi vs estimasi?
Apa perbedaan antara "inferensi" dan "estimasi" di bawah konteks pembelajaran mesin ? Sebagai seorang pemula, saya merasa bahwa kita menyimpulkan variabel acak dan memperkirakan parameter model. Apakah pemahaman saya ini benar? Jika tidak, apa perbedaan sebenarnya, dan kapan saya harus menggunakan yang mana? Juga, yang mana adalah sinonim dari "belajar"?

2
Jaringan saraf convolusional: Bukankah neuron sentral terlalu terwakili dalam output?
[Pertanyaan ini juga diajukan pada stack overflow] Pertanyaan singkatnya Saya sedang mempelajari jaringan saraf convolutional, dan saya percaya bahwa jaringan ini tidak memperlakukan setiap input neuron (pixel / parameter) secara setara. Bayangkan kita memiliki jaringan yang dalam (banyak lapisan) yang menerapkan konvolusi pada beberapa gambar input. Neuron di "tengah" gambar …


6
Jika 'korelasi tidak menyiratkan sebab-akibat', maka jika saya menemukan korelasi yang signifikan secara statistik, bagaimana saya bisa membuktikan kausalitas?
Saya mengerti bahwa korelasi bukanlah sebab-akibat . Misalkan kita mendapatkan korelasi tinggi antara dua variabel. Bagaimana Anda memeriksa apakah korelasi ini sebenarnya karena sebab akibat? Atau, dalam kondisi apa, tepatnya, dapatkah kita menggunakan data eksperimental untuk menyimpulkan hubungan sebab akibat antara dua atau lebih variabel?

2
Apakah distribusi kuasi-binomial (dalam konteks GLM)?
Saya berharap seseorang dapat memberikan gambaran intuitif tentang apa distribusi quasibinomial dan apa fungsinya. Saya sangat tertarik pada poin-poin ini: Bagaimana kuasibinomial berbeda dengan distribusi binomial. Ketika variabel respon adalah proporsi (nilai contoh termasuk 0,23, 0,11, 0,78, 0,98), model quasibinomial akan berjalan dalam R tetapi model binomial tidak akan. Mengapa …


9
Mengapa menggunakan model koreksi kesalahan vektor?
Saya bingung tentang Vector Error Correction Model ( VECM ). Latar belakang teknis: VECM menawarkan kemungkinan untuk menerapkan Vector Autoregressive Model ( VAR ) ke seri waktu multivarian terintegrasi. Dalam buku teks mereka menyebutkan beberapa masalah dalam menerapkan VAR ke deret waktu terintegrasi, yang paling penting adalah yang disebut regresi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.