Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Mengapa regresi linier memiliki asumsi pada residual tetapi model linier umum memiliki asumsi pada respon?
Mengapa regresi linier dan Model Umum memiliki asumsi yang tidak konsisten? Dalam regresi linier, kita asumsikan residual berasal dari Gaussian Dalam regresi lain (regresi logistik, regresi racun), kami menganggap respons datang dari beberapa distribusi (binomial, poission dll). Mengapa kadang-kadang berasumsi sisa dan waktu lain menganggap pada respons? Apakah karena kita …


7
Secara intuitif memahami mengapa distribusi Poisson adalah kasus pembatas distribusi binomial
Dalam "Analisis Data" oleh DS Sivia, ada derivasi dari distribusi Poisson, dari distribusi binomial. Mereka berpendapat bahwa distribusi Poisson adalah kasus terbatas dari distribusi binomial ketika M→∞M→∞M\rightarrow\infty , di mana MMM adalah jumlah percobaan. Pertanyaan 1: Bagaimana argumen itu dimengerti secara intuitif? Pertanyaan 2: Mengapa batas besar MMMuntuk M!N!(M−N)!M!N!(M−N)!\frac{M!}{N!(M-N)!}sama dengan, …

2
Untuk model apa bias MLE jatuh lebih cepat dari varians?
θ^θ^\hat\thetaθ∗θ∗\theta^*nnn∥θ^−θ∗∥‖θ^−θ∗‖\lVert\hat\theta-\theta^*\rVertO(1/n−−√)O(1/n)O(1/\sqrt n)∥Eθ^−θ∗∥‖Eθ^−θ∗‖\lVert \mathbb E\hat\theta - \theta^*\rVert∥Eθ^−θ^∥‖Eθ^−θ^‖\lVert \mathbb E\hat\theta - \hat\theta\rVertO(1/n−−√)O(1/n)O(1/\sqrt{n}) Saya tertarik pada model yang memiliki bias yang menyusut lebih cepat dari O(1/n−−√)O(1/n)O(1/\sqrt n) , tetapi di mana kesalahan tidak menyusut pada tingkat yang lebih cepat ini karena penyimpangan masih menyusut sebagai O(1/n−−√)O(1/n)O(1/\sqrt n) . Secara khusus, saya ingin mengetahui …

3
Mengapa korelasi tidak terlalu berguna ketika salah satu variabelnya kategorikal?
Ini sedikit pemeriksaan usus, tolong bantu saya melihat apakah saya salah memahami konsep ini, dan dengan cara apa. Saya memiliki pemahaman fungsional tentang korelasi, tetapi saya merasa sedikit mengerti untuk benar-benar menjelaskan prinsip-prinsip di balik pemahaman fungsional itu. Seperti yang saya pahami, korelasi statistik (berlawanan dengan penggunaan istilah yang lebih …

3
Apakah kovarians sama dengan nol menyiratkan independensi untuk variabel acak biner?
Jika dan adalah dua variabel acak yang hanya dapat mengambil dua kemungkinan keadaan, bagaimana saya bisa menunjukkan bahwa menyiratkan independensi? Jenis ini bertentangan dengan apa yang saya pelajari kembali pada hari dimana tidak menyiratkan independensi ...XXXYYYCov(X,Y)=0Cov(X,Y)=0Cov(X,Y) = 0Cov(X,Y)=0Cov(X,Y)=0Cov(X,Y) = 0 Petunjuk mengatakan mulai dengan dan sebagai status yang memungkinkan dan …

1
Bagaimana efek acak dengan hanya 1 pengamatan mempengaruhi model campuran linier umum?
Saya memiliki satu set data di mana variabel yang ingin saya gunakan sebagai efek acak hanya memiliki satu pengamatan untuk beberapa level. Berdasarkan jawaban atas pertanyaan sebelumnya, saya telah mengumpulkan bahwa, pada prinsipnya, ini baik-baik saja. Bisakah saya memasukkan model campuran dengan subjek yang hanya memiliki 1 observasi? Model penyadapan …

1
Adakah contoh variabel bebas (kasar) yang bergantung pada nilai ekstrim?
Saya mencari contoh 2 variabel acak XXX ,YYY such that |cor(X,Y)|≈0|cor(X,Y)|≈0\newcommand{\cor}{{\rm cor}}|\cor(X,Y)| \approx 0 but when consider the tail part of the distributions, they are highly correlated. (I try to avoid 'correlated' / 'correlation' for the tail because it might not be linear). Probably use this: |cor(X′,Y′)|≫0|cor(X′,Y′)|≫0|\cor(X', Y')| \gg 0 …

3
Mengapa kembali merambat melalui waktu dalam RNN?
Dalam jaringan saraf berulang, Anda biasanya akan maju merambat melalui beberapa langkah waktu, "membuka gulungan" jaringan, dan kemudian kembali merambat melintasi urutan input. Mengapa Anda tidak hanya memperbarui bobot setelah masing-masing langkah dalam urutan? (setara dengan menggunakan panjang pemotongan 1, sehingga tidak ada yang membuka gulungan) Ini benar-benar menghilangkan masalah …



3
Distribusi apa yang mengikuti CDF normal terbalik dari variabel beta acak?
Misalkan Anda mendefinisikan: X∼Beta(α,β)X∼Beta(α,β)X\sim\mbox{Beta}(\alpha,\beta) Y∼Φ−1(X)Y∼Φ−1(X)Y\sim \Phi^{-1}(X) dimana Φ−1Φ−1\Phi^{-1} adalah kebalikan dari CDF dari distribusi normal standar . Pertanyaan saya adalah: Apakah ada distribusi sederhana yang YYY ikuti, atau yang dapat mendekati YYY ? Saya bertanya karena saya memiliki kecurigaan yang kuat berdasarkan hasil simulasi (ditunjukkan di bawah) bahwa YYY menyatu …



4
Konsep himpunan tipikal
Saya berpikir bahwa konsep himpunan tipikal cukup intuitif: urutan panjang akan menjadi milik himpunan jika probabilitas urutan yang keluar tinggi. Jadi, urutan apa pun yang mungkin ada di . (Saya menghindari definisi formal terkait dengan entropi karena saya mencoba memahaminya secara kualitatif.)A ( n ) ϵ A ( n ) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.