Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Apa perbedaan antara "percobaan statistik" dan "model statistik"?
Saya mengikuti AW van der Vaart, statistik asimptotik (1998). Dia berbicara tentang eksperimen statistik, mengklaim bahwa mereka berbeda dari model statistik, tetapi dia tidak mendefinisikan keduanya. Pertanyaan saya: Apa itu (1) percobaan statistik, (2) model statistik dan (3) apa bahan utama yang selalu akan membuat eksperimen statistik berbeda dari model …

3
Mengapa tidak menggunakan "persamaan normal" untuk menemukan koefisien kuadrat terkecil sederhana?
Saya melihat daftar ini di sini dan tidak percaya ada begitu banyak cara untuk menyelesaikan kuadrat terkecil. "Persamaan normal" di Wikipedia tampaknya merupakan cara yang cukup lurus ke depan: α^β^=y¯−β^x¯,=∑ni=1(xi−x¯)(yi−y¯)∑ni=1(xi−x¯)2α^=y¯−β^x¯,β^=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2 {\displaystyle {\begin{aligned}{\hat {\alpha }}&={\bar {y}}-{\hat {\beta }}\,{\bar {x}},\\{\hat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}\end{aligned}}} Jadi mengapa tidak menggunakannya …



1
Apakah ada interpretasi Bayesian tentang regresi linier dengan regularisasi L1 dan L2 simultan (alias jaring elastis)?
Ini juga diketahui bahwa regresi linier dengan penalti setara dengan menemukan perkiraan MAP diberi Gaussian sebelumnya pada koefisien. Demikian pula, menggunakan l 1 penalti setara dengan menggunakan distribusi Laplace sebagai sebelumnya.l2l2l^2l1l1l^1 Tidak jarang menggunakan kombinasi tertimbang dari regularisasi dan l 2 . Bisakah kita mengatakan bahwa ini setara dengan beberapa …

1
Kapan kemungkinan maksimum dan metode momen menghasilkan penduga yang sama?
Saya ditanya pertanyaan ini tempo hari dan tidak pernah mempertimbangkannya sebelumnya. Intuisi saya berasal dari kelebihan masing-masing estimator. Kemungkinan maksimum lebih disukai ketika kami yakin dalam proses menghasilkan data karena, tidak seperti metode momen, itu memanfaatkan pengetahuan dari seluruh distribusi. Karena penduga Kementerian Perindustrian hanya menggunakan informasi yang terdapat pada …

2
Mengapa tepatnya regresi beta tidak dapat menangani 0s dan 1s dalam variabel respon?
Regresi beta (yaitu GLM dengan distribusi beta dan biasanya fungsi tautan log) sering direkomendasikan untuk menangani respons alias variabel dependen yang mengambil nilai antara 0 dan 1, seperti fraksi, rasio, atau probabilitas: Regresi untuk hasil (rasio atau fraksi) antara 0 dan 1 . Namun, selalu dinyatakan bahwa regresi beta tidak …


4
Apa dasar dari definisi outlier Box dan Whisker Plot?
Definisi standar pencilan untuk plot Kotak dan Kumis adalah poin di luar rentang , di mana dan adalah kuartil pertama dan adalah kuartil ketiga dari data.{Q1−1.5IQR,Q3+1.5IQR}{Q1−1.5IQR,Q3+1.5IQR}\left\{Q1-1.5IQR,Q3+1.5IQR\right\}IQR=Q3−Q1IQR=Q3−Q1IQR= Q3-Q1Q1Q1Q1Q3Q3Q3 Apa dasar dari definisi ini? Dengan sejumlah besar poin, bahkan distribusi yang normal sekalipun menghasilkan outlier. Misalnya, Anda mulai dengan urutan: xseq<-seq(1-.5^1/4000,.5^1/4000, by …

2
Distribusi sampel dari dua populasi Bernoulli independen
Mari kita asumsikan bahwa kita memiliki sampel dua variabel acak Bernoulli independen, dan .B e r ( θ 2 )Ber(θ1)Ber(θ1)\mathrm{Ber}(\theta_1)Ber(θ2)Ber(θ2)\mathrm{Ber}(\theta_2) Bagaimana kami membuktikan bahwa ?(X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2−−−−−−−−−−−−−−√→dN(0,1)(X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2→dN(0,1)\frac{(\bar X_1-\bar X_2)-(\theta_1-\theta_2)}{\sqrt{\frac{\theta_1(1-\theta_1)}{n_1}+\frac{\theta_2(1-\theta_2)}{n_2}}}\xrightarrow{d} \mathcal N(0,1) Asumsikan .n1≠n2n1≠n2n_1\neq n_2



1
Mengapa nilai-p sering lebih tinggi dalam model bahaya proporsional Cox daripada dalam regresi logistik?
Saya telah belajar tentang model bahaya proporsional Cox. Saya memiliki banyak pengalaman pas model regresi logistik, dan model sehingga untuk membangun intuisi saya telah membandingkan cocok menggunakan coxphdari R "survival" dengan model regresi logistik cocok menggunakan glmdengan family="binomial". Jika saya menjalankan kode: library(survival) s = Surv(time=lung$time, event=lung$status - 1) summary(coxph(s …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.