Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Matematika di balik pengujian multivarian untuk pengoptimalan situs web
Saya mencari sumber daya teoretis (buku, tutorial, dll.) Untuk belajar tentang membuat kesimpulan statistik suara yang diberikan (banyak) data konversi situs web multivarian. Saya mengejar matematika yang terlibat, dan tidak dapat menemukan hal-hal non-pemasaran yang bagus di web. Jenis pertanyaan yang ingin saya jawab: seberapa besar pengaruh variabel tunggal (misalnya …

2
Masalah warna bohlam lampu
Silakan lihat terlebih dahulu masalah kecil berikut ini: Ada dua bola lampu yang tidak bisa dibedakan A dan B. Sebuah lampu merah berkedip dengan prob .8 dan biru dengan prob .2; B merah dengan .2 dan biru .8. Sekarang dengan 0,5 prob Anda disajikan dengan A atau B. Anda seharusnya …


2
Menguji normalitas dan independensi residu seri waktu
Bentuk paling sederhana dari proses white noise adalah di mana pengamatannya tidak berkorelasi. Kami dapat memeriksa ini dengan menerapkan mis tes portmanteau seperti Paru - Kotak atau Kotak - Pierce. Serial ini mungkin white noise Gaussian di mana pengamatannya tidak berkorelasi dan juga terdistribusi secara normal dan karenanya independen. Kita …


1
Pasang garis regresi yang kuat menggunakan MM-estimator di R
Konteks. Saya ingin mencocokkan garis regresi untuk mempelajari hubungan antara beberapa variabel responyyy dan beberapa kovariat terus menerus xxx. Karena adanya poin leverage yang buruk, saya telah memilih untuk estimator MM daripada estimasi LS. Metodologi. Pada dasarnya, estimasi-MM adalah estimasi-M yang diinisialisasi oleh S-estimator. Oleh karena itu, dua fungsi kerugian …
8 r  robust 

4
Masalah interpretasi dengan pengujian hipotesis
Dua hal yang selalu mengganggu saya tentang pengujian hipotesis: Kemungkinan bahwa mean populasi persis setiap angka yang diberikan (disediakan bahwa variabel acak yang dimaksud adalah terus menerus) selalu nol, bukan? Karena itu, kita harus selalu menolak hipotesis nol ... Jika hasil tes adalah apakah menolak atau menerima hipotesis nol , …

1
Kesalahan standar sampel standar deviasi proporsi
Baru-baru ini saya mulai membaca Gelman and Hill, "Analisis Data Menggunakan Regresi dan Model Bertingkat / Hirarki" dan pertanyaannya didasarkan pada: Sampel berisi 6 pengamatan pada proporsi:p1,p2,…,p6p1,p2,…,p6p_{1}, p_{2}, \dots, p_{6} Setiap memiliki mean dan varians , di mana adalah jumlah pengamatan yang digunakan untuk menghitung proporsi .pipip_{i}πiπi\pi_{i}πi(1−πi)niπi(1−πi)ni\frac{\pi_{i}(1-\pi_{i})}{n_i}ninin_{i}pipip_{i} Statistik uji adalah …

2
Subsampel sampel acak: sampel acak?
Katakanlah Anda memiliki sampel acak besar pemain sepak bola di Eropa tetapi Anda hanya tertarik pada apa yang terjadi di Spanyol. Bisakah Anda mengurangi sampel Anda menjadi pemain di Spanyol dan masih menyebutnya sampel acak (tetapi dari populasi yang berbeda)? Jika tidak, bagaimana Anda menyebut subsampel itu dan tindakan pencegahan …





2
Apakah ada referensi yang melegitimasi penggunaan z-test yang tidak disatukan untuk membandingkan dua proporsi?
Tes-z untuk membandingkan dua proporsi adalah z=hal^1-hal^2V a r (hal^1-hal^2)√z=p^1−p^2Var(p^1−p^2)\newcommand{\p}{\hat{p}}\newcommand{\v}{\mathrm{Var}} z=\frac{\p_1-\p_2}{\sqrt{\v(\p_1-\p_2)}} . Biasanya didefinisikan itu V a r (hal^1-hal^2) =hal^( 1 -hal^) ( 1 /n1+ 1 /n2) ,Var(p^1−p^2)=p^(1−p^)(1/n1+1/n2),\v(\p_1-\p_2)=\p(1-\hat{p})(1/n_1+1/n_2), dimana hal^=n1hal^1+n2hal^2n1+n2.p^=n1p^1+n2p^2n1+n2.\p=\frac{n_1 \p_1+n_2 \p_2}{n_1+n_2}. Apakah ada referensi tertulis yang melegitimasi saya untuk menggunakan varian unpooled, yaitu V a r (hal^1-hal^2) =hal^1( 1 …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.