Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Apa intuisi di balik fungsi skor? [duplikat]
Pertanyaan ini sudah memiliki jawaban di sini : Informasi apa yang dimaksud dengan informasi Fisher? (3 jawaban) Ditutup 7 bulan lalu . Wikipedia memberi tahu kita bahwa skor memainkan peran penting dalam ketimpangan Cramér-Rao. Itu juga mengeluarkan definisi: V=∂∂θcatatanL ( θ ; X)V=∂∂θlog⁡L(θ;X)V = \frac{\partial}{\partial \theta} \log{L(\theta; X)} Namun, saya …

4
Perbedaan antara bias, bias sistematis, dan kesalahan sistematis?
Apakah ada perbedaan di antara persyaratan berikut atau mereka sama? Bias Bias sistematik Kesalahan sistematis Jika ada beberapa perbedaan, mohon jelaskan. Bisakah kesalahan ini dikurangi ketika seseorang menambah ukuran sampel? UPDATE: Bidang minat saya adalah inferensi statistik. Maksud saya mengatakan bahwa bagaimana kita membedakan istilah ini sebagai ahli statistik.

3
Memperkirakan efek acak dan menerapkan struktur korelasi / kovariansi yang ditetapkan pengguna dengan paket R lme4 atau nlme
Saya memiliki tipe data berikut. Saya telah mengevaluasi 10 orang yang masing-masing diulang 10 kali. Saya memiliki 10x10 matriks relasi (hubungan antara semua kombinasi individu). set.seed(1234) mydata <- data.frame (gen = factor(rep(1:10, each = 10)), repl = factor(rep(1:10, 10)), yld = rnorm(10, 5, 0.5)) Gen ini adalah varietas tanaman yang …
9 r  mixed-model 

1
Konsistensi dari proses pembelajaran
Saya punya dua pertanyaan terkait dengan konsep "konsistensi belajar" bagi mereka yang akrab dengan teori pembelajaran statistik a la Vapnik. Pertanyaan 1. Proses pembelajaran disebut konsisten (untuk kelas fungsi dan distribusi probabilitas ) jikaFF\mathcal{F}PPP Re m p(f∗l)→Pinff∈ FR ( f) ,l → ∞Remp(fl∗)→Pinff∈FR(f),l→∞ R_{emp}(f^*_l) \buildrel P \over \to \inf_{f \in …

1
Bagaimana seharusnya satu kontrol untuk perbedaan kelompok dan individu dalam skor pra-perawatan dalam uji coba terkontrol secara acak?
Andrew Gelman, dalam buku yang ditulisnya dengan Jennifer Hill, menyatakan dalam Bab 9, (bagian 9.3), di halaman 177: Hanya tepat untuk mengontrol prediktor pra-perawatan, atau, lebih umum, prediktor yang tidak akan terpengaruh oleh perawatan (seperti ras atau usia). Poin ini akan diilustrasikan secara lebih konkret di Bagian 9.7 ... Dan …

2
Kolmogorov-Smirnov dua sampel -values
Saya menggunakan uji dua sampel Kolmogorov-Smirnov untuk membandingkan distribusi, dan saya perhatikan nilai- sering dilaporkan sebagai statistik uji. Bagaimana nilai- ini ditentukan? Saya tahu ini probabilitas mendapatkan hasil setidaknya sebesar yang diperoleh, tetapi bagaimana nilai- ini ditentukan mengingat ini adalah tes nonparametrik? Yaitu, kita tidak dapat mengasumsikan fluktuasi Gaussian dalam …

1
Proses pencampuran dan pembagian poin
Pada gambar berikut di sebelah kiri dua realisasi proses titik dengan kepadatan (intensitas) dan yang berbeda sedang dicampur dengan pusat area yang dimiliki untuk membangun proses titik di tengah dengan intensitas . Kemudian poin yang dipilih secara acak sebagai dua set diekstraksi dari itu seperti yang ditunjukkan di sisi kanan. …

5
Turunkan P (C | A + B) dari dua aturan Cox
Saya bekerja dengan cara saya (belajar sendiri) melalui buku ET Jaynes ' Probability Theory - The Logic of Science Masalah Asli Latihan 2.1 mengatakan: "Apakah mungkin untuk menemukan formula umum untukp(C|A+B)p(C|A+B)p(C|A+B) analog dengan [rumusnya p(A+B|C)=p(A|C)+p(B|C)−p(AB|C)p(A+B|C)=p(A|C)+p(B|C)−p(AB|C)p(A+B|C)=p(A|C)+p(B|C)-p(AB|C)] dari produk dan aturan penjumlahan. Jika demikian, turunkan; jika tidak, jelaskan mengapa ini tidak bisa …

1
Praktik terbaik untuk mengukur dan menghindari overfitting?
Saya mengembangkan sistem perdagangan otomatis untuk pasar saham. Tantangan besar adalah overfitting. Dapatkah Anda merekomendasikan beberapa sumber yang menggambarkan metode untuk mengukur dan menghindari overfitting? Saya mulai dengan set pelatihan / validasi, tetapi set validasi selalu ternoda. Juga, data deret waktu selalu berubah karena pasar selalu berubah. Bagaimana Anda mengukur …

2
Akankah komputasi kuantum memungkinkan teknik statistik baru?
Saya baru saja membaca bahwa Anda sekarang dapat membeli komputer kuantum (meskipun hanya ada satu yang terjual sejauh ini!). Apakah komputasi kuantum memiliki aplikasi dalam statistik? {sunting - untuk keperluan pertanyaan, mari kita asumsikan bahwa komputer kuantum akhirnya (dalam beberapa bentuk) akan berfungsi}
9 theory 

3
Pengujian Bayesian AB
Saya menjalankan Tes AB pada halaman yang hanya menerima kunjungan 5k per bulan. Akan terlalu lama untuk mencapai tingkat lalu lintas yang diperlukan untuk mengukur perbedaan + -1% antara pengujian dan kontrol. Saya telah mendengar bahwa saya dapat menggunakan statistik Bayesian untuk memberi saya peluang bagus untuk menentukan apakah tesnya …


3
Nasihat umum tentang pemodelan
Merumuskan model matematika untuk suatu masalah adalah salah satu aspek statistik yang paling subyektif, tetapi juga salah satu yang paling penting. Apa referensi terbaik yang berhubungan dengan topik penting ini tetapi sering diabaikan? Dan ahli statistik terkenal mana yang mengatakan sesuatu, "Biarkan data memandu model?"

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.