Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data




2
Apakah diperbolehkan menggunakan rata-rata pada dataset untuk meningkatkan korelasi?
Saya memiliki dataset dengan variabel dependen dan independen. Keduanya bukan deret waktu. Saya memiliki 120 pengamatan. Koefisien korelasi adalah 0,43 Setelah perhitungan ini, saya telah menambahkan kolom untuk kedua variabel dengan rata-rata untuk setiap 12 pengamatan, menghasilkan 2 kolom baru dengan 108 pengamatan (pasangan). Koefisien korelasi kolom-kolom ini adalah 0,77 …

1
Model linear dimana data memiliki ketidakpastian, menggunakan R
Katakanlah saya memiliki data yang memiliki ketidakpastian. Sebagai contoh: X Y 1 10±4 2 50±3 3 80±7 4 105±1 5 120±9 Sifat ketidakpastian dapat berupa pengukuran ulang atau eksperimen, atau misalnya ketidakpastian instrumen pengukuran. Saya ingin menyesuaikan kurva menggunakan R, sesuatu yang biasanya saya lakukan lm. Namun, ini tidak memperhitungkan …

1
Deteksi changepoint online Bayesian (distribusi prediksi marjinal)
Saya membaca kertas pendeteksian changepoint online Bayesian oleh Adams dan MacKay ( tautan ). Penulis mulai dengan menulis distribusi prediksi marjinal: manaP(xt+1|x1:t)=∑rtP(xt+1|rt,x(r)t)P(rt|x1:t)(1)P(xt+1|x1:t)=∑rtP(xt+1|rt,xt(r))P(rt|x1:t)(1) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t} P(x_{t+1} | r_t, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) \qquad \qquad (1) txtxtx_t adalah pengamatan pada waktu ;ttt tx1:tx1:t\textbf{x}_{1:t} menunjukkan set pengamatan sampai waktu ;ttt …

2
Regresi pada disk unit mulai dari sampel "spasi seragam"
Saya perlu menyelesaikan masalah regresi yang rumit pada unit disk. Pertanyaan aslinya menarik beberapa komentar menarik, tetapi sayangnya tidak ada jawaban. Sementara itu, saya belajar lebih banyak tentang masalah ini, jadi saya akan mencoba untuk membagi masalah asli menjadi submasalah, dan melihat apakah saya lebih beruntung kali ini. Saya memiliki …

1
Dapatkah seseorang menjelaskan seperti saya berusia 5 tahun tentang masalah ini dari Buku ESL Hastie?
Saya sedang mengerjakan buku ESL Hastie, dan saya mengalami kesulitan dengan Pertanyaan 2.3. Pertanyaannya adalah sebagai berikut: Kami sedang mempertimbangkan perkiraan tetangga terdekat di titik asal, dan jarak median dari titik asal ke titik data terdekat diberikan oleh persamaan ini. Saya tidak tahu harus mulai dari mana dalam hal mencoba …

2
Apakah Poisson nol terpotong dan Poisson dasar bersarang atau tidak bersarang?
Saya telah melihat banyak yang membahas apakah regresi Poisson dasar adalah versi bersarang dari regresi Poisson nol-meningkat. Misalnya situs ini berpendapat bahwa itu adalah, karena yang terakhir mencakup parameter tambahan untuk memodelkan nol tambahan, tetapi sebaliknya menyertakan parameter regresi Poisson yang sama dengan yang sebelumnya, meskipun halaman tersebut tidak menyertakan …

6
Saya ingin belajar tentang teori probabilitas, mengukur teori dan akhirnya mempelajari mesin. Di mana saya memulai? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 3 tahun yang lalu . Saya ingin belajar tentang teori probabilitas, mengukur teori dan akhirnya mempelajari mesin. Tujuan utama …

1
Cara menyebarkan undian secara optimal saat menghitung beberapa harapan
Misalkan kita ingin menghitung beberapa harapan: EYEX| Y[ f( X, Y) ]EYEX|Y[f(X,Y)]E_YE_{X|Y}[f(X,Y)] Misalkan kita ingin memperkirakan ini menggunakan simulasi Monte Carlo. EYEX| Y[ f( X, Y) ] ≈ 1R S∑r = 1R∑s = 1Sf( xr , s, yr)EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) TAPI kira itu mahal untuk menarik sampel dari kedua distribusi, …

1
Cara yang lebih mudah untuk menemukan
Pertimbangkan 3 sampel awal yang diambil dari distribusi seragam u(θ,2θ)u(θ,2θ)u(\theta, 2\theta) , di mana θθ\theta adalah parameter. Saya ingin mencari E[X(2)|X(1),X(3)]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] mana X( i )X(i)X_{(i)} adalah statistik pesanan .sayaii Saya berharap hasilnya menjadi Tetapi satu-satunya cara saya dapat menunjukkan hasil ini tampaknya terlalu panjangnya, saya tidak dapat …


1
Bagaimana cara kerja pembelajar berbasis linier dalam meningkatkan? Dan bagaimana cara kerjanya di perpustakaan xgboost?
Saya tahu bagaimana menerapkan fungsi objektif linear dan peningkatan linear di XGBoost. Pertanyaan konkret saya adalah: ketika algoritme itu cocok dengan residual (atau gradien negatif) apakah ia menggunakan satu fitur pada setiap langkah (yaitu model univariat) atau semua fitur (model multivariat)? Referensi apa pun untuk dokumentasi tentang peningkatan linear di …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.