Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Deteksi outlier yang kuat dalam jangka waktu keuangan
Saya sedang mencari beberapa teknik yang kuat untuk menghapus outlier dan kesalahan (apa pun penyebabnya) dari data time-series keuangan (yaitu tickdata). Tick-by-tick data time-series keuangan sangat berantakan. Ini berisi kesenjangan (waktu) yang sangat besar ketika pertukaran ditutup, dan membuat lompatan besar ketika pertukaran dibuka kembali. Ketika pertukaran terbuka, semua jenis …


4
Mengapa P (A, B | C) / P (B | C) = P (A | B, C)?
Saya mengerti P( A ∩ B ) / P( B ) = P( A | B )P(SEBUAH∩B)/P(B)=P(SEBUAH|B)P(A\cap B)/P(B) = P(A|B) . Yang bersyarat adalah persimpangan A dan B dibagi dengan seluruh area B. Tetapi mengapa P(A∩B|C)/P(B|C)=P(A|B∩C)P(SEBUAH∩B|C)/P(B|C)=P(SEBUAH|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) ? Bisakah Anda memberi intuisi? Bukankah seharusnya: ?P(A∩B∩C)/P(B,C)=P(A|B∩C)P(SEBUAH∩B∩C)/P(B,C)=P(SEBUAH|B∩C)P(A\cap B …




2
Definisi splines kubik alami untuk regresi
Saya belajar tentang splines dari buku "Elemen-elemen Pembelajaran Statistik, Penambangan, Inferensi, dan Prediksi" oleh Hastie et al. Saya menemukan pada halaman 145 bahwa splines kubik alami adalah linier di luar simpul batas. Ada KKK knot, ξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K dalam splines dan berikut ini diberikan tentang spline tersebut dalam buku. …


2
Interpretasi interval kepercayaan
Catatan: permintaan maaf sebelumnya jika ini adalah duplikat, saya tidak menemukan q serupa dalam pencarian saya Katakanlah kita memiliki parameter true p. Interval kepercayaan C (X) adalah RV yang berisi p, katakanlah 95% dari waktu. Sekarang anggaplah kita mengamati X dan menghitung C (X). Jawaban yang umum tampaknya adalah bahwa …

3
Kapan kita dapat berbicara tentang kolinearitas
Dalam model linier kita perlu memeriksa apakah ada hubungan antara variabel penjelas. Jika mereka berkorelasi terlalu banyak maka ada collinearity (yaitu, sebagian variabel saling menjelaskan satu sama lain). Saat ini saya hanya melihat korelasi berpasangan antara masing-masing variabel penjelas. Pertanyaan 1: Apa yang mengklasifikasikan korelasi terlalu banyak? Misalnya, apakah korelasi …

3
Mengapa kita harus menggunakan REML (bukan ML) untuk memilih di antara model var-covar bersarang?
Berbagai deskripsi tentang pemilihan model pada efek acak dari Linear Mixed Models memerintahkan untuk menggunakan REML. Saya tahu perbedaan antara REML dan ML pada tingkat tertentu, tetapi saya tidak mengerti mengapa REML harus digunakan karena ML bias. Misalnya, apakah salah menjalankan LRT pada parameter varians dari model distribusi normal menggunakan …

3
Cara memilih sebelumnya dalam estimasi parameter Bayesian
Saya tahu 3 metode untuk melakukan estimasi parameter, pendekatan ML, MAP dan Bayes. Dan untuk pendekatan MAP dan Bayes, kita perlu memilih prior untuk parameter, kan? Katakanlah saya memiliki model ini , di mana α , β adalah parameter, untuk melakukan estimasi menggunakan MAP atau Bayes, saya membaca di buku …


1
Jumlah minimal poin untuk regresi linier
Berapa jumlah observasi minimal yang "masuk akal" untuk mencari tren dari waktu ke waktu dengan regresi linier? bagaimana dengan pemasangan model kuadratik? Saya bekerja dengan indeks gabungan dari ketidaksetaraan dalam kesehatan (SII, RII), dan hanya memiliki 4 gelombang survei, jadi 4 poin (1997.2001.2004.2008). Saya bukan ahli statistik, tetapi saya memiliki …
16 regression 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.