Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Cara menafsirkan plot ACF dan PACF
Saya hanya ingin memeriksa apakah saya menginterpretasikan plot ACF dan PACF dengan benar: Data terkait dengan kesalahan yang dihasilkan antara titik data aktual dan perkiraan yang dihasilkan menggunakan model AR (1). Saya telah melihat jawabannya di sini: Perkirakan koefisien ARMA melalui inspeksi ACF dan PACF Setelah membaca bahwa tampaknya kesalahan …

1
Estimator yang tidak sesuai dengan varian minimum untuk
Misalkan menjadi sampel acak dari distribusi untuk . Yaitu,X1,...,XnX1,...,Xn X_1, ...,X_nGeometric(θ)Geometric(θ)Geometric(\theta)0&lt;θ&lt;10&lt;θ&lt;10<\theta<1 pθ(x)=θ(1−θ)x−1I{1,2,...}(x)pθ(x)=θ(1−θ)x−1I{1,2,...}(x)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) Temukan estimator yang tidak bias dengan varians minimum untukg(θ)=1θg(θ)=1θg(\theta)=\frac{1}{\theta} Usaha saya: Karena distribusi geometrik berasal dari keluarga eksponensial, statistik lengkap dan cukup untuk . Juga, jika adalah penduga untuk , itu tidak bias. Oleh karena itu, oleh …

3
Mengapa orang menyukai data yang halus?
Saya menggunakan kernel Squared Exponential (SE) untuk Regresi Proses Gaussian. Kelebihan dari kernel ini adalah: 1) sederhana: hanya 3 hiperparameter; 2) smooth: kernel ini adalah Gaussian. Mengapa orang sangat menyukai 'kehalusan'? Saya tahu bahwa kernel Gaussian terdiferensiasi tanpa batas, tetapi apakah itu sangat penting? (Tolong beri tahu saya jika ada …

1
Keluarga Eksponensial: Statistik yang Memadai vs. yang Diharapkan
Pertanyaan saya muncul dari membaca bacaan Minka "Memperkirakan Distribusi Dirichlet" , yang menyatakan berikut tanpa bukti dalam konteks memperoleh penduga kemungkinan maksimum untuk distribusi Dirichlet berdasarkan pengamatan vektor acak: Seperti biasa dengan keluarga eksponensial, ketika gradien adalah nol, statistik yang diharapkan cukup sama dengan statistik yang diamati cukup. Saya belum …

4
Subset terkorelasi terkecil dari variabel acak dari matriks korelasi
Saya memiliki matriks korelasi AAA , yang saya peroleh dengan menggunakan koefisien korelasi linear Pearson melalui corrcoef () Matlab . Matriks korelasi dimensi 100x100, yaitu saya menghitung matriks korelasi pada 100 variabel acak. Di antara 100 variabel acak ini, saya ingin menemukan 10 variabel acak yang matriks korelasinya mengandung "korelasi …


5
Apakah menggunakan desil untuk menemukan korelasi merupakan pendekatan yang valid secara statistik?
Saya memiliki sampel 1,449 titik data yang tidak berkorelasi (r-squared 0,006). Ketika menganalisis data, saya menemukan bahwa dengan memecah nilai-nilai variabel independen menjadi kelompok-kelompok positif dan negatif, tampaknya ada perbedaan yang signifikan dalam rata-rata variabel dependen untuk setiap kelompok. Membagi titik menjadi 10 sampah (desil) dengan menggunakan nilai variabel independen, …

2
Mengapa PCA memaksimalkan varian total dari proyeksi?
Christopher Bishop menulis dalam bukunya Pattern Recognition dan Machine Learning sebagai bukti, bahwa setiap komponen utama berturut-turut memaksimalkan varian proyeksi ke satu dimensi, setelah data diproyeksikan ke ruang ortogonal ke komponen yang sebelumnya dipilih. Lainnya menunjukkan bukti serupa. Namun, ini hanya membuktikan bahwa setiap komponen berturut-turut adalah proyeksi terbaik untuk …

2
Regresi logistik dan variabel independen ordinal
Saya telah menemukan posting ini: Iya. Koefisien mencerminkan perubahan dalam peluang log untuk setiap kenaikan perubahan dalam prediktor ordinal. Spesifikasi model ini (sangat umum) mengasumsikan prediktor memiliki dampak linier di seluruh kenaikannya. Untuk menguji asumsi, Anda dapat membandingkan model di mana Anda menggunakan variabel ordinal sebagai prediktor tunggal dengan yang …

1
Bagaimana cara membandingkan kekuatan dua korelasi Pearson?
Saya telah ditanya oleh reviewer apakah korelasi Pearson (nilai-r) yang disajikan dalam tabel dapat dibandingkan satu sama lain sehingga orang dapat mengklaim bahwa yang satu "lebih kuat" dari yang lain (selain hanya mengamati nilai r yang sebenarnya) . Bagaimana Anda melakukannya? Saya telah menemukan metode ini http://vassarstats.net/rdiff.html tetapi tidak yakin …

2
Memperkirakan ukuran persimpangan beberapa set dengan menggunakan sampel satu set
Saya sedang mengerjakan suatu algoritma yang perlu menghitung ukuran satu set yang dihasilkan oleh persimpangan setidaknya 2 set. Lebih spesifik: z=|A0∩…∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | Set yang berpotongan dihasilkan oleh query SQL, dan dalam upaya untuk menjaga hal-hal cepat, saya mendapatkan hitungan setiap query …
10 error  sample 

1
Bagaimana Menafsirkan Nilai-P GAM?
Nama saya Hugh, dan saya seorang mahasiswa PhD yang menggunakan model aditif umum untuk melakukan beberapa analisis eksplorasi. Saya tidak yakin bagaimana menafsirkan nilai-p yang berasal dari paket MGCV dan ingin memeriksa pemahaman saya (saya menggunakan versi 1.7-29, dan telah berkonsultasi dengan beberapa dokumentasi Simon Wood). Saya pertama-tama mencari pertanyaan …
10 p-value  mgcv 

2
Mengapa algoritma iterasi kebijakan menyatu dengan fungsi kebijakan dan nilai yang optimal?
Saya membaca catatan kuliah Andrew Ng tentang pembelajaran penguatan, dan saya mencoba memahami mengapa iterasi kebijakan digabungkan ke fungsi nilai optimal dan kebijakan optimal .V∗V∗V^*π∗π∗\pi^* Ingat iterasi kebijakan adalah: Inisialisasi π secara acakUlangi {L e t V : = Vπ \ untuk kebijakan saat ini, selesaikan bellman's eqn's dan atur …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.