Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
EFA jelas mendukung satu faktor, ukurannya konsisten secara internal, tetapi CFA kurang pas?
Saya mengeksplorasi sifat psikometrik dari ukuran laporan diri 10 item. Saya memiliki sekitar 400 kasus dalam dua sampel independen. Item selesai pada skala Likert 4 poin. EFA jelas mendukung solusi satu faktor (misalnya, nilai eigen pertama di atas 6, semua lainnya di bawah 1) dan alpha Cronbach baik (misalnya, 0,90). …

2
Ramalan ARIMA dengan musim dan tren, hasil yang aneh
karena saya melangkah ke peramalan dengan model ARIMA, saya mencoba memahami bagaimana saya dapat meningkatkan ramalan berdasarkan ARIMA yang sesuai dengan musiman dan pergeseran. Data saya adalah seri waktu berikut (lebih dari 3 tahun, dengan tren yang jelas ke atas dan musim yang terlihat, yang tampaknya tidak didukung oleh autokorelasi …

1
Tentukan jumlah lokasi dunia nyata yang tidak diketahui dari laporan berbasis GPS
Saya sedang mengerjakan beberapa perangkat lunak yang harus menentukan lokasi dunia nyata (kamera kecepatan) dari beberapa laporan berbasis GPS . Seorang pengguna akan mengemudi saat melaporkan lokasi, sehingga laporannya sangat tidak akurat. Untuk mengatasi masalah itu saya harus mengelompokkan laporan tentang lokasi yang sama dan menghitung rata-rata. Pertanyaan saya adalah …

2
Estimasi rata-rata yang kuat dengan efisiensi pembaruan O (1)
Saya mencari estimasi kuat dari mean yang memiliki properti spesifik. Saya memiliki serangkaian elemen yang ingin saya hitung statistik ini. Kemudian, saya menambahkan elemen baru satu per satu, dan untuk setiap elemen tambahan saya ingin menghitung ulang statistik (juga dikenal sebagai algoritma online). Saya ingin kalkulasi pembaruan ini menjadi cepat, …


2
Formula Doane untuk binning histogram
Saya menerapkan berbagai algoritme untuk memperkirakan jumlah sampah terbaik yang digunakan untuk histogram. Sebagian besar yang saya laksanakan dijelaskan pada halaman "Histogram" Wikipedia di bagian " Jumlah sampah dan lebar " *. Saya terjebak pada masalah dengan rumus Doane: 1 + log(n) + log(1 + kurtosis(data) * sqrt(n / 6.)) …

1
Dynamic Time Warping dan normalisasi
Saya menggunakan Dynamic Time Warping untuk mencocokkan kurva "kueri" dan "templat" dan sejauh ini berhasil, tetapi saya punya beberapa pertanyaan mendasar: Saya menilai "kecocokan" dengan menilai apakah hasil DTW kurang dari beberapa nilai ambang batas yang saya buat secara heuristik. Apakah ini pendekatan umum untuk menentukan "kecocokan" menggunakan DTW? Jika …


2
Membuat data "demo" dari data nyata: menyamarkan tanpa menodai
(Saya tidak tahu apa yang harus ditandai dengan ini karena saya bukan ahli statistik dan saya tidak tahu bidang apa ini. Jangan ragu untuk menambahkan tag yang lebih cocok.) Saya bekerja untuk perusahaan yang memproduksi perangkat lunak analisis data, dan kami membutuhkan set data yang layak untuk menguji dan mendemonstrasikan …

2
Bagaimana menemukan jarak yang diharapkan antara dua titik yang terdistribusi secara merata?
Jika saya menentukan koordinat dan mana( X 2 , Y 2 )(X1,Y1)(X1,Y1)(X_{1},Y_{1})(X2,Y2)(X2,Y2)(X_{2},Y_{2}) X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X_{1},X_{2} \sim \text{Unif}(0,30)\text{ and }Y_{1},Y_{2} \sim \text{Unif}(0,40). Bagaimana saya bisa menemukan nilai jarak yang diharapkan dari mereka? Saya berpikir, karena jarak dihitung oleh akan nilai yang diharapkan jadilah ?(1/30+1/30)2+(1/40+1/40)2(X1−X2)2+(Y1−Y2)2−−−−−−−−−−−−−−−−−−−√)(X1−X2)2+(Y1−Y2)2)\sqrt{(X_{1}-X_{2})^{2} + (Y_{1}-Y_{2})^{2}})(1/30+1/30)2+(1/40+1/40)2(1/30+1/30)2+(1/40+1/40)2(1/30 + 1/30)^2 + …

1
Bagaimana menentukan matriks kontras (dalam R) untuk perbedaan antara satu level dan rata-rata yang lain?
Saya memiliki model regresi yang terlihat seperti ini:Y= β0+ β1X1+ β2X2+ β3X3+ β12X1X2+ β13X1X3+ β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... atau dalam notasi R: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 Katakanlah dan adalah variabel kategori dan adalah numerik. Masalahnya adalah …
9 r  contrasts 

3
Memilih cluster untuk k-means: kasus 1 cluster
Adakah yang tahu metode yang baik untuk menentukan apakah pengelompokan menggunakan kmeans bahkan sesuai? Artinya, bagaimana jika sampel Anda sebenarnya homogen? Saya tahu sesuatu seperti model campuran (melalui mclust di R) akan memberikan statistik yang cocok untuk kasus klaster 1: k, tetapi sepertinya semua teknik untuk mengevaluasi kman memerlukan setidaknya …
9 r  clustering  k-means 



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.