Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Mengapa mengatur bobot ke 1 dalam analisis faktor konfirmasi?
Saya menulis pertanyaan ini dengan merujuk pada contoh pada hal 138-142 dari dokumen berikut: ftp://ftp.software.ibm.com/software/analytics/spss/documentation/amos/20.0/id/Manuals/IBM_SPSS_Amos_User_Guide.pdf . Berikut adalah gambar ilustrasi dan tabel: Saya mengerti bahwa variabel laten tidak memiliki metrik alami dan pengaturan pemuatan faktor ke 1 dilakukan untuk memperbaiki masalah ini. Namun, ada beberapa hal yang saya tidak (sepenuhnya) …

3
Mengapa ada siku tajam di kurva ROC saya?
Saya memiliki beberapa set data EEG yang saya uji terhadap dua kelas. Saya bisa mendapatkan tingkat kesalahan yang layak dari LDA (distribusi kelas-kondisional bukan Gaussian, tetapi memiliki ekor yang sama dan pemisahan yang cukup baik), jadi saya ingin memplot ROC dari prediktor LDA terhadap set data dari subjek lain. Berikut …


2
Bagaimana cara memplot set data 5D di "koordinat bintang"?
Saya membaca makalah "Star Coordinates: A Visualization Multidimensional Technique dengan Uniform Treatment of Dimensions" dan mencoba untuk memplot data saya. Katakanlah saya memiliki , titik data lima dimensi, dan titik dihitung dengan rumus yang dijelaskan dalam makalah. A(2,5,3,1,8)A(2,5,3,1,8)A(2,5,3,1,8) Ide dasar Star Coordinates adalah untuk mengatur sumbu koordinat pada lingkaran pada …


1
Peramalan deret waktu yang sangat berkorelasi
Dalam peramalan deret waktu menggunakan berbagai model seperti AR, MA, ARMA, dll, kami biasanya fokus pada pemodelan data dalam perubahan waktu. Tetapi ketika kita memiliki 2 seri waktu yang menunjukkan koefisien korelasi Pearson mereka sangat berkorelasi, apakah mungkin untuk memodelkan nilai ketergantungan dan perkiraan mereka satu dari yang lain? Misalnya, …

1
Solusi untuk Teori Probabilitas ET Jaynes untuk studi mandiri?
Saya sedang melakukan studi sendiri tentang Teori Probabilitas ETJayne, logika sains. Saya ingin melihat apakah ada yang tahu tentang halaman web yang memberikan solusi untuk latihan? Saya tidak memiliki guru atau siapa pun yang berpengalaman dalam buku ini di sekitar saya, saya perlu memastikan bahwa solusi saya untuk mereka sudah …

2
Istilah yang digunakan untuk menggambarkan dua garis muncul lebih dekat satu sama lain ketika garis berada pada gradien yang lebih besar
Maafkan saya jika ini di luar lingkup Cross Validated, tetapi sepertinya relevan di bagian visualisasi. Seperti dijelaskan di sini (halaman 3) ada fenomena ketika mengukur jarak antara dua garis pada plot untuk membandingkan jarak terdekat antara kedua garis, daripada jarak vertikal. Hal ini menyebabkan terlalu rendahnya jarak antar garis pada …


2
Perhitungan kemungkinan kapan
Saya mencoba menghitung distribusi posterior ini: (θ|−)=∏ni=1pyii(1−pi)1−yi∑allθ,pi|θ∏ni=1pyii(1−pi)1−yi(θ|−)=∏i=1npiyi(1−pi)1−yi∑allθ,pi|θ∏i=1npiyi(1−pi)1−yi (\theta|-)=\frac{\prod_{i=1}^{n}p_i^{y_i}(1-p_i)^{1-y_i}}{\sum_{\text{all}\,\theta,p_i|\theta}\prod_{i=1}^{n}p_i^{y_i}(1-p_i)^{1-y_i}} Masalahnya adalah bahwa pembilang, yang merupakan produk dari sekelompok probabilitas terlalu kecil. ( saya besar, sekitar 1500).Bernoulli(pi,yi)Bernoulli(pi,yi)\text{Bernoulli}(p_i,y_i)nnn Oleh karena itu, nilai-nilai posterior untuk semua semua bisa dihitung menjadi 0 (saya melakukan perhitungan dalam R).θθ\theta Untuk memperjelas, masing-masing memiliki sendiri , bersama-sama ini …

3
Nama fenomena pada perkiraan plot data disensor CDF
Dataset saya berisi dua (agak berkorelasi kuat) variabel (runtime algoritma) dan (jumlah node yang diperiksa, apa pun). Keduanya sangat berkorelasi dengan desain, karena algoritma dapat mengelola kira-kira node per detik.tttnnnccc Algoritma dijalankan pada beberapa masalah, tetapi dihentikan jika solusi belum ditemukan setelah beberapa waktu habis . Jadi data disensor dengan …

1
Menggunakan komponen PCA yang dirotasi oleh varimax sebagai prediktor dalam regresi linier
Setelah melakukan PCA, komponen pertama menjelaskan bagian terbesar dari variabilitas. Ini penting misalnya dalam studi pengukuran tubuh di mana umumnya dikenal (Jolliffe, 2002) bahwa sumbu PC1 menangkap variasi ukuran. Pertanyaan saya adalah apakah skor PCA setelah rotasi varimax mempertahankan sifat yang sama atau apakah mereka berbeda seperti yang disebutkan dalam …



3
Mendeteksi cluster dalam urutan biner
Saya memiliki urutan biner seperti 11111011011110101100000000000100101011011111101111100000000000011010100000010000000011101111 Di mana kluster sebagian besar 1 diikuti oleh jumlah yang lebih besar dari nol, seperti pada gambar di bawah ini (hitam singkatan dari 1): Saya ingin menerapkan teknik (lebih disukai dalam R atau dengan Python) di mana saya dapat secara otomatis mendeteksi kluster 1 …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.