Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


5
Uji-berpasangan versus tidak berpasangan
Misalkan saya punya 20 tikus. Saya memasangkan tikus dalam beberapa cara, sehingga saya mendapatkan 10 pasang. Untuk tujuan pertanyaan ini, itu bisa menjadi pasangan acak, ATAU itu bisa menjadi pasangan yang masuk akal, seperti mencoba untuk memasangkan tikus dari sampah yang sama, dari jenis kelamin yang sama, dengan berat yang …

3
Bagaimana menafsirkan koefisien regresi ketika respons ditransformasikan oleh root ke-4?
Saya menggunakan 1/4transformasi kekuatan root keempat ( ) pada variabel respons saya, sebagai hasil dari heteroskedastisitas. Tapi sekarang saya tidak yakin bagaimana menafsirkan koefisien regresi saya. Saya berasumsi bahwa saya perlu membawa koefisien ke kekuatan keempat ketika saya melakukan transformasi balik (lihat di bawah hasil regresi). Semua variabel dalam satuan …

2
Seberapa kuat koefisien korelasi Pearson terhadap pelanggaran normalitas?
Data untuk beberapa jenis variabel cenderung tidak normal ketika diukur dalam populasi tertentu (misalnya tingkat depresi pada populasi orang dengan Gangguan Depresif Utama). Mengingat bahwa Pearson mengasumsikan normal, seberapa kuat statistik uji dalam kondisi non-normal? Saya memiliki sejumlah variabel yang saya ingin koefisien korelasi, tetapi kemiringan Z untuk beberapa variabel …


2
Mensimulasikan deret waktu yang diberikan daya dan lintas kerapatan spektral
Saya mengalami masalah dalam menghasilkan serangkaian seri waktu berwarna stasioner, mengingat matriks kovariansnya (densitas spektral daya (PSD)) dan densitas spektral cross-power (CSD)). Saya tahu bahwa, mengingat dua seri waktu yI(t)ysaya(t)y_{I}(t) dan yJ(t)yJ(t)y_{J}(t) , saya dapat memperkirakan kepadatan spektral daya (PSD) dan kepadatan spektral silang (CSD) menggunakan banyak rutinitas yang tersedia …

6
PCA data non-Gaussian
Saya punya beberapa pertanyaan singkat tentang PCA: Apakah PCA berasumsi bahwa dataset adalah Gaussian? Apa yang terjadi ketika saya menerapkan PCA ke data non-linear yang inheren? Diberikan dataset, prosesnya adalah untuk menormalkan rata-rata, mengatur varians ke 1, mengambil SVD, mengurangi peringkat, dan akhirnya memetakan dataset ke dalam ruang pengurangan peringkat …
20 pca  svd 


6
“Fully Bayesian” vs “Bayesian”
Saya telah belajar tentang statistik Bayesian, dan saya sering membaca dalam artikel "Kami mengadopsi pendekatan Bayesian" atau yang serupa. Saya juga memperhatikan, lebih jarang: "Kami mengadopsi pendekatan Bayesian sepenuhnya " (Penekanan saya). Apakah ada perbedaan antara pendekatan ini dalam arti praktis atau teoritis? FWIW, saya menggunakan paket MCMCglmmdalam R dalam …
20 bayesian 

1
Menghitung interval prediksi untuk regresi logistik
Saya ingin memahami cara membuat interval prediksi untuk estimasi regresi logistik. Saya disarankan untuk mengikuti prosedur dalam Pemodelan Data Biner Collett , 2nd Ed hal.98-99. Setelah menerapkan prosedur ini dan membandingkannya dengan R predict.glm, saya benar-benar berpikir buku ini menunjukkan prosedur untuk menghitung interval kepercayaan , bukan interval prediksi. Implementasi …

6
Mengubah skala variabel menjadi 0-100
Saya telah membangun indeks modal sosial menggunakan teknik PCA. Indeks ini terdiri dari nilai-nilai positif dan negatif. Saya ingin mengubah / mengonversi indeks ini ke skala 0-100 agar mudah ditafsirkan. Tolong sarankan saya cara termudah untuk melakukannya.

2
Validasi silang vs Bayes empiris untuk memperkirakan hiperparameter
Diberi model hierarkis , saya ingin proses dua tahap agar sesuai dengan model. Pertama, perbaiki beberapa hiperparameter , dan kemudian lakukan inferensi Bayesian pada seluruh parameter \ phi . Untuk memperbaiki hyperparameters saya mempertimbangkan dua opsi.p ( x | ϕ , θ )p(x|ϕ,θ)p(x|\phi,\theta)θθ\thetaϕϕ\phi Gunakan Empirical Bayes (EB) dan maksimalkan kemungkinan …

1
Kesalahan dalam perkiraan normal untuk distribusi jumlah yang seragam
Salah satu metode naif untuk mendekati distribusi normal adalah dengan menambahkan bersama-sama mungkin variabel acak IID yang terdistribusi secara seragam pada , kemudian masuk kembali dan skala, bergantung pada Teorema Batas Pusat. ( Catatan : Ada metode yang lebih akurat seperti transformasi Box-Muller .) Jumlah variabel acak IID dikenal sebagai …


2
Apakah ada penaksir yang tidak bias tentang jarak Hellinger antara dua distribusi?
Dalam pengaturan di mana seseorang mengamati didistribusikan dari distribusi dengan kepadatan , saya ingin tahu apakah ada penduga yang tidak bias (berdasarkan ) dari jarak Hellinger ke distribusi lain dengan kepadatan , yaitu X1,…,XnX1,…,XnX_1,\ldots,X_nfffXiXiX_if0f0f_0H(f,f0)={1−∫Xf(x)f0(x)−−−−−−−−√dx}1/2.H(f,f0)={1−∫Xf(x)f0(x)dx}1/2. \mathfrak{H}(f,f_0) = \left\{ 1 - \int_\mathcal{X} \sqrt{f(x)f_0(x)} \text{d}x \right\}^{1/2}\,.

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.