Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Struktur faktor internal yang baik tetapi Cronbach ?
Saya menjalankan CFA dan mendapatkan indeks kecocokan yang baik (CFI = .99, RMSEA = .01) untuk skala uni-dimensional. Namun, ketika saya menguji konsistensi internal, saya mendapatkan s Cronbach yang buruk ( ). Saya sudah mencoba semuanya mulai dari menghapus outlier, hingga menjatuhkan barang dan masih berakhir dengan masalah yang sama.αα\alphaα=.6α=.6\alpha …

2
Fungsi kemungkinan data terpotong
Saya mengalami sedikit kesulitan memahami konsep dan derivasi dari kemungkinan data terpotong. Misalnya, jika saya ingin menemukan fungsi kemungkinan berdasarkan sampel dari distribusi, tetapi ketika mengambil sampel dari distribusi, saya mengamati nilai terpotong (di mana ada cut-off dari MMM, yaitu setiap dicatat sebagai ):xi>Mxi>Mx_{i}>MMMM x1,x2,M,x3,M,x4,x5,...,x10x1,x2,M,x3,M,x4,x5,...,x10 x_{1}, x_{2}, M, x_{3}, M, …


4
Distribusi proposal matriks kovarian
Dalam implementasi MCMC model hirarkis, dengan efek acak normal dan Wishart sebelum matriks kovariannya, sampling Gibbs biasanya digunakan. Namun, jika kita mengubah distribusi efek acak (mis. Ke Student's-t atau yang lain), konjugasinya hilang. Dalam hal ini, apa yang akan menjadi distribusi proposal yang sesuai (yaitu mudah ditembus) untuk matriks kovarians …

2
Matriks Factorization Model untuk sistem rekomendasi bagaimana menentukan jumlah fitur laten?
Saya mencoba merancang teknik faktorisasi matriks untuk pengguna-item sederhana, sistem rekomendasi rating. Saya punya 2 pertanyaan tentang ini. Pertama dalam implementasi sederhana yang saya lihat dari teknik faktorisasi matriks untuk rekomendasi film, penulis baru saja menginisialisasi dimensi fitur laten, sebut saja K dari dua fitur laten Pengguna dan item Matriks, …


1
Kemungkinan dari Regresi Logistik
Saya telah membangun model regresi logistik dalam R dan meskipun hasilnya tampaknya memuaskan sampai taraf tertentu, ada satu pertanyaan yang belum dapat saya atasi. Saya tidak yakin apakah pendekatan saya sama sekali benar. Saya tahu bahwa tujuan keseluruhan model logistik adalah untuk memprediksi probabilitas keberhasilan untuk variabel acak biner. Dari …

2
Ketika n meningkatkan nilai-t meningkat dalam uji hipotesis, tetapi t-tabel justru sebaliknya. Mengapa?
Rumus untuk dalam uji hipotesis diberikan oleh: tttt =X¯- μσ^/n--√.t=X¯−μσ^/n. t=\frac{\bar{X}-\mu}{\hat \sigma/\sqrt{n}}. Ketika meningkat, nilai- meningkat sesuai dengan rumus di atas. Tetapi mengapa kritis menurun pada -tabel saat (yang merupakan fungsi dari ) meningkat?nnntttttttttdfdf\text{df}nnn


2
Menggabungkan nilai-p dari berbagai uji statistik yang diterapkan pada data yang sama
Meskipun judul pertanyaan itu tampaknya sepele, saya ingin menjelaskan bahwa itu tidak sepele dalam arti bahwa itu berbeda dari pertanyaan menerapkan uji statistik yang sama dalam kumpulan data yang sama untuk menguji terhadap hipotesis nol total (meta-analisis, misalnya menggunakan metode Fisher untuk menggabungkan nilai-p). Apa yang saya cari, adalah metode …


2
Contoh untuk Satu kelas SVM di R
Saya mencoba melakukan satu kelas SVM di R. Saya telah mencoba menggunakan paket kernlab e1071 / ksvm. Tetapi saya tidak yakin apakah saya melakukannya dengan benar. Apakah ada contoh kerja untuk satu kelas SVM di R? Juga, Saya memberikan matriks besar prediktor sebagai X. Karena itu seharusnya satu kelas, apakah …
8 r  svm 

1
Memvisualisasikan data longitudinal dengan hasil biner
Untuk data longitudinal dengan hasil numerik, saya bisa menggunakan plot spageti untuk memvisualisasikan data. Misalnya sesuatu seperti ini (diambil dari situs Statistik UCLA): tolerance<-read.table("http://www.ats.ucla.edu/stat/r/faq/tolpp.csv",sep=",", header=T) head(tolerance, n=10) interaction.plot(tolerance$time, tolerance$id, tolerance$tolerance, xlab="time", ylab="Tolerance", legend=F) Tetapi bagaimana jika hasil saya adalah biner 0 atau 1? Misalnya, dalam data "ohio" di R, variabel …

3
Demonstrasi sampel bias kuantitatif
Saat melakukan beberapa simulasi, saya menyadari bahwa sampel kuantil adalah penaksir yang bias dari kuantil yang sebenarnya. Dan, menurut simulasi saya, yang berpotensi sangat bias. Saya terkejut dengan hasil itu karena CDF empiris tidak bias, tetapi setelah beberapa penelitian internet, saya menemukan itu benar . Saya mencoba mencari tahu dari …

1
Metode apa yang mensimulasikan pvalues ​​dari pengambilan sampel ulang dari data
Beberapa waktu yang lalu saya mengajukan pertanyaan tentang menghubungkan waktu antara prangko waktu dan menerima tanggapan dari Peter Ellis yang mengatakan saya bisa menghitung jarak rata-rata antara kode ... Ini sudah memberi Anda perasaan tentang perilaku mana yang dikelompokkan bersama, tetapi Anda juga harus memeriksa bahwa ini tidak masuk akal …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.