Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Apa yang harus dilakukan dengan heterogenitas varians ketika spread berkurang dengan nilai yang lebih besar
Saya mencoba untuk menghasilkan model campuran linier kode R adalah sebagai berikut. lme (Average.payoff ~ Game + Type + Others.Type + Game: Type + Game: Others.Type + Type: Others.Type, random = ~ 1 | Subjek, metode = "REML", data = Subjectsm1) -> lme1 Istilah respons Average.payoff kontinu sementara semua variabel …

2
Apakah transformasi data pada data non-normal diperlukan untuk analisis faktor eksplorasi ketika menggunakan metode ekstraksi anjak sumbu utama?
Saya mengembangkan kuesioner untuk mengukur empat faktor yang merupakan spiritualitas, dan saya ingin mengajukan pertanyaan berikut: Apakah transformasi data pada data non-normal diperlukan untuk analisis faktor eksplorasi ketika menggunakan metode ekstraksi anjak sumbu utama? Saya selesai menyaring data saya kemarin, dan saya menemukan bahwa 3 dari 20 pertanyaan condong positif …


1
Interval kepercayaan sekitar centroid dengan kesamaan Gower yang dimodifikasi
Saya ingin memperoleh interval kepercayaan 95% untuk centroid berdasarkan pada kesamaan Gower antara beberapa sampel mulivariat (data komunitas dari inti sedimen). Saya sejauh ini menggunakan vegan{}paket dalam R untuk mendapatkan kesamaan Gower yang dimodifikasi antara core (berdasarkan Anderson 2006; sekarang termasuk dalam R sebagai bagian dari vegdist()). Adakah yang tahu …

3
MCMC untuk menangani masalah kemungkinan datar
Saya memiliki kemungkinan yang cukup datar untuk mengarahkan sampler Metropolis-Hastings untuk bergerak melalui ruang parameter dengan sangat tidak teratur, yaitu tidak ada konvergensi yang dapat dicapai, apa pun parameter distribusi proposal (dalam kasus saya ini adalah gaussian). Tidak ada kompleksitas tinggi dalam model saya - hanya 2 parameter, tetapi tampaknya …

2
Pertanyaan imputasi berganda untuk regresi berganda di SPSS
Saat ini saya menjalankan model regresi berganda menggunakan data yang diperhitungkan dan memiliki beberapa pertanyaan. Latar Belakang: Menggunakan SPSS 18. Data saya tampaknya MAR. Penghapusan kasus secara berurutan membuat saya hanya memiliki 92 kasus, beberapa imputasi menyisakan 153 kasus untuk dianalisis. Semua asumsi terpenuhi - satu log variabel ditransformasikan. 9 …

2
Statistik PRESS untuk regresi ridge
Dalam kuadrat terkecil biasa, regresi vektor target terhadap seperangkat prediktor , matriks topi dihitung sebagaiyyyXXX H=X(XtX)−1XtH=X(XtX)−1XtH = X (X^tX)^{-1} X^t dan PRESS (prediksi jumlah residu kuadrat) dihitung oleh SSP=∑i(ei1−hii)2SSP=∑i(ei1−hii)2SS_P = \sum_i \left( \frac{e_i}{1-h_{ii}}\right)^2 di mana adalah residu ke- dan adalah elemen diagonal dari matriks topi.eieie_iiiihiihiih_{ii} Dalam regresi ridge dengan koefisien …

3
Bisakah saya menggunakan variabel yang memiliki hubungan non-linear dengan variabel dependen dalam regresi logistik?
Katakanlah saya sedang membangun model regresi logistik di mana variabel dependen adalah biner dan dapat mengambil nilai atau . Biarkan variabel independen menjadi - ada variabel independen . Katakanlah untuk variabel independen ke- , analisis bivariat menunjukkan tren berbentuk-U - yaitu, jika saya mengelompokkan ke dalam tong yang masing-masing berisi …

1
Jika memiliki distribusi log-normal, apakah juga memiliki distribusi log-normal?
Katakanlah memiliki distribusi log-normal dan ada satu angka positif nyata . maka apakah benar untuk mengatakan bahwa juga memiliki beberapa distribusi log-normal? Perasaan saya adalah, itu tidak mungkin, karena dapat mengambil nilai negatif sedangkan distribusi log-normal hanya didefinisikan pada domain positif. Adakah yang bisa membantah hal itu?XXXccc(X−c)(X−c)(X -c)(X−c)(X−c)(X - c)
9 lognormal 

1
Imputasi variabel yang disensor
Saya memiliki dataset medis dengan sekitar 200 variabel. Salah satu variabel adalah penanda-bio (konsentrasi enzim tertentu). Distribusinya condong ke kanan, dan masalahnya adalah bahwa nilai di atas level tertentu disensor / terputus pada level itu. Jadi, sementara rata-rata variabel sekitar 10, nilai apa pun yang lebih besar dari 50 dicatat …

3
Apakah perlu untuk mendrrenden dan mendaur ulang data deret waktu saat menggunakan metode pembelajaran mesin?
Sebagai contoh: Saya ingin meramalkan nilai-nilai masa depan dari suatu seri-waktu berdasarkan nilai-nilai sebelumnya dari beberapa seri-waktu 'menggunakan ANN dan / atau SVM. Input akan menjadi nilai lag dari setiap deret waktu, dan output akan menjadi prakiraan satu langkah di depan (prakiraan dengan cakrawala lebih lanjut akan dilakukan dengan "menggulirkan" …

4
Mean square error atau mean squared error
Sebagai penutur bahasa Inggris non-pribumi saya bertanya-tanya mana dari ekspresi persegi atau kuadrat yang harus saya gunakan. Misalnya dalam mean square error atau mean squared error. Menurut internet, tampaknya kedua bentuk tersebut digunakan secara tidak jelas. Apakah satu ungkapan lebih persegi daripada yang lain?

1
Teknik untuk pembelajaran online tambahan classifier pada aliran data
Teknik mana yang bagus untuk menghadapi masalah abstrak ini? Anda memiliki aliran data dari sinyal kontinu, sebagai satu dari sensor fisik. Sinyal itu memiliki nilai nyata (tidak jelas), tanpa atribut; fitur kecanduan (misalnya, kekuatan, korelasi-otomatis, entropi) dapat diekstraksi. Anda dapat menetapkan satu label dari set terbatas ke jendela sinyal. Biarkan …

1
Bagaimana cara kerja imputasi tikus?
Saya bertanya-tanya apakah ada yang punya pengalaman menggunakan fungsi mouse, seperti yang dijelaskan dalam mouse: Imputasi Multivarian oleh Chained Equations di R (JSS 2011 45 (3))? Saya memiliki dataset dengan sejumlah variabel, masing-masing dengan berbagai tingkat data yang hilang. Pertanyaan utama saya adalah: katakanlah saya menggunakan regresi linier Bayesian untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.