Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Varian kombinasi linear dari variabel acak berkorelasi
Saya mengerti bukti bahwa tapi saya tidak mengerti bagaimana membuktikan generalisasi untuk kombinasi linear yang sewenang-wenang.Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y),Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y),Var(aX+bY) = a^2Var(X) +b^2Var(Y) + 2abCov(X,Y), Biarkan menjadi skalar untuk sehingga kita memiliki vektor , dan menjadi vektor dari variabel acak berkorelasi. Kemudian Bagaimana kita membuktikan ini? Saya membayangkan ada bukti dalam notasi penjumlahan dan …

3
Sensor kanan dan sensor kiri
Wikipedia memberikan definisi berikut: Penyensoran benar : titik data berada di atas nilai tertentu tetapi tidak diketahui seberapa banyak. Sensor kiri : titik data di bawah nilai tertentu tetapi tidak diketahui seberapa banyak. Dalam definisi ini, apa yang dimaksud dengan: "titik data" "nilai tertentu", dan "berapa banyak" Secara umum, Apa …

2
Menggunakan LASSO untuk pemilihan variabel, kemudian menggunakan Logit
Saya tahu ini akan memperburuk kesimpulan statistik, tetapi saya benar-benar hanya peduli dengan sedekat mungkin dengan model yang akurat. Saya memiliki variabel hasil dikotomis, dengan seperangkat besar prediktor dikotomis. Saya pikir saya ingin mencoba menggunakan LASSO untuk memilih variabel mana yang harus saya sertakan dalam model saya, kemudian memasukkan variabel-variabel …

3
k-means vs k-means ++
Sejauh yang saya tahu k-means memilih pusat awal secara acak. Karena mereka didasarkan pada keberuntungan murni, mereka dapat dipilih dengan sangat buruk. Algoritma K-means ++ mencoba untuk memecahkan masalah ini, dengan menyebarkan pusat awal secara merata. Apakah kedua algoritma menjamin hasil yang sama? Atau ada kemungkinan bahwa centroid awal yang …
10 k-means 

1
Periksa status proses pelatihan dalam R [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 4 tahun yang lalu . Saya melatih model menggunakan caretpaket dalam R selama hampir 3 hari. Perhitungan berjalan secara paralel (beberapa proses). Sayangnya tidak ada …

2
Lmer dengan data yang dimasukkan multiply
Bagaimana saya bisa mendapatkan efek acak dikumpulkan untuk lmer setelah beberapa kali imputasi? Saya menggunakan mouse untuk menghubungkan beberapa frame data. Dan lme4 untuk model campuran dengan intersep acak dan kemiringan acak. Pooling lmer baik-baik saja, kecuali bahwa itu tidak mengumpulkan efek acak. Saya telah mencari banyak solusi tanpa keberuntungan. …

2
RMSE yang dinormalisasi
Saya memiliki beberapa deret waktu dalam VAR (1) dan, karena beberapa dari mereka tidak memiliki satuan ukuran yang sama, saya ingin memperkirakan RMSE dalam persentase. Saya tahu itu bisa dilakukan dalam beberapa cara (lihat di bawah) tetapi saya tidak tahu persis mana yang lebih cocok dengan masalah evaluasi perkiraan. Saya …
10 time-series  mse  rms 

2
Menafsirkan korelasi CCF dalam R
Saya menggunakan ccfuntuk menemukan korelasi antara 2 seri waktu. Saya mendapatkan plot yang terlihat seperti itu: Perhatikan bahwa saya terutama tertarik pada korelasi untuk lag = 0. Pertanyaan: Apakah mengartikannya dengan benar bahwa ada korelasi silang untuk lag = 0, karena untuk lag ini korelasi silang berada di atas garis …

2
Bagaimana cara membandingkan perbedaan antara dua seri waktu?
Saya sedang mengerjakan tesis saya di mana saya memeriksa seberapa kuat emosi orang-orang terhadap berbagai peristiwa. Masalah saya adalah (1) saya memiliki pengalaman yang SANGAT kecil dengan statistik dan matematika, jadi saya agak bingung dengan semua metode yang berbeda dan akan sangat senang jika jawaban 'mudah' dapat diberikan (tanpa banyak …

1
Mengapa kita menghitung nilai Informasi?
Saya memiliki data dengan variabel kategori dan variabel kontinu, tetapi adalah kebutuhan untuk menemukan nilai informasi dalam analisis data penjelasan. Berikan saja alasan mengapa kami menghitung nilai informasi untuk setiap variabel pada awal analisis data dan apa yang akan menjadi titik cutoff dari INFORMASI NILAI untuk mengurus analisis


2
Cara menggunakan uji chi-squared untuk menentukan apakah data mengikuti distribusi Poisson
Gambar di bawah ini (Gambar 1 dari hal. 646 tulisan ini ) membandingkan nilai yang diamati dengan nilai yang diharapkan di bawah distribusi Poisson. Kemudian menjalankan uji chi-squared untuk melihat apakah nilai yang diamati berbeda dari nilai yang diharapkan di bawah distribusi Poisson. Dengan menggunakan R, bagaimana mungkin untuk menghasilkan …

3
Bisakah variabel independen dengan korelasi rendah dengan variabel dependen menjadi prediktor signifikan?
Saya memiliki delapan variabel independen dan satu dependen. Saya telah menjalankan matriks korelasi, dan 5 di antaranya memiliki korelasi rendah dengan DV. Saya kemudian menjalankan beberapa regresi bertahap untuk melihat apakah ada / semua IVs dapat memprediksi DV. Regresi menunjukkan bahwa hanya dua IV yang dapat memprediksi DV (hanya dapat …

2
Menskalakan variabel terbelakang dalam HMM Baum-Welch
Saya hanya mencoba untuk mengimplementasikan algoritma Baum-Welch yang diskalakan dan saya telah mengalami masalah di mana variabel terbelakang saya, setelah penskalaan, berada di atas nilai 1. Apakah ini normal? Bagaimanapun, probabilitas tidak boleh lebih dari 1. Saya menggunakan faktor skala yang saya dapatkan dari variabel forward: ct=1/∑s∈Sαt(s)ct=1/∑s∈Sαt(s) c_t = 1 …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.