Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Menemukan indeks kolom dengan namanya di R [ditutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 6 tahun yang lalu . Dalam bingkai data, saya ingin mendapatkan indeks kolom dengan nama. Sebagai contoh: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) Saya ingin tahu indeks kolom …
11 r 

1
Metode grafis apa yang berguna untuk memvisualisasikan bagaimana ketidakpastian agregat?
Saya memiliki satu set sistem di mana ketidakpastian menumpuk di dalamnya. Ini tidak selalu murni aditif - kadang-kadang mereka, kadang-kadang tidak. Saya sudah cukup sukses dalam menggunakan bagan penggemar, bagan batang dengan interval kepercayaan, dan plot kotak untuk berkomunikasi item tunggal. Tetapi bagaimana saya bisa menunjukkan bagaimana ketidakpastian menumpuk dan …


1
Simulasi seri ARIMA (1,1,0)
Saya telah memasang model ARIMA ke seri waktu asli, dan model terbaik adalah ARIMA (1,1,0). Sekarang saya ingin mensimulasikan seri dari model itu. Saya menulis model AR (1) sederhana, tetapi saya tidak bisa mengerti bagaimana menyesuaikan perbedaan dalam model ARI (1,1,0). Kode R untuk seri AR (1) berikut adalah: phi= …
11 r  time-series  arima 

2
Varian dari dua variabel acak tertimbang
Membiarkan: Simpangan baku variabel acak A=σ1=5A=σ1=5A =\sigma_{1}=5 Simpangan baku variabel acak B=σ2=4B=σ2=4B=\sigma_{2}=4 Maka varian A + B adalah: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Dimana: adalah korelasi antara dua variabel acak.p1,2p1,2p_{1,2} adalah bobot variabel acak Aw1w1w_{1} adalah bobot variabel acak Bw2w2w_{2} w1+w2=1w1+w2=1w_{1}+w_{2}=1 Gambar di bawah ini memplot varian A dan B ketika bobot …

4
Bagaimana Anda menguji implementasi k-means?
Penafian: Saya memposting pertanyaan ini di Stackoverflow, tapi saya pikir mungkin ini lebih cocok untuk platform ini. Bagaimana Anda menguji implementasi k-means Anda sendiri untuk set data multidimensi? Saya sedang berpikir untuk menjalankan implementasi yang sudah ada (yaitu, Matlab) pada data dan membandingkan hasilnya dengan algoritma saya. Tetapi ini akan …

3
Bagaimana cara melakukan uji-t dengan sampel besar?
Saya memiliki dua populasi, Satu dengan N = 38.704 (jumlah pengamatan) dan lainnya dengan N = 1.313.662. Set data ini memiliki ~ 25 variabel, semuanya bersambungan. Saya mengambil rata-rata dari setiap set data dan menghitung statistik uji menggunakan rumus t = rata-rata perbedaan / kesalahan std Masalahnya adalah tingkat kebebasan. …
11 t-test 

1
Mengapa Menggunakan Ekspansi Cornish-Fisher Daripada Jumlah Sampel?
The Cornish-Fisher Ekspansi menyediakan cara untuk memperkirakan quantiles dari distribusi berdasarkan momen. (Dalam hal ini, saya melihatnya sebagai pelengkap dari Edgeworth Expansion , yang memberikan perkiraan distribusi kumulatif berdasarkan momen.) Saya ingin tahu di situasi mana seseorang akan lebih memilih ekspansi Cornish-Fisher untuk pekerjaan empiris di atas sampel kuantil, atau …

2
Soft-thresholding vs. Lasso adu penalti
Saya mencoba untuk meringkas apa yang saya mengerti sejauh ini dalam analisis multivariat yang dihukum dengan set data dimensi tinggi, dan saya masih berjuang melalui mendapatkan definisi yang tepat dari hukuman lunak thresholding vs Lasso (atau ).L1L1L_1 Lebih tepatnya, saya menggunakan regresi PLS jarang untuk menganalisis struktur data 2-blok termasuk …

5
Apa cara yang ada untuk menunjukkan dua metode analitis yang setara?
Saya memiliki dua metode analitik berbeda yang dapat mengukur konsentrasi molekul tertentu dalam matriks (misalnya mengukur jumlah garam dalam air) Dua metode berbeda, dan masing-masing memiliki kesalahan sendiri. Cara apa yang ada untuk menunjukkan kedua metode itu setara (atau tidak). Saya berpikir bahwa memplot hasil dari sejumlah sampel yang diukur …

1
Seberapa berbeda spline kubik terbatas dan spline dihukum?
Saya banyak membaca tentang menggunakan splines dalam berbagai masalah regresi. Beberapa buku (misalnya Hodges Richly Parrameterized Linear Models ) merekomendasikan splines yang dikenakan sanksi. Yang lainnya (mis . Strategi Pemodelan Regresi Harrell ) memilih splines kubik terbatas. Seberapa berbeda hal ini dalam praktiknya? Apakah Anda sering mendapatkan hasil yang berbeda …

1
Apa yang dimaksud dengan istilah "jarang sebelumnya" (FBProphet Paper)?
Membaca makalah "Forecasting at Scale" (alat peramalan FBProphet, lihat https://peerj.com/preprints/3190.pdf ) Saya menemukan istilah "jarang sebelumnya". Para penulis menjelaskan bahwa mereka menggunakan "jarang sebelumnya" dalam pemodelan vektor penyimpangan tingkat dari beberapa tingkat skalar , yang merupakan parameter model dalam model pertumbuhan logistik.δδ\mathbf{\delta}kkk Ketika mereka menyatakan bahwa , apakah saya mengerti …


2
Apa intuisi di balik perbedaan urutan kedua?
Kadang-kadang sebuah seri waktu mungkin perlu dibedakan untuk dibuat diam. Namun saya tidak mengerti bagaimana perbedaan urutan kedua dapat membantu membuatnya stasioner ketika perbedaan urutan pertama tidak cukup. Bisakah Anda memberikan penjelasan intuitif untuk perbedaan urutan kedua dan kasus di mana diperlukan?

2
Bukankah beberapa filter dalam lapisan konvolusional mempelajari parameter yang sama selama pelatihan?
Berdasarkan dari apa yang telah saya pelajari, kami menggunakan beberapa filter dalam Conv Layer CNN untuk mempelajari berbagai detektor fitur. Tetapi karena filter ini diterapkan dengan cara yang sama (yaitu digeser dan dikalikan dengan wilayah input), bukankah mereka hanya mempelajari parameter yang sama selama pelatihan? Karenanya penggunaan beberapa filter akan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.