Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana menjalankan ANOVA dua arah pada data tanpa normalitas atau persamaan varians dalam R?
Saya sedang mengerjakan tesis master saya saat ini dan berencana menjalankan statistik dengan SigmaPlot. Namun, setelah menghabiskan beberapa waktu dengan data saya, saya sampai pada kesimpulan bahwa SigmaPlot mungkin tidak cocok untuk masalah saya (saya mungkin salah) jadi saya memulai upaya pertama saya di R, yang sebenarnya tidak membuatnya lebih …

3
Apakah MLE memerlukan data iid? Atau hanya parameter independen?
Memperkirakan parameter menggunakan estimasi likelihood maksimum (MLE) melibatkan mengevaluasi fungsi likelihood, yang memetakan probabilitas sampel (X) yang terjadi pada nilai (x) pada ruang parameter (family) yang diberikan keluarga distribusi (P (X = x | θ ) lebih dari nilai yang mungkin dari θ (catatan: apakah saya benar tentang ini?). Semua …

4
Membersihkan data format tidak konsisten dalam R?
Saya sering berurusan dengan data survei yang berantakan yang membutuhkan banyak pembersihan sebelum statistik dapat dilakukan. Saya biasa melakukan ini "secara manual" di Excel, kadang-kadang menggunakan rumus Excel, dan kadang-kadang memeriksa entri satu-per-satu. Saya mulai melakukan semakin banyak tugas ini dengan menulis skrip untuk melakukannya di R, yang sangat bermanfaat …
16 r  data-cleaning 

2
Menghitung kesalahan standar dalam estimasi rata-rata tertimbang
Misalkan dan masing-masing diambil iid dari beberapa distribusi, dengan independen dari . The secara ketat positif. Anda mengamati semua , tetapi bukan ; Anda lebih mengamati . Saya tertarik memperkirakan dari informasi ini. Jelas penaksir tidak bias, dan dapat dihitung dengan memberikan informasi yang ada.w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_nw i x i w i …

3
Perhitungan deviasi standar baru menggunakan deviasi standar lama setelah perubahan dalam dataset
Saya memiliki array nilai riil, yang memiliki rata-rata μ o l d dan standar deviasi σ o l d . Jika elemen array x i digantikan oleh elemen lain x j , maka rata-rata baru akan menjadinnnμoldμold\mu_{old}σoldσold\sigma_{old}xixix_ixjxjx_j μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} Keuntungan dari pendekatan ini adalah ia membutuhkan perhitungan yang konstan terlepas dari …

3
Menemukan MLE untuk proses Hawkes eksponensial univariat
Proses Hawkes eksponensial univariat adalah proses poin yang menarik sendiri dengan tingkat kedatangan peristiwa: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} di mana t1,..tnt1,..tn t_1,..t_n adalah kali event kedatangan. Fungsi kemungkinan log adalah −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} yang dapat dihitung secara rekursif: …

1
Menafsirkan hasil uji kausalitas Granger
Saya mencoba mendidik diri sendiri tentang Granger Causality. Saya sudah membaca posting di situs ini dan beberapa artikel bagus online. Saya juga menemukan alat yang sangat membantu, Bivariate Granger Causality - Kalkulator Statistik Gratis , yang memungkinkan Anda untuk memasukkan deret waktu dan menghitung Granger Stats. Di bawah, adalah output …

1
Menggunakan R dan plm untuk memperkirakan model efek tetap yang mencakup interaksi dengan waktu
Saya menggunakan plm()untuk memperkirakan model efek tetap dari formulir y ~ x + time + time:fixed_trait di mana fixed_traitvariabel yang bervariasi antar individu tetapi konstan dalam individu. Inti dari berinteraksi timedengan fixed_traitadalah untuk memungkinkan efek fixed_traitbervariasi sepanjang waktu. (Saya bekerja di sini dari buklet terbaru Paul Allison tentang efek tetap. …
16 r 


6
Implementasi SVM tercepat
Lebih banyak pertanyaan umum. Saya menjalankan SVF rbf untuk pemodelan prediktif. Saya pikir program saya saat ini jelas perlu sedikit mempercepat. Saya menggunakan scikit belajar dengan pencarian kasar ke grid + validasi silang. Setiap menjalankan SVM membutuhkan waktu sekitar satu menit, tetapi dengan semua iterasi, saya masih menemukannya terlalu lambat. …

2
Apa alternatif untuk dimensi VC untuk mengukur kompleksitas jaringan saraf?
Saya telah menemukan beberapa cara dasar untuk mengukur kompleksitas jaringan saraf: Naif dan informal: hitung jumlah neuron, neuron tersembunyi, lapisan, atau lapisan tersembunyi Dimensi VC (Eduardo D. Sontag [1998] "Dimensi VC dari jaringan saraf" [ pdf ].) Suatu ukuran kompleksitas komputasiTC0dTCd0TC^0_d berbutir dan asimptotik dengan ekivalensi dengan T C 0 …

4
Intuisi di balik distribusi kuasa hukum
Saya tahu bahwa pdf dari distribusi hukum kuasa adalahp(x)=α−1xmin(xxmin)−αp(x)=α−1xmin(xxmin)−α p(x) = \frac{\alpha-1}{x_{\text{min}}} \left(\frac{x}{x_{\text{min}}} \right)^{-\alpha} Tapi apa artinya secara intuitif jika, misalnya, harga saham mengikuti distribusi kuasa hukum? Apakah ini berarti bahwa kerugian bisa sangat tinggi tetapi jarang terjadi?

1
Bagaimana menganalisis data jumlah longitudinal: akuntansi untuk autokorelasi temporal di GLMM?
Halo guru statistik dan ahli pemrograman R, Saya tertarik dalam memodelkan tangkapan hewan sebagai fungsi dari kondisi lingkungan dan hari dalam setahun. Sebagai bagian dari penelitian lain, saya memiliki jumlah tangkapan pada ~ 160 hari selama tiga tahun. Pada setiap hari ini saya memiliki suhu, curah hujan, kecepatan angin, kelembaban …


6
Di mana menemukan corpus teks besar? [Tutup]
Tutup. Pertanyaan ini di luar topik . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga sesuai topik untuk Cross Validated. Ditutup 6 tahun yang lalu . Saya mencari korpus teks besar (&gt; 1000) untuk diunduh. Lebih disukai dengan berita dunia atau semacam laporan . Saya hanya …
16 dataset 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.