Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
R sebagai alternatif SAS untuk data besar
Saya tahu bahwa R tidak terlalu membantu untuk menganalisis dataset besar mengingat R memuat semua data dalam memori sedangkan sesuatu seperti SAS melakukan analisis sekuensial. Yang mengatakan, ada paket seperti bigmemory yang memungkinkan pengguna untuk melakukan analisis data besar (analisis statistik) lebih efisien di R. Saya ingin tahu, terlepas dari …
8 r  sas  large-data 

2
Mensimulasikan jalur sampel perkiraan dari model tbats
Menggunakan paket ramalan yang sangat baik oleh Rob Hyndman, saya menemukan perlunya tidak hanya memiliki interval prediksi, tetapi untuk mensimulasikan sejumlah jalur masa depan, mengingat pengamatan masa lalu dari serangkaian waktu dengan musiman kompleks. Ada sesuatu untuk deret waktu yang kurang kompleks dengan satu atau dua musiman saja (simulate.ets () …

4
Bagaimana saya bisa mengambil sampel dari distribusi dengan CDF yang tidak dapat dihitung?
Simulasi ilmu semi-komputer terkait masalah di sini. Saya punya distribusi di mana P (x) =(eb−1)eb(n−x)ebn+b−1(eb−1)eb(n−x)ebn+b−1\frac{(e^b-1) e^{b (n-x)}}{e^{b n+b}-1} untuk beberapa konstanta b dan n, dan x adalah bilangan bulat sehingga .0≤x≤n0≤x≤n0\leq x \leq n Sekarang, saya perlu sampel dari distribusi ini. Ini memiliki CDF yang dapat dibalik, jadi dimungkinkan untuk …


1
Menerapkan Recency Dalam Regresi Logistik
Apakah ada konsep atau teori statistik tentang cara mengukur kebaruan dengan efektif di mana peristiwa baru-baru ini diberi bobot lebih dari yang lebih tua. Saya membuat model regresi logistik dan ingin menerapkan penyesuaian pada berbagai faktor berdasarkan peristiwa yang baru terjadi. ... atau, apakah semata-mata terserah saya untuk membuat formula …

2
Untuk distribusi apa yang dipangkas berarti penaksir kemungkinan maksimum?
Sampel rata-rata adalah penduga kemungkinan maksimum μμ\mu untuk distribusi normal Normal ( μ , σ)Normal(μ,σ)\text{Normal}(\mu,\sigma). Median sampel adalah penaksir kemungkinan maksimum sebesarmmmuntuk distribusi Laplace Laplace ( m , s )Laplace(m,s)\text{Laplace}(m,s) (Juga disebut distribusi eksponensial ganda). Apakah distribusi ada dengan parameter lokasi yang berarti rata-rata sampel yang dipangkas adalah penaksir kemungkinan …



1
Memprediksi pemenang pertandingan sepak bola hanya berdasarkan hasil pertandingan sebelumnya antara kedua tim
Saya penggemar berat sepakbola dan tertarik pada pembelajaran mesin juga. Sebagai proyek untuk kursus ML saya, saya mencoba membangun model yang akan memprediksi peluang menang untuk tim tuan rumah, mengingat nama-nama tim tuan rumah dan tandang. (Saya menanyakan dataset saya dan karenanya membuat titik data berdasarkan pertandingan sebelumnya antara kedua …

1
Tidak dapat mencocokkan regresi binomial negatif dalam R (berusaha mereplikasi hasil yang dipublikasikan)
Mencoba untuk mereplikasi hasil dari artikel yang baru diterbitkan, Aghion, Philippe, John Van Reenen, dan Luigi Zingales. 2013. "Inovasi dan Kepemilikan Institusional." American Economic Review, 103 (1): 277-304. (Data dan kode stata tersedia di http://www.aeaweb.org/aer/data/feb2013/20100973_data.zip ). Saya tidak memiliki masalah untuk menciptakan 5 regresi pertama dalam R (menggunakan metode OLS …


3
Contoh tandingan untuk kondisi yang cukup yang diperlukan untuk konsistensi
Kita tahu bahwa jika estimator adalah estimator yang tidak bias dari theta dan jika variansenya cenderung 0 karena n cenderung tak terhingga maka itu adalah estimator yang konsisten untuk theta. Tetapi ini adalah kondisi yang cukup dan tidak perlu. Saya mencari contoh estimator yang konsisten tetapi variansnya cenderung 0 karena …

2
Anova dari interpretasi output R
Saya punya pertanyaan tentang bagaimana seorang ahli statistik biasanya menafsirkan output anova. Katakanlah saya memiliki output anova dari R. > summary(fitted_data) Call: lm(formula = V1 ~ V2) Residuals: Min 1Q Median 3Q Max -2.74004 -0.33827 0.04062 0.44064 1.22737 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 2.11405 0.32089 6.588 1.3e-09 …

1
Apakah akar kuadrat dari matriks semi-pasti positif adalah hasil yang unik?
Saya mencoba menguraikan serangkaian waktu nnn pengamatan vcvc\bf{\mathrm{v_c}} ke dalam n×nn×nn \times n struktur varians-kovarians ∑∑\sum dan seri acak vv\bf{\mathrm{v}}. Jadi, saya bisa menurunkan matriks varians-kovarians ∑∑\sum dari fungsi autokorelasi vcvc\bf{\mathrm{v_c}}. Ini akan menjadi matriks Toeplitz, yang merupakan semidefinite positif. Oleh karena itu, saya dapat menghitung matriks yang sesuai∑−12∑−12\sum^{-\frac{1}{2}} untuk …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.