Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Interval kepercayaan untuk median
Saya memiliki distribusi sampel dengan sejumlah kecil nilai di masing-masing (kurang dari ). Saya telah menghitung median untuk setiap sampel, yang ingin saya bandingkan dengan model dan mendapatkan perbedaan antara model dan median masing-masing sampel. Untuk mendapatkan hasil yang konsisten, saya memerlukan kesalahan pada perbedaan ini.101010 Hasilnya menemukan bahwa standar …

1
Hitung tingkat insiden menggunakan model poisson: hubungan dengan rasio bahaya dari model Cox PH
Saya ingin menghitung tingkat kejadian untuk disajikan di sepanjang rasio bahaya untuk menyajikan ukuran risiko relatif dan absolut. Saya melihat dalam penelitian lain bahwa tingkat kejadian seperti itu dapat dihitung menggunakan model poisson dengan waktu tindak lanjut dalam model sebagai offset. Jadi saya mencobanya di R sebagai berikut: library(survival) # …

1
Haruskah saya mengecualikan efek acak dari model jika tidak signifikan secara statistik?
Haruskah saya memasukkan efek acak dalam model bahkan jika mereka tidak signifikan secara statistik? Saya memiliki desain eksperimental tindakan berulang, di mana setiap individu mengalami tiga perawatan yang berbeda dalam urutan acak. Saya ingin mengontrol efek individu dan ketertiban, tetapi tidak ada yang secara statistik signifikan dalam model saya. Apakah …

4
Sesuaikan untuk semua yang Anda miliki dalam skor kecenderungan?
Saya punya pertanyaan metodologis, dan karenanya tidak ada dataset sampel yang dilampirkan. Saya berencana untuk melakukan skor kecenderungan regresi Cox yang disesuaikan yang bertujuan untuk memeriksa apakah obat tertentu akan mengurangi risiko hasil. Penelitian ini bersifat observasional, terdiri dari 10.000 orang. Kumpulan data berisi 60 variabel. Saya menilai bahwa 25 …

1
Menemukan pencilan pada plot pencar
Saya memiliki satu set titik data yang seharusnya duduk di lokus dan mengikuti pola, tetapi ada beberapa titik hamburan dari lokus utama yang menyebabkan ketidakpastian dalam analisis akhir saya. Saya ingin mendapatkan lokus yang rapi untuk menerapkannya nanti untuk analisis saya. Poin biru kurang lebih adalah poin sebaran yang ingin …


2
Bagaimana nilai CP (Kompleksitas Biaya) dihitung dalam RPART (atau pohon keputusan secara umum)
Dari apa yang saya mengerti, argumen cp ke rpartfungsi membantu pra-pangkas pohon dengan cara yang sama dengan argumen menitplit atau minbucket. Yang tidak saya mengerti adalah bagaimana nilai CP dihitung. Sebagai contoh df<-data.frame(x=c(1,2,3,3,3,4), y=as.factor(c(TRUE, TRUE, FALSE, TRUE, FALSE, FALSE)), method="class") mytree<-rpart(y ~ x, data = df, minbucket = 1, minsplit=1) …
9 r  cart  rpart 

1
Membandingkan residu antara regresi OLS dan non-OLS
Misalkan Anda ingin memperkirakan model linier: ( pengamatan respons, dan prediktor) nnnp+1p+1p+1E(yi)=β0+∑j=1pβjxijE(yi)=β0+∑j=1pβjxij\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Salah satu cara untuk melakukan ini adalah melalui solusi OLS, yaitu memilih koefisien sehingga jumlah kesalahan kuadrat minimum: (β0,β1, ⋯ ,βhal)T=argminβ0,β1, ⋯ ,βhal∑i = 1n(ysaya-β0-∑j = 1halβjxsaya j)2(β0,β1,⋯,βhal)T=arg⁡minβ0,β1,⋯,βhal∑saya=1n(ysaya-β0-∑j=1halβjxsayaj)2(\beta_0,\beta_1,\cdots,\beta_p)^T = \underset{\beta_0,\beta_1,\cdots,\beta_p}{\arg \min} \sum_{i=1}^{n} …




1
Mengkuantifikasi seberapa banyak “lebih banyak korelasi” yang terkandung dalam matriks korelasi A dibandingkan dengan matriks korelasi B
Saya memiliki 2 matriks korelasi dan (menggunakan koefisien korelasi linear Pearson melalui corrcoef Matlab () ). Saya ingin menghitung berapa banyak "lebih korelasi" berisi dibandingkan dengan . Apakah ada metrik atau tes standar untuk itu?SEBUAHAABBBSEBUAHAABBB Misalnya matriks korelasi mengandung "lebih banyak korelasi" daripada Saya mengetahui Box M Test , yang …

2
Dapatkah saya melakukan Analisis Daya Uji-t untuk Kelompok Ukuran Tidak Sama yang Menghasilkan 2 Minimum Berbeda?
Biasanya mudah dilakukan Power Analysisuntuk menghitung minimum sample size, terutama dalam R yang merupakan lingkungan komputasi statistik pilihan saya. Namun, saya diminta untuk melakukan Analisis Kekuatan yang sedikit berbeda dari apa pun yang telah saya lakukan atau yang dapat saya temukan referensi online. Saya bertanya-tanya apakah apa yang saya minta …

1
Teori Nilai Ekstrim: Parameter GEV lognormal
Distribusi lognormal milik domain daya tarik maksimum Gumbel , di mana: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right) , FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Pertanyaan saya : Apakah kita memiliki dan ?μ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta The distribusi nilai ekstrim juga menggunakan notasi (Gumbel adalah batas kasus ), dan membandingkan CDFS untuk Standar-Lognormal dan Standard-Gumbel lagi akan berarti …

2
Bagaimana menyiapkan interaksi variabel kategorikal dalam scikit-learning?
Apa cara terbaik untuk mempersiapkan interaksi fitur-fitur kategorikal sebelum disesuaikan dengan scikit-learn? Dengan statsmodelssaya bisa dengan mudah mengatakan dalam gaya R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(sama di Stata dengan regress depvar i.var1##i.var2). Bisakah sklearn.preprocessing.PolynomialFeatures(dalam v0.15, saat ini dev) digunakan dengan variabel kategori?

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.