Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Bagaimana menemukan nilai optimal untuk parameter tuning dalam meningkatkan pohon?
Saya menyadari bahwa ada 3 parameter penyetelan dalam model meningkatkan pohon, yaitu jumlah pohon (jumlah iterasi) parameter penyusutan jumlah pemisahan (ukuran masing-masing pohon penyusun) Pertanyaan saya adalah: untuk setiap parameter penyetelan, bagaimana saya harus menemukan nilai optimalnya? Dan metode apa? Perhatikan bahwa: parameter susut dan jumlah parameter pohon beroperasi bersama, …

1
tes anova tipe III untuk GLMM
Saya memasang glmermodel dalam lme4paket R. Saya mencari tabel anova dengan nilai p yang ditunjukkan di sini, tetapi saya tidak dapat menemukan paket yang cocok. Apakah mungkin melakukannya di R? Model yang saya pas adalah dalam bentuk: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))


1
Kekuasaan dalam proteomik?
Hibah sering memerlukan analisis daya untuk mendukung ukuran sampel yang diusulkan. Dalam proteomik (dan sebagian besar -omik), ada 100 hingga 1000 fitur / variabel yang diukur pada 10 sampel (mungkin 100-an, tetapi tidak mungkin). Juga, diketahui bahwa beberapa unit pengukuran ini (misalnya, jumlah spektral protein) tidak terdistribusi secara normal sehingga …

4
Membantu menafsirkan alur interaksi?
Saya mengalami kesulitan menafsirkan plot interaksi ketika ada interaksi antara dua variabel independen. Grafik berikut berasal dari situs ini : Di sini, dan adalah variabel independen dan adalah variabel dependen.B D VSEBUAHAABBBD VDVDV Pertanyaan: Ada interaksi dan efek utama , tetapi tidak ada efek utamaBSEBUAHAABBB Saya dapat melihat bahwa semakin …

5
Regresi Logistik pada Big Data
Saya memiliki kumpulan data sekitar 5000 fitur. Untuk data itu saya pertama kali menggunakan uji Chi Square untuk pemilihan fitur; setelah itu, saya mendapat sekitar 1500 variabel yang menunjukkan hubungan signifikan dengan variabel respon. Sekarang saya harus menyesuaikan regresi logistik. Saya menggunakan paket glmulti untuk R (paket glmulti menyediakan pilihan …



1
Distribusi mana yang digunakan untuk memodelkan waktu baca halaman web?
Saya memiliki fungsi yang mengembalikan waktu tunggu rata-rata untuk pengguna web. Artinya, ini memberikan waktu rata-rata bahwa pengguna rata-rata dapat tinggal di halaman web, mengingat panjang sumber daya web dalam kata-kata. Saya ingin menggunakan fungsi ini (dan rata-rata yang dihasilkan) bersamaan dengan distribusi untuk memodelkan 'pengguna web rata-rata' yang menjelajahi …

3
Bagaimana memasukkan
Saya ingin memasukkan istilah xxx dan kuadrat x2x2x^2 (variabel prediktor) ke dalam regresi karena saya berasumsi bahwa nilai rendah xxx memiliki efek positif pada variabel dependen dan nilai-nilai tinggi memiliki efek negatif. The x2x2x^2 harus menangkap efek dari nilai-nilai yang lebih tinggi. Karena itu saya berharap bahwa koefisien xxx akan …

2
Mengapa residu Pearson dari regresi binomial negatif lebih kecil daripada residu dari regresi poisson?
Saya punya data ini: set.seed(1) predictor <- rnorm(20) set.seed(1) counts <- c(sample(1:1000, 20)) df <- data.frame(counts, predictor) Saya menjalankan regresi poisson poisson_counts <- glm(counts ~ predictor, data = df, family = "poisson") Dan regresi binomial negatif: require(MASS) nb_counts <- glm.nb(counts ~ predictor, data = df) Lalu saya menghitung statistik dispersi …

2
Estimasi parameter dengan model linier umum
Secara default ketika kami menggunakan glmfungsi dalam R, ia menggunakan metode iteratively reweighted least square (IWLS) untuk menemukan estimasi kemungkinan maksimum parameter. Sekarang saya punya dua pertanyaan. Apakah estimasi IWLS menjamin maksimum global dari fungsi kemungkinan? Berdasarkan slide terakhir dalam presentasi ini , saya pikir tidak! Saya hanya ingin memastikan …

3
Apakah ICA harus menjalankan PCA terlebih dahulu?
Saya meninjau makalah berbasis aplikasi yang mengatakan bahwa menerapkan PCA sebelum menerapkan ICA (menggunakan paket fastICA). Pertanyaan saya adalah, apakah ICA (fastICA) mengharuskan PCA dijalankan terlebih dahulu? Makalah ini menyebutkan itu ... juga berpendapat bahwa pra-penerapan PCA meningkatkan kinerja ICA dengan (1) membuang nilai eigen trailing kecil sebelum memutihkan dan …

1
Distribusi probabilitas fungsi variabel acak?
Saya ragu: pertimbangkan variabel acak bernilai XXX dan ZZZ keduanya didefinisikan pada ruang probabilitas (Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) . Misalkan Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z) , di mana g(⋅)g(⋅)g(\cdot) adalah fungsi bernilai riil. Karena YYY adalah fungsi dari variabel acak, itu adalah variabel acak. Biarkan x:=X(ω)x:=X(ω)x:=X(\omega) yaitu realisasi XXX . Apakah P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x) sama dengan P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z)) …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.