Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



3
Masalah perangkap variabel dummy
Saya menjalankan regresi OLS besar di mana semua variabel independen (sekitar 400) adalah variabel dummy. Jika semua termasuk, ada multikolinieritas sempurna (perangkap variabel dummy), jadi saya harus menghilangkan salah satu variabel sebelum menjalankan regresi. Pertanyaan pertama saya adalah, variabel mana yang harus dihilangkan? Saya telah membaca bahwa lebih baik untuk …



6
Menemukan titik perubahan dalam data dari fungsi linear piecewise
Salam pembuka, Saya melakukan penelitian yang akan membantu menentukan ukuran ruang yang diamati dan waktu yang berlalu sejak big bang. Semoga Anda bisa membantu! Saya memiliki data yang sesuai dengan fungsi linear piecewise di mana saya ingin melakukan dua regresi linier. Ada titik di mana perubahan kemiringan dan mencegat, dan …

1
Bagaimana cara menangani pertanyaan survei dengan beberapa respons?
Saya memiliki dataset yang menanyakan kepada orang-orang apakah mereka pernah ke tempat tertentu (misalnya A, B, C, D), dan mereka dapat membuat lebih dari satu pilihan, kemudian spesimen diambil dari hidung mereka untuk melihat apakah mereka terinfeksi dengan beberapa penyakit. Saya perlu mengetahui risiko relatif terinfeksi untuk orang yang pergi …
10 logistic 

4
Dengan rantai 10M MCMC, bagaimana saya bisa menentukan mode posteriornya di R?
Pertanyaan: Dengan rantai MCMC 10 dimensi, katakanlah saya siap memberikan Anda sebuah matriks undian: 100.000 iterasi (baris) dengan 10 parameter (kolom), bagaimana cara terbaik saya mengidentifikasi mode posterior? Saya terutama memperhatikan beberapa mode. Latar Belakang:Saya menganggap diri saya seorang ahli statistik yang mengerti secara komputasi, tetapi ketika seorang kolega bertanya …

5
Omega kuadrat untuk mengukur efek dalam R?
Buku statistik yang saya baca merekomendasikan omega kuadrat untuk mengukur efek percobaan saya. Saya telah membuktikan menggunakan desain plot terpisah (campuran antara subyek dan desain antara subyek) bahwa faktor dalam subyek saya signifikan secara statistik dengan p <0,001 dan F = 17. Sekarang saya ingin melihat seberapa besar perbedaannya ... …

1
Output dari model logistik di R
Saya mencoba menafsirkan tipe model logistik berikut: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) Apakah output dari predict(mdl)peluang keberhasilan yang diharapkan untuk setiap titik data? Apakah ada cara sederhana untuk menabulasi peluang untuk setiap tingkat faktor model, daripada semua titik data?


3
Jika
Untuk variabel acak berkesinambungan XXX , jika E(|X|)E(|X|)E(|X|) adalah terbatas, apakah limn→∞nP(|X|>n)=0limn→∞nP(|X|>n)=0\lim_{n\to\infty}n P(|X|>n)=0 ? Ini adalah masalah yang saya temukan di internet, tetapi saya tidak yakin apakah itu berfungsi atau tidak. Saya tahu bahwa nP(|X|>n)<E(|X|)nP(|X|>n)<E(|X|)n P(|X|>n)


1
Standarisasi variabel dan kolinearitas
Collinearity dapat menimbulkan masalah tertentu dalam berbagai macam masalah regresi. Secara khusus, ini dapat membuat estimasi parameter memiliki varian tinggi dan menjadi tidak stabil. Berbagai metode telah diusulkan untuk menangani hal ini termasuk regresi ridge, regresi kuadrat terkecil parsial, regresi komponen utama, menjatuhkan variabel dan mendapatkan lebih banyak data. Salah …

2
Mengapa tidak menggunakan teorema Bayes dalam bentuk ?
Ada banyak pertanyaan (seperti ini ) tentang beberapa ambiguitas dengan formula Bayes dalam kasus berkelanjutan. p ( θ | x ) =p(x|θ)⋅p(θ)p(x)p(θ|x)=p(x|θ)⋅p(θ)p(x)p(\theta | x) = \frac{p(x | \theta) \cdot p(\theta)}{p(x)} Sering kali, kebingungan timbul dari kenyataan bahwa definisi distribusi bersyarat dijelaskan sebagai menjadi fungsi diberikan tetap .f(variable|parameter)f(variable|parameter)f(variable | parameter) fffv …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.