Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Apakah masuk akal untuk menggabungkan PCA dan LDA?
Asumsikan saya memiliki dataset untuk tugas klasifikasi statistik terawasi, misalnya, melalui pengklasifikasi Bayes. Dataset ini terdiri dari 20 fitur dan saya ingin meringkasnya menjadi 2 fitur melalui teknik pengurangan dimensionalitas seperti Principal Component Analysis (PCA) dan / atau Linear Discriminant Analysis (LDA). Kedua teknik memproyeksikan data ke subruang fitur yang …


3
Alasan intuitif di balik penaksir kemungkinan maksimum yang bias
Saya bingung tentang penaksir bias kemungkinan maksimum (ML). Matematika dari seluruh konsep cukup jelas bagi saya, tetapi saya tidak dapat menemukan alasan intuitif di baliknya. Mengingat dataset tertentu yang memiliki sampel dari distribusi, yang dengan sendirinya merupakan fungsi dari parameter yang ingin kami perkirakan, estimator ML menghasilkan nilai untuk parameter …

2
Korelasi antara estimator OLS untuk intersep dan kemiringan
Dalam model regresi sederhana, y=β0+β1x+ε,y=β0+β1x+ε, y = \beta_0 + \beta_1 x + \varepsilon, estimator OLS dan berkorelasi.ββ^O L S0β^0OLS\hat{\beta}_0^{OLS}β^O L S1β^1OLS\hat{\beta}_1^{OLS} Rumus untuk korelasi antara kedua penaksir adalah (jika saya mendapatkannya dengan benar): Kor( β^O L S0, β^O L S1) = - Âni = 1xsayan--√∑ni = 1x2saya-------√.Corr⁡(β^0OLS,β^1OLS)=−∑i=1nxin∑i=1nxi2. \operatorname{Corr}(\hat{\beta}_0^{OLS},\hat{\beta}_1^{OLS}) = \frac{-\sum_{i=1}^{n}x_i}{\sqrt{n} …



5
Bagaimana cara menguji dan menghindari multikolinearitas dalam model linier campuran?
Saat ini saya menjalankan beberapa model linear efek campuran. Saya menggunakan paket "lme4" di R. Model saya mengambil bentuk: model <- lmer(response ~ predictor1 + predictor2 + (1 | random effect)) Sebelum menjalankan model saya, saya memeriksa kemungkinan multikolinieritas antara prediktor. Saya melakukan ini dengan: Buat kerangka data prediksi dummy_df …

2
Bagaimana cara menggunakan hasil R prcomp untuk prediksi?
Saya memiliki data.frame dengan 800 obs. dari 40 variabel, dan ingin menggunakan Analisis Komponen Prinsip untuk meningkatkan hasil prediksi saya (yang sejauh ini bekerja paling baik dengan Mesin Vector Support pada sekitar 15 variabel pilihan). Saya mengerti prcomp dapat membantu saya meningkatkan prediksi saya, tetapi saya tidak tahu bagaimana cara …
25 r  pca 

1
"Estimasi kepadatan kernel" adalah konvolusi dari apa?
Saya mencoba untuk mendapatkan pemahaman yang lebih baik tentang estimasi kepadatan kernel. Menggunakan definisi dari Wikipedia: https://en.wikipedia.org/wiki/Kernel_density_estimation#Definition fh^(x)=1n∑ni=1Kh(x−xi)=1nh∑ni=1K(x−xih)fh^(x)=1n∑i=1nKh(x−xi)=1nh∑i=1nK(x−xih) \hat{f_h}(x) = \frac{1}{n}\sum_{i=1}^n K_h (x - x_i) \quad = \frac{1}{nh} \sum_{i=1}^n K\Big(\frac{x-x_i}{h}\Big) Mari kita ambil K()K()K() menjadi fungsi persegi panjang yang memberikan 111 jika xxx adalah antara −0.5−0.5-0.5 dan 0.50.50.5 dan 000 …

4
Memeriksa asumsi model campuran lmer / lme dalam R
Saya menjalankan desain berulang dimana saya menguji 30 pria dan 30 wanita di tiga tugas yang berbeda. Saya ingin memahami bagaimana perilaku pria dan wanita berbeda dan bagaimana itu tergantung pada tugas. Saya menggunakan paket lmer dan lme4 untuk menyelidiki ini, namun, saya terjebak dengan mencoba memeriksa asumsi untuk kedua …

3
LSA vs PCA (pengelompokan dokumen)
Saya menyelidiki berbagai teknik yang digunakan dalam pengelompokan dokumen dan saya ingin menghapus beberapa keraguan tentang PCA (analisis komponen utama) dan LSA (analisis semantik laten). Hal pertama - apa perbedaan di antara mereka? Saya tahu bahwa di PCA, dekomposisi SVD diterapkan ke matriks term-kovarians, sedangkan di LSA itu adalah matriks …

1
Apa nilai kriteria Calinski & Harabasz (CH) yang dapat diterima?
Saya telah melakukan analisis data yang mencoba mengelompokkan data longitudinal menggunakan paket R dan kml . Data saya berisi sekitar 400 lintasan individu (seperti yang disebut di koran). Anda dapat melihat hasil saya di gambar berikut: Setelah membaca bab 2.2 "Memilih jumlah cluster yang optimal" di makalah yang sesuai saya …


2
Apa yang setara dengan Bayesian untuk tes kecocokan umum?
Saya memiliki dua set data, satu dari serangkaian pengamatan fisik (suhu), dan satu dari rangkaian model numerik. Saya sedang melakukan analisis model-sempurna, dengan asumsi ansambel model mewakili sampel yang benar dan independen, dan memeriksa untuk melihat apakah pengamatan diambil dari distribusi itu. Statistik yang saya hitung dinormalisasi, dan secara teoritis …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.