Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Solusi analitik untuk estimasi koefisien regresi-linier
Saya mencoba memahami notasi matriks, dan bekerja dengan vektor dan matriks. Saat ini saya ingin memahami bagaimana vektor estimasi koefisien dalam regresi berganda dihitung.β^β^\hat{\beta} Persamaan dasarnya tampaknya ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. Sekarang bagaimana saya menyelesaikan vektor ββ\beta sini? Sunting : Tunggu, saya mandek. Saya di sini sekarang dan …

3
Apakah salah menggunakan jitter sebelum melakukan tes Wilcoxon?
Saya menulis skrip menguji data menggunakan wilcox.test, tetapi ketika saya mendapatkan hasilnya, semua nilai p sama dengan 1. Saya membaca di beberapa situs web yang dapat Anda gunakan jitter sebelum menguji data (untuk menghindari ikatan seperti yang mereka katakan), Saya melakukan ini dan sekarang saya memiliki hasil yang dapat diterima. …
9 r  nonparametric  ties 

1
Apakah ada cara mudah untuk menggabungkan dua model glm dalam R?
Saya memiliki dua model regresi logistik dalam R yang dibuat dengan glm(). Keduanya menggunakan variabel yang sama, tetapi dibuat menggunakan subset matriks yang berbeda. Apakah ada cara mudah untuk mendapatkan model rata-rata yang memberikan nilai koefisien dan kemudian menggunakannya dengan fungsi predict ()? [maaf jika pertanyaan jenis ini harus diposting …

1
Apakah ada nama untuk jenis bootstrap ini?
Pertimbangkan percobaan dengan beberapa partisipan manusia, masing-masing diukur beberapa kali dalam dua kondisi. Model efek campuran dapat dirumuskan (menggunakan sintaks lme4 ) sebagai: fit = lmer( formula = measure ~ (1|participant) + condition ) Sekarang, katakan saya ingin membuat interval kepercayaan bootstrap untuk prediksi model ini. Saya pikir saya telah …

1
Bagaimana membangun kuadrat untuk proses titik yang sangat berbeda frekuensinya?
Saya ingin melakukan analisis jumlah kuadrat pada beberapa proses titik (atau satu proses titik yang ditandai), untuk kemudian menerapkan beberapa teknik reduksi dimensi. Tanda tidak terdistribusi secara identik, yaitu, beberapa tanda muncul cukup sering, dan beberapa sangat jarang. Jadi, saya tidak bisa hanya membagi ruang 2D saya dalam kotak biasa, …

3
Korelasi Spearman atau Pearson dengan skala Likert di mana linieritas dan homoseksualitas dapat dilanggar
Saya ingin menjalankan korelasi pada sejumlah pengukuran di mana skala Likert digunakan. Melihat plot scatter, tampaknya asumsi linearitas dan homoseksualitas mungkin telah dilanggar. Mengingat bahwa tampaknya ada beberapa perdebatan seputar penilaian tingkat ordinal yang mendekati penskalaan tingkat interval, haruskah saya memainkannya dengan aman dan menggunakan Spearman's Rho daripada r Pearson? …

1
Fungsi diskrit: Cakupan interval kepercayaan?
Bagaimana cara menghitung cakupan interval diskrit? Apa yang saya tahu bagaimana melakukannya: Jika saya memiliki model kontinu, saya bisa menentukan interval kepercayaan 95% untuk masing-masing nilai prediksi saya, dan kemudian melihat seberapa sering nilai aktual berada dalam interval kepercayaan. Saya mungkin menemukan bahwa hanya 88% dari waktu interval kepercayaan 95% …

4
Referensi tentang optimasi numerik untuk ahli statistik
Saya sedang mencari referensi yang solid (atau referensi) pada teknik optimasi numerik yang ditujukan untuk ahli statistik, yaitu, itu akan menerapkan metode ini untuk beberapa masalah inferensial standar (misalnya MAP / MLE dalam model umum). Hal-hal seperti gradient descent (lurus dan stokastik), EM dan spin-off / generalisasi, annealing simulasi, dll. …

2
Bagaimana menemukan hubungan antara berbagai jenis acara (ditentukan oleh lokasi 2D-nya)?
Saya memiliki dataset peristiwa yang terjadi selama periode waktu yang sama. Setiap acara memiliki tipe (ada beberapa tipe berbeda, kurang dari sepuluh) dan lokasi, direpresentasikan sebagai titik 2D. Saya ingin memeriksa apakah ada korelasi antara jenis peristiwa, atau antara jenis dan lokasi. Misalnya, mungkin peristiwa tipe A biasanya tidak terjadi …

2
Apakah mungkin menggunakan kernel PCA untuk pemilihan fitur?
Apakah mungkin untuk menggunakan analisis komponen utama kernel (kPCA) untuk Latent Semantic Indexing (LSI) dengan cara yang sama seperti PCA digunakan? Saya melakukan LSI dalam R menggunakan prcompfungsi PCA dan mengekstrak fitur dengan memuat tertinggi dari komponen pertama . Dengan itu saya mendapatkan fitur yang menggambarkan komponen terbaik.kkk Saya mencoba …

4
Untuk apa kesalahan standar?
Saya menggunakan tutorial yang saya temukan dan merencanakan nilai rata-rata bersama dengan kesalahan standar untuk menampilkan data saya. Tapi saya mengalami masalah dalam membahas hasil. Plot saya seperti yang ditunjukkan di bawah ini: beberapa kesalahan standar (ditampilkan sebagai bilah kesalahan) sangat bervariasi dan beberapa di antaranya sangat mendekati nol.


3
Penggunaan polandia median untuk pemilihan fitur
Dalam sebuah makalah yang saya baca baru-baru ini saya menemukan bit berikut di bagian analisis data mereka: Tabel data kemudian dipecah menjadi jaringan dan garis sel, dan kedua subtabel secara terpisah dipoles median (baris dan kolom secara iteratif disesuaikan memiliki median 0) sebelum bergabung kembali ke dalam satu tabel. Kami …

2
Bagaimana cara menafsirkan hasil tes Breusch – Pagan?
Dalam Rsaya dapat melakukan tes Breusch-Pagan untuk heteroskedastisitas menggunakan ncvTestfungsi carpaket. Tes Breusch – Pagan adalah jenis tes chi kuadrat. Bagaimana cara menginterpretasikan hasil ini: > require(car) > set.seed(100) > x1 = runif(100, -1, 1) > x2 = runif(100, -1, 1) > ncvTest(lm(x1 ~ x2)) Non-constant Variance Score Test Variance …

3
Distribusi stabil positif di R
Distribusi stabil positif dijelaskan oleh empat parameter: parameter skewness , parameter skala , parameter lokasi , dan sebagainya -called index parameter . Ketika adalah nol distribusi simetris di sekitar , ketika itu positif (resp. negatif) distribusi miring ke kanan (resp. ke kiri) Distribusi yang stabil memungkinkan ekor gemuk ketika berkurang.β∈[−1,1]β∈[−1,1]\beta\in[-1,1]σ>0σ>0\sigma>0μ∈(−∞,∞)μ∈(−∞,∞)\mu\in(-\infty,\infty)α∈(0,2]α∈(0,2]\alpha\in(0,2]ββ\betaμμ\muαα\alpha …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.