Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Analisis Cluster diikuti oleh Analisis Diskriminan
Apa alasannya, jika ada, untuk menggunakan Analisis Diskriminan (DA) pada hasil algoritma pengelompokan seperti k-means, seperti yang saya lihat dari waktu ke waktu dalam literatur (pada dasarnya pada subtyping klinis gangguan mental)? Umumnya tidak direkomendasikan untuk menguji perbedaan kelompok pada variabel yang digunakan selama konstruksi cluster karena mereka mendukung maksimalisasi …

3
Bagaimana menangani variabel kategorikal non-biner dalam regresi logistik (SPSS)
Saya harus melakukan regresi logistik biner dengan banyak variabel independen. Kebanyakan dari mereka adalah biner, tetapi beberapa variabel kategori memiliki lebih dari dua level. Apa cara terbaik untuk menangani variabel seperti itu? Misalnya, untuk variabel dengan tiga nilai yang mungkin, saya kira dua variabel dummy harus dibuat. Kemudian, dalam prosedur …

2
Perhitungan indeks musiman untuk musiman kompleks
Saya ingin meramalkan barang eceran (berdasarkan minggu) menggunakan pemulusan eksponensial. Saya terjebak sekarang dalam cara menghitung, menyimpan, dan menerapkan indeks sesonality. Masalahnya adalah bahwa semua contoh yang saya temukan berurusan dengan semacam musiman sederhana. Dalam kasus saya, saya memiliki masalah berikut: 1. Musim tidak terjadi pada minggu yang sama setiap …

4
Mengukur plot QQ
Plot qq dapat digunakan untuk memvisualisasikan seberapa mirip dua distribusi itu (misalnya memvisualisasikan kesamaan distribusi ke distribusi normal, tetapi juga untuk membandingkan dua distribusi data artibrary). Apakah ada statistik yang menghasilkan ukuran numerik yang lebih obyektif yang mewakili kesamaan mereka (lebih disukai dalam bentuk normal (0 <= x <= 1))? …



2
Bandwidth kernel dalam estimasi kepadatan kernel
Saya melakukan beberapa estimasi kepadatan Kernel, dengan titik-titik tertimbang yang ditetapkan (mis., Masing-masing sampel memiliki bobot yang tidak diperlukan), dalam dimensi N. Juga, sampel ini hanya dalam ruang metrik (mis., Kita dapat menentukan jarak di antara mereka) tetapi tidak ada yang lain. Sebagai contoh, kita tidak dapat menentukan rata-rata titik …


2
Perbandingan dua distribusi longitudinal
Saya memiliki hasil tes tes darah yang diberikan kepada 2.500 orang empat kali dalam interval enam bulan. Hasilnya terutama terdiri dari dua ukuran respon imun - satu di hadapan antigen tuberkulosis tertentu, satu di ketiadaan. Saat ini, setiap tes mengevaluasi positif atau negatif berdasarkan perbedaan antara respons antigen dan respons …

4
Distribusi asimtotik multinomial
Saya mencari distribusi terbatas dari distribusi multinomial daripada hasil. Yaitu, distribusi berikut limn → ∞n- 12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Di mana XnXn\mathbf{X_n} adalah variabel acak nilai vektor dengan kepadatan fn( x )fn(x)f_n(\mathbf{x}) untuk xx\mathbf{x} sedemikian rupa sehingga ∑sayaxsaya= n∑ixi=n\sum_i x_i=n , xsaya∈ Z , xsaya≥ 0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0 dan …


11
Revolusi dalam statistik selama 50 tahun terakhir? [Tutup]
Seperti yang ada saat ini, pertanyaan ini tidak cocok untuk format Tanya Jawab kami. Kami berharap jawaban didukung oleh fakta, referensi, atau keahlian, tetapi pertanyaan ini kemungkinan akan mengundang debat, argumen, polling, atau diskusi panjang. Jika Anda merasa bahwa pertanyaan ini dapat diperbaiki dan mungkin dibuka kembali, kunjungi pusat bantuan …
10 history 

1
Apa jenis analisis residu pasca-fit yang Anda gunakan?
Ketika melakukan OLS regresi linier berganda, daripada memplot residual terhadap nilai-nilai pas, saya plot residual (internal) Studentized terhadap nilai-nilai pas (ditto untuk kovariat). Residu ini didefinisikan sebagai: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} di mana adalah residual dan adalah elemen diagonal dari matriks topi. Untuk mendapatkan residu pelajar dalam R, …


5
Apa transformasi normalisasi yang biasa digunakan di luar yang umum seperti akar kuadrat, log, dll?
Dalam analisis skor tes (misalnya, dalam Pendidikan atau Psikologi), teknik analisis umum sering mengasumsikan bahwa data terdistribusi secara normal. Namun, mungkin lebih sering daripada tidak, skor cenderung menyimpang kadang-kadang liar dari normal. Saya akrab dengan beberapa transformasi normalisasi dasar, seperti: akar kuadrat, logaritma, transformasi timbal balik untuk mengurangi kemiringan positif, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.