Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apa sebenarnya yang dimaksud dengan notasi
Apa yang dimaksud dengan notasi (dot over tilde), dalam konteks seperti ? x ˙ ∼ N(0,1)∼˙∼˙\dot\simx ∼˙N( 0 , 1 )x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) Ternyata lebih mudah untuk menemukan cara mengesetnya dengan benar: tex.SE menjelaskan bahwa seseorang harus mengetik \mathrel{\dot\sim}alih-alih hanya \dot\simuntuk memperbaiki masalah penspasian - daripada menemukan apa artinya …

1
Buktikan / Tolak
Buktikan / Tolak E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} Mengingat ruang probabilitas disaring (Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, \{\mathscr{F}_n\}_{n \in \mathbb{N}}, \mathbb{P}) , biarkan A∈FA∈FA \in \mathscr{F} …

3
Bagaimana cara membaca p, d dan q dari auto.arima ()?
Bagaimana saya bisa mendapatkan p,d and qnilai dalam ARIMA(p,d,q)model yang diperkirakan oleh auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Jika kita melihat output dari arima_model $ arma kita mendapatkan, [1] 1 0 0 0 1 2 0 Apa arti dari angka-angka yang muncul dalam urutan di atas?
10 r  arima 

3
Apa metode statistik yang dapat saya gunakan untuk menemukan kombinasi populer atau umum dari variabel kategori?
Saya sedang melakukan studi tentang penggunaan polydrug. Saya memiliki set data 400 pecandu narkoba, yang masing-masing menyatakan narkoba yang mereka penyalahgunaan. Ada lebih dari 10 obat dan karenanya ada kemungkinan kombinasi yang besar. Saya telah mencatat ulang sebagian besar obat yang mereka konsumsi menjadi variabel biner (yaitu heroin adalah 1 …

1
Regresi logistik vs chi-square dalam tabel kontingensi 2x2 dan Ix2 (faktor tunggal - respons biner)?
Saya mencoba memahami penggunaan regresi logistik dalam tabel kontingensi 2x2 dan Ix2. Misalnya, menggunakan ini sebagai contoh Apa perbedaan antara menggunakan uji chi-square dan menggunakan regresi logistik? Bagaimana dengan tabel dengan beberapa faktor nominal (tabel Ix2) seperti ini: Ada pertanyaan serupa di sini - tetapi jawabannya terutama bahwa chi-square dapat …

1
Bagaimana cara kernelisasi perceptron sederhana?
Masalah klasifikasi dengan batas nonlinier tidak dapat diselesaikan dengan perceptron sederhana . Kode R berikut adalah untuk tujuan ilustrasi dan didasarkan pada contoh ini dengan Python): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) …

1
Apa yang dimaksud dengan PCA hanya mempertahankan jarak berpasangan yang besar?
Saat ini saya membaca tentang teknik visualisasi t-SNE dan disebutkan bahwa salah satu kelemahan menggunakan analisis komponen utama (PCA) untuk memvisualisasikan data dimensi tinggi adalah bahwa ia hanya mempertahankan jarak berpasangan yang besar antara titik-titik. Makna titik-titik yang berjauhan dalam ruang dimensi tinggi juga akan tampak berjauhan dalam subruang dimensi …

2
Variabel skala sebagai data jumlah - benar atau tidak?
Dalam makalah ini (tersedia gratis melalui pusat PubMed), penulis menggunakan regresi binomial negatif untuk memodelkan skor pada instrumen skrining 10-item dengan skor 0-40. Prosedur ini mengasumsikan jumlah data, yang jelas tidak demikian di sini. Saya ingin pendapat Anda tentang apakah pendekatan ini dapat diterima, karena saya kadang-kadang menggunakan instrumen yang …

2
Bagaimana cara menguji secara statistik apakah jaringan saya (grafik) adalah jaringan "dunia kecil" atau tidak?
Sebuah jaringan-dunia kecil adalah jenis grafik matematika di mana sebagian besar node tidak tetangga satu sama lain, tapi yang paling node dapat dicapai dari setiap lain oleh sejumlah kecil hop atau langkah-langkah. Secara khusus, jaringan dunia kecil didefinisikan sebagai jaringan di mana jarak tipikal L antara dua node yang dipilih …

4
Overfitting dengan Linear Classifiers
Hari ini profesor kami menyatakan di kelas bahwa "overfitting dengan pengklasifikasi linear tidak mungkin". Saya berpendapat bahwa itu salah, karena bahkan pengklasifikasi linier dapat peka terhadap outlier dalam set pelatihan - ambil contohnya margin keras Dukungan Mesin Vektor: Satu titik data berisik dapat mengubah hyperplane mana yang akan digunakan untuk …

1
Ketika parametrizing ulang fungsi kemungkinan, apakah cukup dengan memasukkan variabel yang ditransformasi alih-alih perubahan formula variabel?
Misalkan saya sedang mencoba untuk parametrize ulang fungsi kemungkinan yang didistribusikan secara eksponensial. Jika fungsi kemungkinan asli saya adalah: p ( y∣ θ ) = θ e- θ yp(y∣θ)=θe−θy p(y \mid \theta) = \theta e^{-\theta y} dan saya ingin mengembalikan parameter menggunakan , karena bukan variabel acak, tetapi sebuah parameter, …

2
Perbedaan antara rata-rata data kemudian pas dan pas data kemudian rata-rata
Jika ada, antara memasang garis ke beberapa "percobaan" terpisah kemudian rata-rata cocok, atau rata-rata data dari eksperimen terpisah kemudian paskan data rata-rata. Biarkan saya uraikan: Saya melakukan simulasi komputer yang menghasilkan kurva, ditunjukkan di bawah ini. Kami mengekstrak kuantitas, sebut saja "A" dengan menyesuaikan wilayah linier plot (lama). Nilainya hanyalah …
10 error  fitting  average 

1
Apa varian penaksir ini?
Saya ingin memperkirakan rata-rata fungsi f, yaitu mana dan adalah variabel acak independen. Saya punya sampel f tetapi tidak iid: Ada sampel iid untuk dan untuk setiap ada sampel dari :EX,Y[f(X,Y)]EX,Y[f(X,Y)]E_{X,Y}[f(X,Y)]XXXYYYY1,Y2,…YnY1,Y2,…YnY_1,Y_2,\dots Y_nYiYiY_ininin_iXXXXi,1,Xi,2,…,Xi,niXi,1,Xi,2,…,Xi,niX_{i,1},X_{i,2},\dots, X_{i,n_i} Jadi total saya punya sampelf(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X_{1,1},Y_1) \dots f(X_{1,n_1},Y_1 ) \dots f(X_{i,j},Y_i) \dots f(X_{n,n_n},Y_n) Untuk memperkirakan rata-rata yang saya …

2
RMSE (Root Mean Squared Error) untuk model logistik
Saya punya pertanyaan tentang validitas menggunakan RMSE (Root Mean Squared Error) untuk membandingkan model logistik yang berbeda. Responsnya adalah salah 0atau 1dan prediksi adalah probabilitas antara 0- 1? Apakah cara yang diterapkan di bawah ini juga berlaku untuk respons biner? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, …

1
Metode apa yang ada untuk tuning graph kernel SVM hyperparameters?
Saya memiliki beberapa data yang ada pada grafik . milik salah satu dari dua kelas , dan saya tertarik untuk melatih SVM untuk membedakan antara dua kelas. Salah satu kernel yang sesuai untuk ini adalah difusi kernel , mana adalah Laplacian dari dan adalah parameter tuning.G=(V,E)G=(V,E)G=(V,E)yi∈{−1,1}yi∈{−1,1}y_i\in\{-1,1\}K=exp(−βL),K=exp⁡(−βL),K=\exp(-\beta L),LLLGGGββ\beta Tuning SVM membutuhkan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.