Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Apakah teorema kontras relatif dari Beyer et al. makalah: "Tentang Perilaku Metrik Jarak yang Mengejutkan di Ruang Dimensi Tinggi" menyesatkan?
Ini dikutip sangat sering ketika menyebutkan kutukan dimensi dan pergi (rumus kanan disebut kontras relatif) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 Hasil teorema menunjukkan bahwa perbedaan antara jarak maksimum dan minimum ke titik kueri yang diberikan tidak meningkat secepat jarak terdekat ke …


3
Metode inisialisasi K-means clustering
Saya tertarik pada kondisi terkini untuk memilih benih awal (pusat cluster) untuk K-means. Googling mengarah ke dua pilihan populer: pemilihan awal benih secara acak, dan, menggunakan teknik pemilihan KMeans ++: Arthur & Vassilvitskii 2006 k-means ++: Keuntungan Pembibitan Hati-Hati Apakah ada metode lain yang menjanjikan yang diketahui oleh siapa pun …


1
Apa fungsi kerugian yang harus saya gunakan untuk mencetak model RNN seq2seq?
Saya sedang mengerjakan makalah Cho 2014 yang memperkenalkan arsitektur encoder-decoder untuk pemodelan seq2seq. Dalam makalah, mereka tampaknya menggunakan probabilitas input yang diberikan output (atau kemungkinan negatif-log) sebagai fungsi kerugian untuk input panjang dan output panjang :xxxMMMyyyNNN P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y_1, …, y_N | x_1, …, x_M) = P(y_1 | x_1, …, x_m) P(y_2 …



2
Bukti mudah
Biarkan menjadi variabel standar normal acak independen. Ada banyak bukti (panjang) di luar sana, yang menunjukkan hal ituZ1, ⋯ , ZnZ1,⋯,ZnZ_1,\cdots,Z_n ∑i=1n(Zi−1n∑j=1nZj)2∼χ2n−1∑saya=1n(Zsaya-1n∑j=1nZj)2∼χn-12 \sum_{i=1}^n \left(Z_i - \frac{1}{n}\sum_{j=1}^n Z_j \right)^2 \sim \chi^2_{n-1} Banyak bukti yang cukup panjang dan beberapa di antaranya menggunakan induksi (misalnya Casella Statistics Inference). Saya bertanya-tanya apakah ada bukti …

2
Apakah Paradox Simpson mencakup semua contoh pembalikan dari variabel tersembunyi?
Berikut ini adalah pertanyaan tentang banyak visualisasi yang ditawarkan sebagai 'bukti oleh gambar' tentang keberadaan paradoks Simpson, dan mungkin pertanyaan tentang terminologi. Paradox Simpson adalah fenomena yang cukup sederhana untuk menggambarkan dan memberikan contoh numerik (alasan mengapa ini bisa terjadi adalah dalam dan menarik). Paradoksnya adalah bahwa terdapat tabel kontingensi …



1
Bagaimana skala Lasso dengan ukuran matriks desain?
Jika saya memiliki matriks desain , di mana adalah jumlah pengamatan dimensi , apa kompleksitas penyelesaian untuk dengan LASSO, wrt dan ? Saya pikir jawabannya harus merujuk pada bagaimana satu iterasi LASSO skala dengan parameter ini, daripada bagaimana jumlah iterasi (konvergensi) skala, kecuali Anda merasa sebaliknya.X∈Rn×dX∈Rn×dX\in\mathcal{R}^{n\times d}nnndddβ^=argminβ12n||Xβ−y||2+λ||β||1β^=argminβ12n||Xβ−y||2+λ||β||1\hat{\beta}=\text{argmin}_{\beta}\frac{1}{2n} ||X\beta-y||^{2} + \lambda||\beta||_{1}nnnddd …

3
Pertanyaan wawancara ilmuwan data: Regresi linier rendah
Saya menghadapi pertanyaan wawancara untuk pekerjaan di mana pewawancara bertanya kepada saya kira sangat rendah (antara 5 hingga 10%) untuk model elastisitas harga. Bagaimana Anda memecahkan pertanyaan ini?R2R2R^2 Saya tidak bisa memikirkan hal lain selain fakta bahwa saya akan melakukan diagnosa regresi untuk melihat apa yang salah atau jika ada …

1
Mengapa saya mendapatkan prediksi berbeda untuk ekspansi polinomial manual dan menggunakan fungsi R `poly`?
Mengapa saya mendapatkan prediksi berbeda untuk ekspansi polinomial manual dan menggunakan polyfungsi R ? set.seed(0) x <- rnorm(10) y <- runif(10) plot(x,y,ylim=c(-0.5,1.5)) grid() # xp is a grid variable for ploting xp <- seq(-3,3,by=0.01) x_exp <- data.frame(f1=x,f2=x^2) fit <- lm(y~.-1,data=x_exp) xp_exp <- data.frame(f1=xp,f2=xp^2) yp <- predict(fit,xp_exp) lines(xp,yp) # using poly …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.