Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Bootstrap vs Bayesian Bootstrap konseptual?
Saya mengalami kesulitan memahami apa proses Bootstrap Bayesian, dan bagaimana hal itu akan berbeda dari bootstrap normal Anda. Dan jika seseorang dapat menawarkan tinjauan intuitif / konseptual dan perbandingan keduanya, itu akan bagus. Mari kita ambil contoh. Katakanlah kita memiliki X dataset yang [1,2,5,7,3]. Jika kita sampel dengan penggantian beberapa …

2
cakupan interval kepercayaan dengan estimasi yang diregulasi
Misalkan saya mencoba untuk memperkirakan sejumlah besar parameter dari beberapa data dimensi tinggi, menggunakan beberapa jenis perkiraan yang diatur. Pembuat peraturan memperkenalkan beberapa bias ke dalam estimasi, tetapi masih bisa menjadi trade-off yang baik karena pengurangan varians harus lebih dari sekadar menebusnya. Masalahnya muncul ketika saya ingin memperkirakan interval kepercayaan …

3
Bagaimana cara memprediksi hasil dengan hanya kasus positif sebagai pelatihan?
Demi kesederhanaan, katakanlah saya sedang mengerjakan contoh klasik dari email spam / bukan-spam. Saya memiliki 20000 email. Dari jumlah tersebut, saya tahu bahwa 2000 adalah spam tetapi saya tidak memiliki contoh email bukan-spam. Saya ingin memprediksi apakah 18.000 sisanya adalah spam atau tidak. Idealnya, hasil yang saya cari adalah probabilitas …


2
Teknik augmentasi data untuk dataset umum?
Dalam banyak aplikasi pembelajaran mesin, metode augmentasi data yang disebut telah memungkinkan membangun model yang lebih baik. Misalnya, asumsikan satu set pelatihan gambar kucing dan anjing. Dengan memutar, mirroring, menyesuaikan kontras, dll. Dimungkinkan untuk menghasilkan gambar tambahan dari yang asli.100100100 Dalam hal gambar, augmentasi data relatif mudah. Namun, anggaplah (misalnya) …

2
Mengapa normalitas residu "hampir tidak penting sama sekali" untuk tujuan memperkirakan garis regresi?
Gelman and Hill (2006) menulis di halaman 46 bahwa: Asumsi regresi yang umumnya paling tidak penting adalah bahwa kesalahan didistribusikan secara normal. Bahkan, untuk tujuan memperkirakan garis regresi (dibandingkan dengan memprediksi titik data individual), asumsi normalitas hampir tidak penting sama sekali. Jadi, berbeda dengan banyak buku teks regresi, kami tidak …

1
Kapan menggunakan Poisson vs. GLM binomial geometris vs. negatif untuk data jumlah?
Saya mencoba untuk tata letak sendiri pada saat yang tepat itu untuk penggunaan jenis regresi (geometris, Poisson, binomial negatif) dengan data hitung, dalam kerangka GLM (hanya 3 dari 8 distribusi GLM digunakan untuk data count, meskipun sebagian besar dari apa Saya telah membaca pusat di sekitar distribusi binomial dan Poisson …

3
Distribusi fragmen terbesar dari tongkat patah (jarak)
Biarkan batang dengan panjang 1 dipecah dalam fragmen secara seragam secara acak. Berapa distribusi panjang fragmen terpanjang?k+1k+1k+1 Secara lebih formal, biarkan menjadi IID , dan biarkan menjadi statistik pesanan terkait, yaitu kami cukup memesan sampel sedemikian rupa sehingga . Biarkan .(U1,…Uk)(U1,…Uk)(U_1, \ldots U_k)U(0,1)U(0,1)U(0,1)(U(1),…,U(k))(U(1),…,U(k))(U_{(1)}, \ldots, U_{(k)})U(1)≤U(2)≤,…,≤U(k)U(1)≤U(2)≤,…,≤U(k)U_{(1)} \leq U_{(2)} \leq, \ldots , …


1
menafsirkan estimasi regresi logistik cloglog
Bisakah seseorang memberi tahu saya tentang bagaimana menginterpretasikan estimasi dari regresi logistik menggunakan tautan cloglog? Saya telah memasang model berikut di lme4: glm(cbind(dead, live) ~ time + factor(temp) * biomass, data=mussel, family=binomial(link=cloglog)) Misalnya, perkiraan waktu adalah 0,015. Apakah benar mengatakan peluang mortalitas per unit waktu dikalikan dengan exp (0,015) = …

2
Apakah distribusi diskrit ini memiliki nama?
Apakah distribusi diskrit ini memiliki nama? Untuk i∈1...Ni∈1...Ni \in 1...N f(i)=1N∑Nj=i1jf(i)=1N∑j=iN1jf(i) = \frac{1}{N} \sum_{j = i}^N \frac{1}{j} Saya menemukan distribusi ini dari yang berikut: Saya memiliki daftar item yang diberi peringkat oleh beberapa fungsi utilitas. Saya ingin memilih salah satu item secara acak, bias ke arah awal daftar. Jadi, saya …

3
Dari aturan Perceptron ke Gradient Descent: Bagaimana Perceptrons dengan fungsi aktivasi sigmoid berbeda dari Regresi Logistik?
Pada dasarnya, pertanyaan saya adalah bahwa dalam multilayer Perceptrons, perceptrons digunakan dengan fungsi aktivasi sigmoid. Sehingga dalam aturan pembaruan dihitung sebagaiy^y^\hat{y} y^=11+exp(−wTxi)y^=11+exp⁡(−wTxi)\hat{y} = \frac{1}{1+\exp(-\mathbf{w}^T\mathbf{x}_i)} Bagaimana perbedaan "sigmoid" Perceptron ini dari regresi logistik? Saya akan mengatakan bahwa perceptron sigmoid satu-lapisan setara dengan regresi logistik dalam arti bahwa keduanya menggunakan dalam aturan …

2
R-kuadrat dalam regresi kuantitatif
Saya menggunakan regresi kuantil untuk menemukan prediktor persentil ke-90 data saya. Saya melakukan ini di R menggunakan quantregpaket. Bagaimana saya bisa menentukan untuk regresi kuantil yang akan menunjukkan berapa banyak variabilitas dijelaskan oleh variabel prediktor?r2r2r^2 Apa yang benar-benar ingin saya ketahui: "Apakah ada metode yang dapat saya gunakan untuk menemukan …

3
Neyman-Pearson lemma
Saya telah membaca lemma Neyman – Pearson dari buku Pengantar Teori Statistik oleh Mood, Graybill, dan Boes. Tapi saya belum mengerti lemma. Adakah yang bisa menjelaskan lemma kepada saya dengan kata-kata sederhana? Apa isinya? Neyman-Pearson Lemma: Misalkan X1,…,XnX1,…,XnX_1,\ldots,X_n menjadi sampel acak dari , di mana adalah salah satu dari dua …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.