Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Menggunakan variabel kontrol dalam percobaan?
Mengapa seseorang ingin mengontrol sejumlah kovariat awal dalam situasi di mana penugasan ke kelompok perlakuan adalah acak? Pemahaman saya adalah bahwa secara acak memberikan pengobatan harus membuat variabel pengobatan secara eksogen, membuat kelompok kontrol yang dapat dianggap sebagai kontrafaktual. Satu-satunya pengecualian yang dapat saya pikirkan adalah ketika ukuran sampel kecil, …

5
Regresi linier tidak pas
Saya melakukan regresi linier menggunakan fungsi Rm: x = log(errors) plot(x,y) lm.result = lm(formula = y ~ x) abline(lm.result, col="blue") # showing the "fit" in blue tapi itu tidak pas. Sayangnya saya tidak bisa memahami manualnya. Bisakah seseorang mengarahkan saya ke arah yang benar agar lebih cocok? Maksud saya, saya …
9 r  regression 

1
Bisakah kita membuat distribusi Irwin-Hall lebih umum?
Saya perlu menemukan kelas distribusi kurtosis rendah simetris, yang meliputi distribusi seragam, segitiga dan Gaussian normal. Distribusi Irwin-Hall (jumlah seragam standar) menawarkan karakteristik ini, tapi tidak memperlakukan perintah non-integer . Namun, jika Anda misalnya meringkas secara mandiri mis. 2 seragam standar dan yang ketiga dengan kisaran yang lebih kecil seperti …

2
Bagaimana cara memasukkan istilah linear dan kuadratik ketika juga menyertakan interaksi dengan variabel-variabel itu?
Ketika menambahkan prediktor numerik dengan prediktor kategoris dan interaksinya, biasanya dianggap perlu untuk memusatkan variabel pada 0 sebelumnya. Alasannya adalah bahwa efek utama sulit ditafsirkan karena mereka dievaluasi dengan prediktor numerik pada 0. Pertanyaan saya sekarang adalah bagaimana cara memusatkan jika seseorang tidak hanya memasukkan variabel numerik asli (sebagai istilah …

1
Plot Ketergantungan Sebagian dan peningkatan Gradien (paket GBM)
Apakah mungkin untuk memplot plot dependensi parsial untuk menampilkan probabilitas kelas dan memperkirakan efek prediktor untuk model GBM ? Sesuatu yang mirip dengan partialPlotdari randomForestpaket. Menurut artikel ini , sebagian plot dapat dilakukan dengan gbm. Terima kasih sebelumnya atas bantuan Anda.
9 r  gbm 

3
Temukan k item n dengan korelasi paling tidak berpasangan
Saya memiliki matriks korelasi berpasangan antara n item. Sekarang saya ingin menemukan subset item k dengan korelasi paling sedikit. Jadi ada dua pertanyaan: Manakah ukuran yang tepat untuk korelasi dalam kelompok itu? Bagaimana menemukan grup dengan korelasi paling sedikit? Masalah ini muncul seperti semacam analisis faktor terbalik bagi saya dan …

1
Efisiensi relatif peringkat yang ditandatangani Wilcoxon dalam sampel kecil
Saya telah melihat dalam literatur yang diterbitkan (dan diposting di sini) bahwa efisiensi relatif asimptotik dari uji peringkat Wilcoxon menandatangani setidaknya 0,864 bila dibandingkan dengan uji t. Saya juga pernah mendengar bahwa ini hanya berlaku untuk sampel besar, meskipun beberapa buku tidak menyebutkan ini (ada apa dengan itu?). Lagi pula, …

1
Menghasilkan seragam diskrit dari membalik koin
Misalkan Anda memiliki koin yang adil yang dapat Anda balikkan sebanyak yang Anda inginkan (mungkin tak terhitung jumlahnya). Apakah mungkin untuk menghasilkan distribusi seragam diskrit pada , di mana BUKAN kekuatan 2? Bagaimana Anda melakukannya?(1,2,...,k)(1,2,...,k)(1,2,...,k)kkk Jika ini terlalu umum, menjawab mungkin akan cukup menarik.k=3k=3k=3

2
Masalah lokomotif dengan berbagai ukuran perusahaan
Saya sedang mengerjakan Think Bayes (gratis di sini: http://www.greenteapress.com/thinkbayes/ ) dan saya sedang berolahraga 3.1. Berikut ringkasan masalahnya: "Sebuah kereta api memberi nomor lokomotifnya dalam urutan 1..N. Suatu hari kamu melihat lokomotif dengan nomor 60. Perkirakan berapa banyak lokomotif yang dimiliki kereta api." Solusi ini ditemukan dengan fungsi kemungkinan dan …

4
Definisi matematis kausalitas
Biarkan dan menjadi variabel acak. adalah mean bersyarat dari diberikan . Kami mengatakan tidak terkait dengan jika tidak bergantung pada , yang berarti sama dengan . Sekarang, mari kita ikuti definisi kausalitas ini sebentar. Menurut hukum ekspektasi berulang, . Ini berarti bahwa jika tidak bergantung pada , jika itu sama …

3
Apakah klasifikasi berbasis Neural Networks perlu pengurangan dimensi?
Saya menggunakan classifier berbasis Neural Networks untuk menjalankan klasifikasi untuk data saya dalam n-dimensional. Lalu saya pikir itu mungkin ide yang baik untuk menjalankan pengurangan dimensi seperti PCA untuk data saya pada awalnya, dan kemudian memasukkan hasil PCA ke dalam classifier (saya menyimpan 3 PC). Namun, klasifikasi pada fitur pengurangan …

1
Interpretasi interval prediksi Bayesian 95%
Asumsikan model regresi bivariat berikut: mana adalah iid untuk .yi=βxi+ui,yi=βxi+ui, y_i = \beta x_i + u_i, uiuiu_iN(0,σ2=9)N(0,σ2=9)N(0, \sigma^2 = 9)i=1,…,ni=1,…,ni = 1,\ldots, n Asumsikan sebelumnya noninformatif , maka dapat ditunjukkan bahwa pdf posterior untuk adalah manap(β)∝constantp(β)∝constantp(\beta) \propto \text{constant}ββ\betap(β|y)=(18π)−12(∑i=1nx2i)12exp[−118∑i=1nx2i(β−β^)2],p(β|y)=(18π)−12(∑i=1nxi2)12exp⁡[−118∑i=1nxi2(β−β^)2], p(\beta|\mathbf{y}) = (18\pi)^{-\frac{1}{2}}\left(\sum_{i=1}^n x_i^2\right)^{\frac{1}{2}} \exp\left[-\frac{1}{18}\sum_{i=1}^n x_i^2 (\beta - \hat{\beta})^2\right], β^=(∑ni=1yixi)/(∑ni=1x2i).β^=(∑i=1nyixi)/(∑i=1nxi2).\hat{\beta} = (\sum_{i=1}^n …

5
Ratakan rangkaian waktu melingkar / periodik
Saya memiliki data kecelakaan kendaraan bermotor menurut jam sehari. Seperti yang Anda harapkan, mereka tinggi di tengah hari dan puncaknya pada jam sibuk. Geom_density default ggplot2 memuluskannya dengan baik Subset dari data, untuk crash terkait drive-minum, tinggi di kedua ujung hari (malam hari dan pagi hari) dan tertinggi di ekstrem. …

1
Bingung dengan Penurunan Fungsi Regresi
Saya baru saja mendapat salinan The Elements of Statistics Learning oleh Hastie, Tibshirani, dan Friedman. Dalam bab 2 (Ikhtisar Pembelajaran yang Dibimbing) bagian 4 (Teori Keputusan Statistik), ia memberikan derivasi dari fungsi regresi. Misalkan menunjukkan vektor input acak bernilai nyata, dan variabel output acak bernilai nyata, dengan distribusi gabungan . …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.