Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Apakah ada cara yang berguna untuk mendefinisikan interval kepercayaan “terbaik”?
Definisi standar (katakanlah) interval kepercayaan 95% (CI) hanya mensyaratkan bahwa probabilitas bahwa itu berisi parameter sebenarnya adalah 95%. Jelas, ini tidak unik. The bahasa Aku pernah melihat menunjukkan bahwa di antara banyak CI valid, biasanya masuk akal untuk menemukan sesuatu seperti terpendek, atau simetris, atau dikenal tepatnya bahkan ketika beberapa …

2
Bagaimana pengetahuan sebelumnya dimungkinkan dalam kerangka Bayesian murni?
Ini lebih merupakan pertanyaan filosofis, tetapi dari sudut pandang Bayesian murni bagaimana sebenarnya seseorang membentuk pengetahuan sebelumnya? Jika kita memerlukan informasi sebelumnya untuk melakukan kesimpulan yang valid maka tampaknya ada masalah jika kita harus menarik pengalaman masa lalu dalam membenarkan prior hari ini. Kami rupanya dibiarkan dengan pertanyaan yang sama …


1
Interpretasi hasil model gam
Saya memasang beberapa model aditif umum menggunakan mgcvpaket dalam R, dan saya ingin menguji antara dua model; apakah saya dapat menghapus istilah atau tidak. Namun, saya mendapatkan hasil yang bertentangan (sejauh yang saya tahu). Model, m1dengan istilah yang halus untuk xditambahkan, nampaknya memberikan kesesuaian yang lebih baik dalam hal , …
8 r  regression  gam 

1
Koreksi untuk beberapa pengujian pada sejumlah tes (10-20) dengan FDR?
False Discovery Rate (Benjamini-Hochberg) biasanya digunakan pada 'Big Data', seperti studi genetik menggunakan tes 100-an. Tetapi dapatkah itu juga digunakan pada sejumlah kecil tes? Misalnya, melihat hasil dari dua kelompok (laki-laki vs perempuan) pada, katakanlah, 10-20 kuesioner yang berbeda. Apakah prosedur FDR kehilangan nilai / makna / kekuatan dalam kasus …

1
Apakah Teorema Basu membutuhkan kecukupan minimal?
Casella & Berger menyatakan Teorema Basu (Th 6.2.24) sebagai berikut: Jika adalah statistik lengkap dan minimal yang memadai, maka tidak tergantung pada setiap statistik tambahan.T( X)T(X)T(X)T( X)T(X)T(X) Namun, dalam kuliah, saya melihat bukti teorema yang hanya menggunakan kecukupan, bukan kecukupan minimal. Buktinya pada dasarnya adalah penerapan hukum probabilitas total. Wikipedia …

1
Apa perbedaan antara Bayesian Optimization (Proses Gaussian) dan Simulasi Annealing dalam praktiknya
Kedua proses tampaknya digunakan untuk memperkirakan nilai maksimum dari fungsi yang tidak diketahui, dan keduanya jelas memiliki cara yang berbeda untuk melakukannya. Namun dalam praktiknya, apakah kedua metode itu pada dasarnya dapat dipertukarkan? Di mana saya ingin menggunakan salah satunya? https://en.wikipedia.org/wiki/Simulated_annealing http://www.iro.umontreal.ca/~bengioy/cifar/NCAP2014-summerschool/slides/Ryan_adams_140814_bayesopt_ncap.pdf Pertanyaan Serupa Pengoptimalan Bayesian atau gradient descent?

1
Decision Tree dengan variabel input kontinu
Diketahui bahwa ketika membangun pohon keputusan, kami membagi variabel input secara mendalam dan menemukan pemisahan 'terbaik' dengan pendekatan uji statistik atau pendekatan fungsi Pengotor. Pertanyaan saya adalah ketika kita menggunakan variabel kontinu sebagai variabel input (hanya beberapa nilai duplikat), jumlah pemisahan yang mungkin bisa sangat besar, untuk menemukan pemisahan 'terbaik' …
8 cart 

3
Seri waktu biner
Saya memiliki seri waktu biner: Kami memiliki 2160 data (0 = tidak terjadi, 1 = terjadi) untuk periode satu jam dalam 90 hari. Saya ingin memperkirakan setelah 90 hari ini, di mana 1 berikutnya akan terjadi, dan juga Perpanjang ketentuan ini untuk satu bulan ke depan.

1
Kovarian untuk tiga variabel
Saya mencoba memahami cara kerja matriks kovarians . Jadi misalkan kita memiliki dua variabel: , di mana memberikan hubungan antar variabel, yaitu seberapa besar satu bergantung pada yang lain.X,YX,YX, YCov(X,Y)=E[(x−E[X])(y−E[Y])]Cov(X,Y)=E[(x−E[X])(y−E[Y])]\text{Cov}(X,Y) = \mathbb{E}[(x -\mathbb{E}[X])(y-\mathbb{E}[Y])] Sekarang, tiga kasus variabel kurang jelas bagi saya. Definisi intuitif untuk fungsi kovarian adalah , tetapi literatur …

3
Kemungkinan Gaussian + yang sebelumnya = Gaussian Marginal?
Diberikan kemungkinan Gaussian untuk sampel seperti dengan sebagai ruang parameter dan , parameterisasi acak dari vektor rata-rata dan matriks kovarians.yyyp(y|θ)=N(y;μ(θ),Σ(θ))p(y|θ)=N(y;μ(θ),Σ(θ))p(y|\theta) = \mathcal{N}(y;\mu(\theta),\Sigma(\theta))ΘΘ\Thetaμ(θ)μ(θ)\mu(\theta)Σ(θ)Σ(θ)\Sigma(\theta) Apakah mungkin untuk menentukan kepadatan sebelumnya dan parameterisasi vektor rata-rata dan matriks kovarians sedemikian rupa sehingga kemungkinan marginal adalah kemungkinan Gaussian?p(θ)p(θ)p(\theta)μ(θ)μ(θ)\mu(\theta)Σ(θ)Σ(θ)\Sigma(\theta)p(y)=∫θ∈ΘN(y;μ(θ),Σ(θ))p(θ)dθp(y)=∫θ∈ΘN(y;μ(θ),Σ(θ))p(θ)dθp(y)=\int_{\theta\in\Theta}N(y;\mu(\theta),\Sigma(\theta))p(\theta)d\theta Saya kira tidak termasuk solusi sepele yang …

1
Interaksi statistik itu penting, tetapi penulis menyangkalnya. Mengapa?
Saya mengevaluasi artikel jurnal tentang interaksi statistiknya. Artikel ini mencoba untuk membangun hubungan antara kontrol tekanan darah yang kurang ketat dan perkembangan menjadi hipertensi berat. Ini mencurigai bahwa hipertensi yang sudah ada sebelumnya adalah faktor prognostik (diberikanp=0.048&lt;0.05p=0.048&lt;0.05p=0.048<0.05). Pertahanannya adalah itu Itu ppp-nilai sedikit signifikan. Ini mungkin kebetulan. Jika hipertensi yang …

2
Interval kepercayaan untuk median
Saya memiliki satu set nilai di mana saya menghitung median M. Saya bertanya-tanya bagaimana saya bisa menghitung kesalahan pada estimasi ini.xi,i=1,…,Nxi,i=1,…,N{x_i}, i=1, \dots ,N Di internet saya menemukan bahwa itu dapat dihitung sebagai mana adalah standar deviasi. Tetapi saya tidak menemukan referensi tentang itu. Jadi saya tidak mengerti kenapa .. …

1
Bagaimana memahami intuisi geometri dari cara kerja jaringan saraf?
Saya telah mempelajari teori di balik JST akhir-akhir ini dan saya ingin memahami 'keajaiban' di balik kemampuan klasifikasi multi-kelas non-linear. Ini membawa saya ke situs web ini yang melakukan pekerjaan dengan baik untuk menjelaskan secara geometris bagaimana perkiraan ini dicapai. Inilah cara saya memahaminya (dalam 3D): Lapisan tersembunyi dapat dianggap …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.