Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Saya ingin membangun indeks kejahatan dan indeks ketidakstabilan politik yang didasarkan pada berita
Saya memiliki proyek sampingan ini di mana saya merangkak situs web berita lokal di negara saya dan ingin membangun indeks kejahatan dan indeks ketidakstabilan politik. Saya sudah membahas bagian pengambilan informasi dari proyek. Rencana saya adalah melakukan: Ekstraksi topik tanpa pengawasan. Mendeteksi duplikat dekat. Klasifikasi dan tingkat insiden yang diawasi …






1
Apakah metode yang kuat benar-benar lebih baik?
Saya memiliki dua kelompok subjek, A, dan B, masing-masing dengan ukuran sekitar 400, dan sekitar 300 prediktor. Tujuan saya adalah untuk membangun model prediksi untuk variabel respons biner. Pelanggan saya ingin melihat hasil penerapan model yang dibangun dari A pada B. (Dalam bukunya, "Strategi Pemodelan Regresi", @FrankHarrell menyebutkan bahwa lebih …


3
Bagaimana melakukan estimasi, ketika hanya statistik ringkasan yang tersedia?
Ini sebagian dimotivasi oleh pertanyaan berikut dan diskusi mengikutinya. Misalkan sampel iid diamati, Xi∼F(x,θ)Xi∼F(x,θ)X_i\sim F(x,\theta) . Tujuannya adalah untuk memperkirakan θθ\theta . Tetapi sampel asli tidak tersedia. Apa yang kita miliki bukan adalah beberapa statistik dari sampel T1,...,TkT1,...,TkT_1,...,T_k . Misalkan kkk sudah diperbaiki. Bagaimana cara kami memperkirakan θθ\theta ? Apa …

6
Periksa properti tanpa memori dari rantai Markov
Saya menduga bahwa serangkaian urutan yang diamati adalah rantai Markov ... X=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AAD⋮BCA⋮E⎞⎠⎟⎟⎟⎟X=(ACDDBACBAACADA⋮⋮⋮⋮⋮⋮⋮BCADABE)X=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&D &A\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & E\\ \end{array}\right) Namun bagaimana saya bisa mengecek bahwa mereka …

3
Menerapkan regresi punggungan: Memilih kisi cerdas untuk
Saya menerapkan Ridge Regression dalam modul Python / C, dan saya telah menemukan masalah "kecil" ini. Idenya adalah bahwa saya ingin sampel derajat efektif kebebasan kurang lebih sama spasi (seperti plot pada halaman 65 pada "Elemen statistik Learning" ), yaitu, sampel: df(λ)=∑i=1pd2id2i+λ,df(λ)=∑i=1pdi2di2+λ,\mathrm{df}(\lambda)=\sum_{i=1}^{p}\frac{d_i^2}{d_i^2+\lambda}, manad2idi2d_i^2 adalah nilai eigen dari matriksXTXXTXX^TX, daridf(λmax)≈0df(λmax)≈0\mathrm{df}(\lambda_{\max})\approx 0hinggadf(λmin)=pdf(λmin)=p\mathrm{df}(\lambda_{\min})=p. …


4
Bagaimana seseorang membuat grafik hasil urutan peringkat subyektif?
Saya mencari cara untuk memvisualisasikan peringkat subyektif, terpisah dari tes non-parametrik saya. Saya telah meminta 12 peserta untuk memberi peringkat 8 item yang berbeda sesuai dengan kriteria subjektif yang berbeda (peringkat terpisah untuk masing-masing item). Untuk setiap peringkat individu, saya mencari cara yang baik untuk memvisualisasikan tren tingkat tinggi peringkat. …

2
Frekuensi dan prior
Robby McKilliam mengatakan dalam komentar untuk posting ini : Harus ditunjukkan bahwa, dari sudut pandang sering, tidak ada alasan bahwa Anda tidak dapat memasukkan pengetahuan sebelumnya ke dalam model. Dalam hal ini, tampilan sering lebih sederhana, Anda hanya memiliki model dan beberapa data. Tidak perlu memisahkan informasi sebelumnya dari model …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.