Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Bias dalam pemilihan juri?
Seorang teman mewakili klien pada saat naik banding, setelah pengadilan pidana di mana tampaknya pemilihan juri bias secara ras. Kelompok juri terdiri dari 30 orang, dalam 4 kelompok ras. Jaksa menggunakan tantangan berat untuk menyingkirkan 10 dari orang-orang ini dari kolam. Jumlah orang dan jumlah tantangan aktual di masing-masing kelompok …

3
Apakah koefisien regresi logistik memiliki makna?
Saya memiliki masalah klasifikasi biner dari beberapa fitur. Apakah koefisien regresi logistik (teratur) memiliki makna yang dapat ditafsirkan? Saya pikir mereka bisa menunjukkan ukuran pengaruhnya, mengingat fitur-fiturnya dinormalisasi sebelumnya. Namun, dalam masalah saya koefisien tampaknya tergantung sensitif pada fitur yang saya pilih. Bahkan tanda koefisien berubah dengan set fitur yang …

2
Subjektivitas dalam Statistik Frequentist
Saya sering mendengar klaim bahwa statistik Bayesian bisa sangat subjektif. Argumen utama adalah bahwa inferensi tergantung pada pilihan prior (walaupun seseorang dapat menggunakan prinsip indiferensi o entropi maksimum untuk memilih prior). Sebagai perbandingan, klaim berjalan, statistik frequentist secara umum lebih objektif. Berapa banyak kebenaran dalam pernyataan ini? Juga, ini membuat …

1
Diagnosis konvergensi Gelman dan Rubin, bagaimana cara menggeneralisasi untuk bekerja dengan vektor?
Diagnostik Gelman dan Rubin digunakan untuk memeriksa konvergensi beberapa rantai mcmc yang berjalan secara paralel. Ini membandingkan varians dalam-rantai dengan varians antara-rantai, eksposisi di bawah ini: Langkah-langkah (untuk setiap parameter): Jalankan m ≥ 2 rantai panjang 2n dari nilai awal overdispersed. Buang imbang pertama di setiap rantai. Hitung varian dalam-rantai …


1
Bagaimana Karl Pearson menghasilkan statistik chi-squared?
Bagaimana Pearson menghasilkan statistik chi-square Pearson berikut pada tahun 1900? bahwa K∼χ2K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} K∼χ2K∼χ2 K \sim \chi^2 Apakah dia memiliki chi-squared dalam pikiran dan menyusun metrik (pendekatan bottom-up), atau apakah dia menyusun statistik dan kemudian membuktikan bahwa itu mengikuti distribusi chi-squared (top-down)?KKK Saya ingin tahu mengapa …

3
Bagaimana cara menghitung tumpang tindih antara kepadatan probabilitas empiris?
Saya mencari metode untuk menghitung luas tumpang tindih antara dua perkiraan kepadatan kernel di R, sebagai ukuran kesamaan antara dua sampel. Untuk memperjelas, dalam contoh berikut, saya perlu mengukur luas wilayah keunguan yang tumpang tindih: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) …

1
Klasifikasi pembelajaran mesin big-O atau kompleksitas
Untuk mengevaluasi kinerja algoritma klasifikasi baru, saya mencoba untuk membandingkan akurasi dan kompleksitas (big-O dalam pelatihan dan klasifikasi). Dari Machine Learning: ulasan saya mendapatkan daftar pengklasifikasi lengkap yang diawasi, juga tabel akurasi antara algoritma, dan 44 masalah pengujian dari repositoy data UCI . Namun, saya tidak dapat menemukan ulasan, kertas, …

1
Apa perbedaan antara koefisien regresi dan koefisien regresi parsial?
Saya pernah membaca di Abdi (2003) itu Ketika variabel independen ortogonal berpasangan, efek masing-masing dalam regresi dinilai dengan menghitung kemiringan regresi antara variabel independen ini dan variabel dependen. Dalam hal ini, (yaitu, ortogonalitas IV), koefisien regresi parsial sama dengan koefisien regresi. Dalam semua kasus lain, koefisien regresi akan berbeda dari …

1
Fungsi biaya untuk bandit kontekstual
Saya menggunakan vowpal wabbit untuk menyelesaikan masalah bandit kontekstual . Saya menampilkan iklan kepada pengguna, dan saya memiliki sedikit informasi yang adil tentang konteks di mana iklan ditampilkan (misalnya siapa pengguna, situs apa yang mereka pakai, dll.). Ini tampaknya menjadi masalah bandit kontekstual yang cukup klasik, seperti yang dijelaskan oleh …


3
Perangkat lunak visualisasi data open source terbaik untuk digunakan dengan PowerPoint
Apa perangkat lunak visualisasi data open source terbaik? Saya memerlukan yang berikut ini: Dapat mengimpor data dari Microsoft Excel (mengimpor data dari database Oracle juga bagus, tetapi ini tidak wajib). Grafik yang dihasilkan oleh perangkat lunak dapat diekspor ke Microsoft PowerPoint (salin dan tempel tidak masalah dengan saya). Sumber terbuka …

2
Distribusi konvolusi variabel normal kuadrat dan chi-kuadrat?
masalah berikut muncul baru-baru ini saat menganalisis data. Jika variabel acak X mengikuti distribusi normal dan Y mengikuti distribusi χ2nχn2\chi^2_n (dengan n dof), bagaimana Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2 didistribusikan? Hingga sekarang saya datang dengan pdf dari : ψ 2 n ( x )Y2Y2Y^2ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& \frac{\partial F(\sqrt{x})}{\partial x} \\ …

1
Uji perbedaan antara 2 distribusi diskrit empiris
Saya memiliki data uji di mana saya memiliki beberapa sampel besar dari distribusi diskrit yang saya gunakan sebagai distribusi empiris. Saya ingin menguji apakah distribusi sebenarnya berbeda dan apa perbedaan artinya untuk distribusi yang sebenarnya berbeda. Karena mereka adalah distribusi terpisah, pemahaman saya adalah bahwa uji Kolmogorov-Smirnov tidak valid karena …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.