Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Bayesian vs Entropi maksimum
Misalkan jumlah yang ingin kita simpulkan adalah distribusi probabilitas. Yang kita tahu adalah bahwa distribusi berasal dari himpunan ditentukan, katakanlah, pada beberapa momennya dan kami memiliki sebelumnya .EEEQQQ Prinsip entropi maksimum (MEP) mengatakan bahwa yang memiliki entropi relatif paling rendah dari (yaitu, ) adalah yang terbaik untuk dipilih. Sedangkan aturan …

1
Distribusi korelasi sampel
Misalkan saya memiliki populasi besar titik data (x,y)(x,y)(x,y) dan bahwa korelasi Pearson adalah corr(X,Y)=ρcorr(X,Y)=ρ\textrm{corr}(X,Y) = \rho Apa yang bisa saya katakan tentang korelasi yang saya harapkan untuk diamati dalam sampel ukuran nnn? Jika korelasi sampelnya adalahρsρs\rho_s, kira-kira sebarannya ρsρs\rho_s? Adalahρsρs\rho_s bias? Jika kita membuat beberapa asumsi seperti normalitas, dapatkah kita …


1
Regresi berganda dengan set data kecil
Saya memiliki dataset studi kasus proyek untuk tipe baru metode penelitian untuk badan-badan Pemerintah untuk mendukung kegiatan pengambilan keputusan. Tugas saya adalah mengembangkan metode estimasi berdasarkan pengalaman masa lalu untuk proyek masa depan untuk keperluan estimasi. Dataset saya dibatasi hingga 50 kasus. Saya memiliki 30+ (calon) prediktor yang direkam dan …

2
Bisakah satu menggunakan Cohen Kappa hanya untuk dua penilaian?
Saya menggunakan Cohen Kappa untuk menghitung antar-perjanjian antara dua hakim. Itu dihitung sebagai: P(A)−P(E)1−P(E)P(A)−P(E)1−P(E) \frac{P(A) - P(E)}{1 - P(E)} dimana P(A)P(A)P(A) adalah proporsi perjanjian dan P(E)P(E)P(E) probabilitas kesepakatan secara kebetulan. Sekarang untuk dataset berikut, saya mendapatkan hasil yang diharapkan: User A judgements: - 1, true - 2, false User B …

1
Apa arti “case-control” dan “cross-sectional” dalam konteks pemodelan logistik?
Saat mempelajari pemodelan logistik, saya membaca pernyataan berikut Fakta bahwa hanya rasio odds, bukan risiko individu, dapat diperkirakan dari pemodelan logistik dalam studi kasus-kontrol atau cross-sectional tidak mengejutkan. Saya tidak tahu apa artinya "studi kasus-kontrol" dan "studi cross-sectional" dalam analisis statistik? Selain itu, saya tidak begitu mengerti apa arti pernyataan …


1
Bayesian inferensi untuk distribusi multinomial dengan pengetahuan awal asimetris?
Misalkan saya akan mendapatkan beberapa sampel dari distribusi binomial. Salah satu cara untuk memodelkan pengetahuan saya sebelumnya adalah dengan distribusi Beta dengan parameter dan . Seperti yang saya pahami, ini sama dengan melihat "kepala" kali dalam uji coba . Dengan demikian, jalan pintas yang bagus untuk melakukan inferensi Bayesian yang …

1
Dapatkah seseorang membantu saya memahami jenis masalah apa yang saya lihat? Tidak yakin apakah ini diklasifikasikan sebagai pengujian hipotesis
Maafkan saya jika pertanyaan ini tidak jelas. Saya tidak yakin apakah saya menggunakan terminologi yang tepat. Saya telah melakukan percobaan di lingkungan yang berbeda beberapa kali. Jadi data saya terlihat seperti ini: Environment1 1.2 2.1 1.1 1.5 1.6 Environment2 4.2 2.6 3.5 2.5 2.9 Environment3 7.2 4.6 5.3 4.5 1.6 …


1
Tes untuk independensi, ketika saya kehilangan satu bin dari kontingensi 2x2
Saya mencari bantuan merancang tes hipotesis untuk situasi berikut. Saya memiliki sumber radioaktif yang sering mengeluarkan partikel. Juga, saya memiliki dua pendeteksi partikel: pendeteksi partikel merah, dan pendeteksi partikel hijau. Setiap kali pendeteksi partikel merah mendeteksi partikel, ia akan memancarkan cahaya merah; membiarkanRRR menunjukkan peristiwa bahwa partikel terdeteksi oleh detektor …

1
Menggabungkan auto.arima () dan ets () dari paket perkiraan
Saya telah menggunakan fungsi ets () dan auto.arima () dari paket perkiraan untuk memperkirakan sejumlah besar rangkaian waktu univariat. Saya telah menggunakan fungsi berikut untuk memilih antara 2 metode, tapi saya bertanya-tanya apakah CrossValidated punya ide yang lebih baik (atau kurang naif) untuk peramalan otomatis. auto.ts <- function(x,ic="aic") { XP=ets(x, …

1
Bagaimana saya harus menganalisis eksperimen perbedaan individu yang diukur berulang kali?
Saya melakukan penelitian psikologi perbedaan individu semu-eksperimental. Saya memeriksa bagaimana orang-orang yang berbeda dalam kemampuan kognitif (yang saya ukur) melakukan tugas lain yang selalu setidaknya melibatkan manipulasi dalam-subjek (dan kadang-kadang antar-subjek) –DV biasanya waktu respons dan / atau akurasi. Untuk pertanyaan ini saya ingin fokus pada waktu respons (anggaplah mereka …

3
Bagaimana cara mengidentifikasi pencilan dalam data kinerja waktu aktif server?
Saya memiliki skrip python yang membuat daftar daftar server uptime dan data kinerja, di mana setiap sub-daftar (atau 'baris') berisi statistik cluster tertentu. Misalnya, diformat dengan baik itu terlihat seperti ini: ------- ------------- ------------ ---------- ------------------- Cluster %Availability Requests/Sec Errors/Sec %Memory_Utilization ------- ------------- ------------ ---------- ------------------- ams-a 98.099 1012 678 …

1
Uji permutasi dua sampel Kolmogorov-Smirnov
Meskipun lebih mudah menggunakan uji tipe Pearson chi-square / Cressie-Read, saya ingin menguji kesetaraan proporsi dalam kkkkategori di dua kelompok menggunakan uji tipe Kolmogorov-Smirnov dari formulir yang diusulkan oleh Pettitt & Stephens (1977) (lihat juga di sini ). Khususnya seperti yang ditunjukkan oleh penulis makalah itu, ia mungkin memiliki kekuatan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.