Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Dalam proses Poisson diukur dengan beberapa efisiensi, apakah jumlah yang diukur masih Poisson?
Situasi: Katakanlah saya memiliki proses Poisson, seperti peluruhan radioaktif, menghasilkan partikel R per detik. Saya mengukur dengan detektor. Ada probabilitas P bahwa partikel akan dideteksi oleh detektor. Hal-hal yang saya rasa saya tahu: Waktu antar kedatangan emisi partikel secara eksponensial didistribusikan dengan parameter berdasarkan R . Jumlah partikel yang dipancarkan …

1
Model dan cluster campuran nonparametrik
Saya punya pertanyaan tentang cluster yang saya rencanakan untuk diobati dengan pendekatan campuran nonparametrik (saya pikir). Saya sedang mengerjakan penjelasan tentang pelampiasan manusia. Setiap baris basis data saya berisi: ID seseorang beberapa parameter lingkungan X (contoh: suhu, angin, dll.) variabel biner Y yang mewakili reaksi orang tersebut terhadap parameter (contoh: …

1
Menafsirkan plot residual binned dalam regresi logistik
Saya melakukan regresi logistik dengan variabel independen dan pengamatan. Saya mengevaluasi kecocokan model untuk menentukan apakah data memenuhi asumsi model dan telah menghasilkan plot sisa binned berikut menggunakan paket:242424123 , 996123,996123,996arm R Jelas ada beberapa tanda-tanda buruk dalam plot ini: banyak poin berada di luar band kepercayaan dan ada pola …

4
Clusterings yang bisa disebabkan oleh K-means
Saya mendapatkan pertanyaan berikut sebagai pertanyaan ujian untuk ujian saya dan saya tidak bisa memahami jawabannya. Plot sebar data yang diproyeksikan ke dua komponen utama pertama ditunjukkan di bawah ini. Kami ingin memeriksa apakah ada beberapa struktur grup dalam kumpulan data. Untuk melakukan ini, kami telah menjalankan algoritma k-means dengan …


1
Mensimulasikan data regresi dengan variabel dependen didistribusikan secara tidak normal
Untuk analisis regresi, seringkali berguna untuk mengetahui proses pembuatan data untuk memeriksa bagaimana metode yang digunakan bekerja. Meskipun cukup sederhana untuk melakukan ini untuk regresi linier sederhana, ini bukan kasus ketika variabel dependen harus mengikuti distribusi tertentu. Pertimbangkan regresi linier sederhana: N <- 100 x <- rnorm(N) beta <- 3 …

4
Memilih model regresi
Bagaimana seseorang dapat secara objektif (membaca "algoritmik") memilih model yang tepat untuk melakukan regresi linear kuadrat-sederhana dengan dua variabel? Sebagai contoh, katakanlah data tampaknya menunjukkan tren kuadratik, dan parabola dihasilkan yang cocok dengan data dengan cukup baik. Bagaimana kita membenarkan membuat regresi ini? Atau bagaimana kita menghilangkan kemungkinan ada model …

2
Teorema harapan total untuk proses Poisson
Saya memiliki dua proses Poisson independen dan dengan tingkat kedatangan dan . Sekarang, waktu yang diharapkan untuk kedatangan item berikutnya untuk proses penggabungan adalah .AAABBBλAλA\lambda_AλBλB\lambda_B1λA+λB1λA+λB\frac {1}{\lambda_A+\lambda_B} Menganggap sebagai waktu kedatangan untuk item selanjutnya dari proses gabungan, dan atau sebagai peristiwa di mana item-item tersebut berasal dari proses atau , menggunakan …


1
Deteksi outlier dalam distribusi beta
Katakanlah saya memiliki sampel nilai yang besar di [0,1][0,1][0,1]. Saya ingin memperkirakan yang mendasarinyaBeta(α,β)Beta(α,β)\text{Beta}(\alpha, \beta)distribusi. Mayoritas sampel berasal dari asumsi iniBeta(α,β)Beta(α,β)\text{Beta}(\alpha, \beta) distribusi, sedangkan sisanya adalah outlier yang ingin saya abaikan dalam estimasi αα\alpha dan ββ\beta. Apa cara yang baik untuk melanjutkan ini? Apakah standar: Inliers={x∈[Q1−1.5IQR,Q3+1.5IQR]}Inliers={x∈[Q1−1.5IQR,Q3+1.5IQR]}\text{Inliers} = \left\{x \in [Q1 …

1
Sensor interval
Saya menjalankan kurva survival sensor interval dengan R, JMP dan SAS. Mereka berdua memberi saya grafik yang sama, tetapi tabelnya sedikit berbeda. Ini adalah tabel yang diberikan JMP padaku. Start Time End Time Survival Failure SurvStdErr . 14.0000 1.0000 0.0000 0.0000 16.0000 21.0000 0.5000 0.5000 0.2485 28.0000 36.0000 0.5000 0.5000 …

1
Kapan / mengapa kecenderungan sentral dari simulasi resampling berbeda dari nilai yang diamati?
Haruskah seseorang selalu mengharapkan kecenderungan sentral (yaitu, rata-rata dan / atau median) sampel yang di-boot sama dengan nilai yang diamati? Dalam kasus khusus ini saya memiliki tanggapan yang didistribusikan secara eksponensial untuk subjek di dua kondisi (saya tidak menjalankan eksperimen, saya hanya punya data). Saya telah ditugaskan untuk boot dengan …


2
Bagaimana cara membuat koreksi peristiwa langka yang dijelaskan dalam King and Zeng (2001)?
Saya memiliki dataset dengan variabel respons biner (bertahan hidup) dan 3 variabel penjelas ( A= 3 level, B= 3 level, C= 6 level). Dalam dataset ini, data seimbang dengan 100 individu per ABCkategori. Saya sudah mempelajari efek dari A, Bdan Cvariabel dengan dataset ini; efeknya signifikan. Saya memiliki subset. Dalam …

3
Bagaimana menafsirkan analisis paralel secara benar dalam analisis faktor eksplorasi?
Beberapa makalah ilmiah melaporkan hasil analisis paralel dari analisis faktor poros utama dengan cara yang tidak konsisten dengan pemahaman saya tentang metodologi. Apa yang saya lewatkan? Apakah saya salah atau mereka. Contoh: Data: Kinerja 200 individu manusia telah diamati pada 10 tugas. Untuk setiap individu dan setiap tugas, seseorang memiliki …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.