Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Penentu informasi Fisher
(Saya memposting pertanyaan serupa di math.se. ) Dalam geometri informasi, penentu matriks informasi Fisher adalah bentuk volume alami pada manifold statistik, sehingga memiliki interpretasi geometris yang bagus. Fakta bahwa itu muncul dalam definisi sebelumnya Jeffreys, misalnya, terkait dengan invariannya di bawah reparametrizations, yang (imho) properti geometris. Tapi apa yang menentukan …

1
t.test mengembalikan kesalahan "data pada dasarnya konstan"
R version 3.1.1 (2014-07-10) -- "Sock it to Me" > bl <- c(140, 138, 150, 148, 135) > fu <- c(138, 136, 148, 146, 133) > t.test(fu, bl, alternative = "two.sided", paired = TRUE) Error in t.test.default(fu, bl, alternative = "two.sided", paired = TRUE) : data are essentially constant Lalu …
12 r  t-test 

4
Bentuk yang bagus untuk menghapus outlier?
Saya sedang mengerjakan statistik untuk pembuatan perangkat lunak. Saya punya data untuk setiap build on pass / gagal dan waktu yang berlalu dan kami menghasilkan ~ 200 dari ini / minggu. Tingkat keberhasilannya mudah untuk dikumpulkan, saya dapat mengatakan bahwa 45% lulus setiap minggu. Tapi saya juga ingin menggabungkan waktu …

2
Mengapa SAS PROC GLIMMIX memberi saya lereng acak yang SANGAT berbeda dari glmer (lme4) untuk glmm binomial
Saya adalah pengguna yang lebih terbiasa dengan R, dan telah mencoba memperkirakan lereng acak (koefisien seleksi) untuk sekitar 35 individu selama 5 tahun untuk empat variabel habitat. Variabel respons adalah apakah suatu lokasi merupakan habitat "bekas" (1) atau "tersedia" (0) ("digunakan" di bawah). Saya menggunakan komputer Windows 64-bit. Dalam R …

3
menguji koefisien regresi logistik menggunakan dan derajat kebebasan deviance residual
Ringkasan: Apakah ada teori statistik untuk mendukung penggunaan distribusi- (dengan derajat kebebasan berdasarkan pada residual deviance) untuk pengujian koefisien regresi logistik, daripada distribusi normal standar?ttt Beberapa waktu yang lalu saya menemukan bahwa ketika memasang model regresi logistik di SAS PROC GLIMMIX, di bawah pengaturan default, koefisien regresi logistik diuji menggunakan …

1
Memahami keluaran dari analisis mediasi dalam R
Saya mencoba mencari tahu tentang paket mediasi dalam R, menggunakan sketsa untuk paket tersebut. Saya berjuang untuk memahami output dari mediate()fungsi ini. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age …
12 r  mediation 

4
Bisakah seri stasioner tren dimodelkan dengan ARIMA?
Saya punya pertanyaan / kebingungan tentang seri stasioner yang diperlukan untuk pemodelan dengan ARIMA (X). Saya lebih memikirkan hal ini dalam hal inferensi (efek intervensi), tetapi ingin tahu apakah perkiraan versus inferensi membuat perbedaan dalam respons. Pertanyaan: Semua sumber pengantar yang telah saya baca menyatakan bahwa seri ini harus stasioner, …

3
Gagasan membuat data memiliki mean nol
Saya sering melihat orang membuat dimensi / fitur dataset menjadi nol-rata dengan menghapus rata-rata dari semua elemen. Tetapi saya tidak pernah mengerti mengapa melakukannya? Apa efek dari melakukan itu sebagai langkah preprocessing? Apakah ini meningkatkan kinerja klasifikasi? Apakah ada gunanya menjawab sesuatu tentang dataset? Apakah ada gunanya ketika melakukan visualisasi …

2
Apakah salah menggunakan plot garis untuk data diskrit?
Saya sering melihat dataset terpisah yang diplot sebagai plot garis, tetapi saya sadar bahwa garis tersebut memberikan nilai pada suatu titik di antara interval pengukuran yang tidak ada artinya bagi dataset terpisah. Apakah karena itu kasus menggunakan plot garis untuk data diskrit salah? Sebagai contoh, ambil dua dataset deret waktu, …

3
Apa cara terbaik untuk membentuk kembali / merestrukturisasi data?
Saya seorang asisten peneliti untuk laboratorium (sukarelawan). Saya dan kelompok kecil telah ditugaskan untuk analisis data untuk satu set data yang ditarik dari sebuah penelitian besar. Sayangnya, data dikumpulkan dengan semacam aplikasi online, dan tidak diprogram untuk menampilkan data dalam bentuk yang paling dapat digunakan. Gambar-gambar di bawah menggambarkan masalah …
12 r  excel  data-cleaning 

2
Apakah X dan Y terdistribusi normal lebih mungkin menghasilkan residu terdistribusi normal?
Di sini salah tafsir dari asumsi normalitas dalam regresi linier dibahas (bahwa 'normalitas' merujuk X dan / atau Y daripada residual), dan poster bertanya apakah mungkin untuk memiliki X dan Y yang terdistribusi secara tidak normal. dan masih memiliki residu terdistribusi normal. Pertanyaan saya adalah: apakah X yang didistribusikan secara …

3
Uji statistik apa yang digunakan untuk uji A / B?
Kami memiliki dua kohort masing-masing 1000 sampel. Kami mengukur 2 jumlah pada setiap kelompok. Yang pertama adalah variabel biner. Yang kedua adalah bilangan real yang mengikuti distribusi ekor yang berat. Kami ingin menilai kohort mana yang berkinerja terbaik untuk setiap metrik. Ada banyak tes statistik yang dapat dipilih: orang menyarankan …
12 ab-test 

3
Batas atas eksponensial
Misalkan kita memiliki variabel acak IID dengan distribusi . Kita akan mengamati sampel dengan cara berikut: biarkan menjadi independen variabel acak, misalkan semua dan 's independen, dan menentukan ukuran sampel . The 's menunjukkan yang mana dari ' s berada dalam sampel, dan kami ingin belajar fraksi keberhasilan dalam sampel …


3
Cara menormalkan data dari distribusi yang tidak diketahui
Saya mencoba untuk menemukan distribusi karakteristik yang paling tepat dari data pengukuran berulang dari jenis tertentu. Pada dasarnya, di cabang geologi saya, kami sering menggunakan penanggalan radiometrik mineral dari sampel (bongkahan batu) untuk mengetahui berapa lama peristiwa terjadi (batu itu mendingin di bawah suhu ambang batas). Biasanya, beberapa (3-10) pengukuran …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.