Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana menafsirkan interaksi tingkat rendah ketika interaksi tingkat tinggi itu signifikan?
Saya punya pertanyaan tentang interpretasi istilah interaksi tingkat rendah di hadapan efek interaksi tingkat tinggi yang signifikan. Misalkan saya punya 2 (faktor SEBUAHAA) ××\times 2 (faktor BBB) ××\times 2 (faktor CCC) desain tempat interaksi urutan tertinggi (A×B×CA×B×CA\times B\times C) signifikan dan istilah interaksi urutan rendah (A×BA×BA\times B) juga signifikan. Apakah …

2
Komputasi fungsi hypergeometrik di R
Saya mengalami kesulitan luar biasa mengevaluasi dengan paket di R. Dalam kasus saya, nilai , , selalu bilangan real positif. Meski begitu, fungsi hypergeometrik sangat sensitif terhadap nilai-nilai mereka. Saya tidak mencari presisi ekstrim; Saya dapat menggunakan Excel untuk mendapatkan estimasi kasar dari hypergeometrik Guass yang baik untuk tujuan saya.2F1(a,b;c;z)2F1(a,b;c;z)_2F_1(a,b;c;z)hypergeoaaabbbccc …

2
menguji preferensi pengguna
Saya telah menghasilkan tes pengguna untuk membandingkan dua metode: M1 dan M2. Saya menghasilkan 40 kasus uji dan menunjukkan hasil masing-masing metode pada kasus uji kepada 20 orang, berdampingan, orang-orang tidak tahu hasil apa yang datang dari metode mana. Untuk setiap kasus uji, setiap orang harus mengatakan apakah hasil yang …

1
Mengapa model berubah saat menggunakan relevel?
Ketika menghitung model regresi dengan R, saya secara teratur menggunakan fungsi relevel untuk mendapatkan model saya untuk memberi saya hasil untuk tingkat lain juga. Saya perhatikan bahwa kadang-kadang, tetapi tidak sering, ini mengubah model dalam arti bahwa tingkat faktor-faktor lain yang signifikan sebelum rilis tidak lagi. Apakah ini melekat pada …
8 r  regression 

1
Pilih model terbaik antara logit, probit dan nls
Saya menganalisis dataset tertentu, dan saya perlu memahami cara memilih model terbaik yang sesuai dengan data saya. Saya menggunakan R. Contoh data yang saya miliki adalah sebagai berikut: corr <- c(0, 0, 10, 50, 70, 100, 100, 100, 90, 100, 100) Angka-angka ini sesuai dengan persentase jawaban yang benar, dalam …

1
Bagaimana cara saya menyelesaikan kotak dengan kemungkinan normal dan normal sebelumnya?
Bagaimana saya menyelesaikan kuadrat dari titik saya tinggalkan, dan apakah ini benar sejauh ini? Saya memiliki sebelumnya normal untuk dari bentuk , untuk mendapatkan:ββ\betap ( β|σ2) ∼ N( 0 ,σ2V)p(β|σ2)∼N(0,σ2V)p(\beta|\sigma^2)\sim \mathcal{N}(0,\sigma^2V) p ( β|σ2) = ( 2 πσ2V)hal2exp[ -12σ2βTβ]p(β|σ2)=(2πσ2V)p2exp⁡[−12σ2βTβ]p(\beta|\sigma^2)=(2\pi\sigma^2V)^\frac{p}{2}\exp[-\frac{1}{2\sigma^2}\beta^T\beta] di mana adalah .βTββTβ\beta^T\beta∑i = 1halβ2saya∑i=1pβi2\sum\limits_{i=1}^p \beta_i^2 Kemungkinan saya memiliki distribusi …

3
Uji akar unit untuk data panel di R
Saya memiliki plmpaket dan ingin menjalankan tes unit root pada beberapa variabel. Saya mendapatkan kesalahan berikut: > purtest(data$tot.emp) Error in data.frame(baldwin = c(59870, 61259, 60397, 58919, 57856, 57227, : arguments imply differing number of rows: 14, 19, 11, 12, 1, 20, 18, 10, 13 Saya berasumsi bahwa saya mendapatkan kesalahan …

3
Teknik reduksi dimensi untuk ukuran sampel yang sangat kecil
Saya memiliki 21 variabel tingkat sosial-ekonomi dan sikap makro (seperti persentase ibu berusia 24-54 yang tidak bekerja, persentase anak-anak berusia 3-5 tahun di sekolah penitipan anak dan sebagainya). Saya juga memiliki data tentang proporsi kakek-nenek yang memberikan pengasuhan anak intensif. Sebagian besar variabel sosial-ekonomi yang saya pilih sangat berkorelasi dengan …


2
Bagaimana cara menghitung dengan probabilitas kecil dan sampel besar?
Apakah mungkin untuk menghitung atau memperkirakan probabilitas sesuatu yang sangat tidak mungkin terjadi sekali dalam sampel besar, yaitu, dalam situasi di mana probabilitas lebih kecil dari kesalahan mesin? Misalnya, saya mencoba menghitung perkiraan seseorang yang berbagi genom saya. Tampaknya suatu genom individu dapat dikompresi tanpa kehilangan hingga sekitar 4MB (2 …

2
Desain ukuran berulang yang seimbang
Oke ini masalah saya: Saya punya 12 peserta. Setiap peserta menghabiskan 3 malam di lab saya melakukan tugas waktu reaksi di empat titik waktu pada malam hari (12, 1, 2 dan 3 jam), dengan satu minggu antara masing-masing malam. Setiap malam, masing-masing peserta dihadapkan pada salah satu dari tiga kondisi …


1
Hitung nilai-p dalam bootstrap berpasangan
Saya menemukan kertas baru dari kelompok Berkeley NLP tentang pengujian statistik, Investigasi Empiris Signifikansi Statistik di NLP . Ada pseudocode untuk menghitung nilai-p dalam makalah, pada dasarnya, idenya adalah bahwa set sampel disampel dengan penggantian dari data . Kemudianx1,x2, . . . ,xNx1,x2,...,xNx_1,x_2,...,x_Nxxx p-value = count ( δ(xsaya) > 2 …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.