Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


5
Teknik pengelompokan yang sesuai untuk data temporal?
Saya memiliki data sementara frekuensi aktivitas. Saya ingin mengidentifikasi cluster dalam data yang menunjukkan periode waktu yang berbeda dengan tingkat aktivitas yang sama. Idealnya saya ingin mengidentifikasi kluster tanpa menentukan jumlah kluster apriori. Apa teknik pengelompokan yang tepat? Jika pertanyaan saya tidak mengandung informasi yang cukup untuk dijawab, informasi apa …


1
Turunkan Negentropi. Terjebak
Jadi, pertanyaan ini agak terlibat, tetapi saya dengan susah payah berusaha membuatnya selurus mungkin. Tujuan: Singkatnya, ada derivasi negentropi yang tidak melibatkan kumulan tingkat tinggi, dan saya mencoba memahami bagaimana itu diturunkan. Latar Belakang: (Saya mengerti semua ini) Saya mempelajari sendiri buku itu 'Analisis Komponen Independen' , ditemukan di sini. …

3
Ukuran standar dari clumpiness?
Saya punya banyak data dan saya ingin melakukan sesuatu yang tampaknya sangat sederhana. Dalam kumpulan data yang besar ini, saya tertarik pada seberapa banyak elemen tertentu berkumpul bersama. Katakanlah data saya adalah kumpulan yang diatur seperti ini: {A, C, B, D, A, Z, T, C ...}. Katakanlah saya ingin tahu …

6
Sumber daya untuk mempelajari cara menerapkan metode ansambel
Saya mengerti secara teoritis (semacam) bagaimana mereka akan bekerja, tetapi saya tidak yakin bagaimana cara menggunakan metode ensemble (seperti voting, campuran tertimbang, dll.). Apa sumber daya yang baik untuk menerapkan metode ensemble? Apakah ada sumber daya khusus mengenai implementasi di Python? EDIT: Untuk menjernihkan beberapa berdasarkan diskusi pada komentar, saya …


5
Memperkirakan persentase sebagai variabel dependen dalam regresi
Saya memiliki persentase peringkat siswa dalam 38 ujian sebagai variabel dependen dalam penelitian saya. Persentase peringkat dihitung oleh (peringkat / jumlah siswa dalam ujian). Variabel dependen ini memiliki distribusi yang hampir seragam dan saya ingin memperkirakan efek dari beberapa variabel pada variabel dependen. Pendekatan regresi mana yang saya gunakan?

2
Bagaimana saya bisa menggunakan nilai untuk menguji asumsi linearitas dalam analisis regresi berganda?
Grafik di bawah ini adalah plot pencar residual dari uji regresi yang asumsi "normalitas", "homoscedasticity", dan "independensi" telah dipenuhi! Untuk menguji asumsi "linearitas" , walaupun, dengan melihat grafik, dapat ditebak bahwa hubungannya adalah curvilinear, tetapi pertanyaannya adalah: Bagaimana nilai "R2 Linear" dapat digunakan untuk menguji asumsi linearitas? Berapa kisaran yang …


1
Bantu saya memahami nilai- di Bayesian glm
Saya mencoba menjalankan Bayesian logit pada data di sini . Saya menggunakan bayesglm()dalam armpaket di R. Pengodean cukup mudah: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) memberikan hasil sebagai berikut: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 …
13 r  bayesian  p-value 

2
Bagaimana cara mendapatkan hasil tes post-hoc Tukey HSD dalam tabel yang menunjukkan pasangan yang dikelompokkan?
Saya akan senang untuk melakukan tes post-hoc TukeyHSD setelah Anova dua arah saya dengan R, memperoleh tabel berisi pasangan yang disortir yang dikelompokkan berdasarkan perbedaan yang signifikan. (Maaf tentang kata-katanya, saya masih baru dengan statistik.) Saya ingin memiliki sesuatu seperti ini: Jadi, dikelompokkan dengan bintang atau huruf. Ada ide? Saya …

1
Apa perbedaan antara wilcox.test dan coin :: wilcox_test dalam R?
Dua fungsi ini ada di R tapi saya tidak tahu perbedaannya. Tampaknya mereka hanya mengembalikan nilai-p yang sama saat menelepon wilcox.testdengan correct=FALSE, dan wilcox_test(dalam paket koin) dengan distribution="aymptotic". Untuk nilai lain mereka mengembalikan nilai p yang berbeda. Jugawilcox.test selalu mengembalikan W = 0 untuk dataset saya, terlepas dari pengaturan parameternya: …

4
Mencari ilustrasi nyata dari kutipan Fisher tentang DoE
Tim saya dan saya ingin memberikan presentasi kepada non-ahli statistik perusahaan tentang kegunaan desain percobaan. Non-ahli statistik ini juga adalah klien kami dan mereka biasanya tidak berkonsultasi dengan kami sebelum mengumpulkan data mereka. Apakah Anda tahu beberapa contoh nyata yang akan menggambarkan kutipan terkenal Fisher "Untuk memanggil ahli statistik setelah …

1
Prediksi menggunakan glmnet di R
Saya mencoba memodelkan beberapa data menggunakan glmnetpaket dalam R. Katakanlah saya memiliki data berikut training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Ini adalah penyederhanaan; data saya jauh lebih rumit.) Lalu saya menggunakan kode berikut …
13 r  glmnet 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.