Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data




9
Mengukur akurasi model berbasis regresi logistik
Saya memiliki model regresi logistik terlatih yang saya terapkan pada set data pengujian. Variabel dependen adalah biner (boolean). Untuk setiap sampel dalam set data pengujian, saya menerapkan model regresi logistik untuk menghasilkan probabilitas% bahwa variabel dependen akan benar. Lalu saya mencatat apakah nilai acutal itu benar atau salah. Saya mencoba …

3
Perbedaan antara MANOVA dan Tindakan Berulang ANOVA?
Apa perbedaan antara ANOVA tindakan berulang atas beberapa faktor (katakanlah kondisi eksperimental) dan MANOVA? Khususnya pada satu situs web yang saya temukan menyarankan bahwa MANOVA tidak membuat asumsi yang sama tentang kebulatan yang diulangi oleh tindakan ANOVA, apakah itu benar? Jika demikian, mengapa seseorang tidak selalu menggunakan MANOVA? Saya mencoba …

3
Apa itu theta dalam regresi binomial negatif yang dilengkapi dengan R?
Saya punya pertanyaan tentang regresi binomial negatif: Misalkan Anda memiliki perintah berikut: require(MASS) attach(cars) mod.NB<-glm.nb(dist~speed) summary(mod.NB) detach(cars) (Perhatikan bahwa mobil adalah set data yang tersedia dalam R, dan saya tidak terlalu peduli jika model ini masuk akal.) Yang ingin saya ketahui adalah: Bagaimana saya bisa menafsirkan variabel theta(seperti yang dikembalikan …

4
Impor harga saham dari Yahoo Finance ke R?
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Saya ingin mengimpor harga saham "Perdagangan Terakhir" dari Yahoo finance ke R. Tujuannya adalah untuk bekerja dengan (hampir) data waktu nyata. Apakah ada solusi? Terima kasih …
26 r 

2
Apakah distribusi memiliki nama?
Saya berlari melintasi kepadatan ini beberapa hari yang lalu. Apakah ada yang memberi nama ini? f( x ) = log( 1 + x- 2) / 2 πf(x)=log⁡(1+x−2)/2πf(x) = \log(1 + x^{-2}) / 2\pi Kepadatannya tak terbatas pada asal dan juga memiliki ekor yang gemuk. Saya melihatnya digunakan sebagai distribusi sebelumnya …

6
Seberapa besar kemungkinan saya akan diturunkan dari orang yang lahir pada tahun 1300?
Dengan kata lain, berdasarkan hal berikut, apa itu p? Untuk menjadikan ini masalah matematika daripada antropologi atau ilmu sosial, dan untuk menyederhanakan masalah, asumsikan bahwa pasangan dipilih dengan probabilitas yang sama di seluruh populasi, kecuali bahwa saudara kandung dan sepupu pertama tidak pernah kawin, dan pasangan selalu dipilih dari yang …

3
Apakah penting untuk menguji normalitas dengan ukuran sampel yang sangat kecil (misalnya, n = 6)?
Saya memiliki ukuran sampel 6. Dalam kasus seperti itu, apakah masuk akal untuk menguji normalitas menggunakan tes Kolmogorov-Smirnov? Saya menggunakan SPSS. Saya memiliki ukuran sampel yang sangat kecil karena butuh waktu untuk mendapatkannya. Jika tidak masuk akal, berapa banyak sampel adalah jumlah terendah yang masuk akal untuk diuji? Catatan: Saya …


3
Bagaimana memahami keluaran dari fungsi polr R (regresi logistik yang dipesan)?
Saya baru mengenal R, memerintahkan regresi logistik, dan polr. Bagian "Contoh" di bagian bawah halaman bantuan untuk polr (yang cocok dengan model regresi logistik atau probit ke respons faktor yang dipesan) menunjukkan options(contrasts = c("contr.treatment", "contr.poly")) house.plr <- polr(Sat ~ Infl + Type + Cont, weights = Freq, data = …
26 r  logistic 

1
Bagaimana seseorang dapat secara empiris menunjukkan dalam R yang mana metode validasi silang yang setara dengan AIC dan BIC?
Dalam sebuah pertanyaan di tempat lain di situs ini, beberapa jawaban menyebutkan bahwa AIC setara dengan validasi silang leave-one-out (LOO) dan bahwa BIC setara dengan validasi silang K-fold. Apakah ada cara untuk secara empiris menunjukkan ini dalam R sehingga teknik yang terlibat dalam LOO dan K-fold diperjelas dan didemonstrasikan setara …
26 r  aic  cross-validation  bic 

4
Mengapa RANSAC tidak digunakan secara luas dalam statistik?
Berasal dari bidang visi komputer, saya sering menggunakan metode RANSAC (Random Sample Consensus) untuk memasang model ke data dengan banyak outlier. Namun, saya belum pernah melihatnya digunakan oleh ahli statistik, dan saya selalu mendapat kesan bahwa itu tidak dianggap metode "statistik-suara". Kenapa begitu? Sifatnya acak, yang membuatnya lebih sulit untuk …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.