Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Teorema Bayes dengan berbagai kondisi
Saya tidak mengerti bagaimana persamaan ini diturunkan. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} Persamaan ini berasal dari makalah "Trial by Probability" di mana kasus OJ Simpson diberikan sebagai contoh masalah. Terdakwa sedang diadili karena pembunuhan ganda dan dua bukti diajukan terhadapnya. M1M1M_{1} adalah peristiwa darah terdakwa cocok dengan setetes darah yang …


1
Apakah ANOVA mengandalkan metode momen dan bukan pada kemungkinan maksimum?
Saya melihat disebutkan di berbagai tempat bahwa ANOVA melakukan estimasi menggunakan metode momen. Saya bingung dengan pernyataan itu karena, meskipun saya tidak terbiasa dengan metode momen, pemahaman saya adalah bahwa itu adalah sesuatu yang berbeda dan tidak setara dengan metode kemungkinan maksimum; di sisi lain, ANOVA dapat dilihat sebagai regresi …



2
Apakah prediksi merupakan 'kriteria emas' untuk menilai kemampuan para ahli statistik?
Saya sedang membaca model linear buku teks Faraway dengan R (edisi 1) akhir pekan lalu. Faraway memiliki bab yang disebut "Strategi Statistik dan Ketidakpastian Model". Dia menggambarkan (halaman 158) bahwa ia artifisial dihasilkan beberapa data menggunakan model yang sangat rumit, maka ia meminta murid-muridnya untuk memodelkan data dan membandingkan siswa …

1
Canggih dalam Penyaringan Kolaboratif
Saya sedang mengerjakan proyek untuk filtering kolaboratif (CF), yaitu menyelesaikan matriks yang diamati sebagian atau secara umum tensor. Saya seorang pemula di lapangan, dan untuk proyek ini akhirnya saya harus membandingkan metode kami dengan yang terkenal lainnya yang saat ini, metode yang diusulkan dibandingkan dengan mereka, yaitu state-of-the-art di CF. …

1
Jelaskan bagaimana `eigen` membantu membalik matriks
Pertanyaan saya berkaitan dengan teknik perhitungan yang dieksploitasi di geoR:::.negloglik.GRFatau geoR:::solve.geoR. Dalam pengaturan model campuran linier: mana dan masing-masing adalah efek tetap dan acak. Juga,Y= Xβ+ Zb + eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\betabbbΣ=cov(Y)Σ=cov(Y)\Sigma=\text{cov}(Y) Ketika memperkirakan efek, ada kebutuhan untuk menghitung yang biasanya dapat dilakukan menggunakan sesuatu seperti , tetapi kadang-kadang hampir tidak …

1
Peluang dibuat sederhana
Saya mengalami beberapa kesulitan dalam memahami peluang, dan saya hanya ingin penjelasan dasar tentang bagaimana menafsirkannya. Saya telah menemukan berbagai posting yang terkait dengan peluang tetapi kebanyakan dari mereka lebih kompleks daripada apa yang saya coba pahami. Berikut ini adalah contoh bagaimana saya menafsirkan peluang: jika peluang suatu peristiwa terjadi …

5
Nilai rata-rata dari cetakan yang dipilih dari serangkaian gulungan yang tak terbatas
Jika saya melempar sepasang dadu beberapa kali tanpa batas, dan selalu memilih nilai yang lebih tinggi dari keduanya, akankah rata-rata yang diharapkan dari nilai tertinggi melebihi 3,5? Kelihatannya pasti karena jika saya melempar sejuta dadu, dan memilih nilai tertinggi setiap kali, kemungkinannya besar bahwa enam akan tersedia di setiap gulungan. …
13 dice 

3
Definisi dan pembatasan model regresi
Sebuah pertanyaan sederhana yang memalukan - tetapi sepertinya belum ditanyakan pada Cross divalidasi sebelumnya: Apa definisi model regresi? Juga pertanyaan dukungan, Apa yang bukan model regresi? Sehubungan dengan yang terakhir, saya tertarik pada contoh rumit di mana jawabannya tidak segera jelas, misalnya ARIMA atau GARCH.

7
Apakah salah untuk menyebut hasil sebagai "hampir" atau "agak" signifikan?
Konsensus umum tentang pertanyaan serupa, Apakah salah untuk menyebut hasil sebagai "sangat signifikan"? adalah bahwa "sangat signifikan" adalah cara yang valid, meskipun tidak spesifik, untuk menggambarkan kekuatan asosiasi yang memiliki nilai p jauh di bawah ambang signifikansi yang telah Anda tetapkan sebelumnya. Namun, bagaimana dengan menggambarkan nilai-p yang sedikit di …

3
Regresi linier: apakah ada distribusi tidak normal yang memberikan identitas OLS dan MLE?
Pertanyaan ini terinspirasi dari diskusi panjang dalam komentar di sini: Bagaimana regresi linier menggunakan distribusi normal? Dalam model regresi linier biasa, untuk kesederhanaan di sini ditulis dengan hanya satu prediktor: Yi=β0+β1xi+ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i mana xixix_i dikenal konstanta dan ϵiϵi\epsilon_i adalah istilah kesalahan independen nol-rata. …

1
Grafik macam apa ini?
Maaf untuk pertanyaan yang tidak jelas tetapi bagan ini muncul di Biddle et al. 2009 dan saya belum pernah mengalami hal seperti itu sebelumnya. Ini bagan batang dengan tepi miring, kadang-kadang 'tanduk'. Apa artinya ini? Apakah jenis bagan ini memiliki nama? Per /meta/244083/site-for-asking-about-charts Saya pikir Academia adalah tempat terbaik untuk …

3
variabel dummy pemusatan dan penskalaan
Saya memiliki kumpulan data yang berisi variabel kategorikal dan variabel kontinu. Saya disarankan untuk mengubah variabel kategori sebagai variabel biner untuk setiap level (yaitu, A_level1: {0,1}, A_level2: {0,1}) - Saya pikir beberapa orang menyebutnya "variabel dummy". Dengan itu, apakah akan menyesatkan untuk kemudian memusatkan dan skala seluruh set data dengan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.