Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Menjelaskan tes dua sisi
Saya mencari berbagai cara untuk menjelaskan kepada siswa saya (dalam kursus statistik dasar) apa itu tes dua sisi, dan bagaimana nilai P dihitung. Bagaimana Anda menjelaskan kepada siswa Anda tes dua lawan satu?

2
Apa justifikasi statistik interpolasi?
Misalkan kita memiliki dua titik (gambar berikut: lingkaran hitam) dan kami ingin menemukan nilai untuk titik ketiga di antara mereka (silang). Memang kita akan memperkirakannya berdasarkan hasil percobaan kita, titik hitam. Kasus paling sederhana adalah menggambar garis dan kemudian menemukan nilai (yaitu, interpolasi linier). Jika kita memiliki titik-titik pendukung misalnya, …

5
Buku teori probabilitas untuk belajar sendiri
Adakah buku bagus yang menjelaskan konsep penting teori probabilitas seperti fungsi distribusi probabilitas dan fungsi distribusi kumulatif? Tolong, hindari merujuk buku-buku seperti "Statistik Matematika dan Analisis Data" oleh John Rice yang dimulai dengan konsep permutasi sederhana dan kemudian, tiba-tiba (dalam bab 2) mengambil lompatan dengan asumsi pengetahuan dalam analisis nyata, …

4
Mengelompokkan data 1D
Saya memiliki dataset, saya ingin membuat kelompok data berdasarkan hanya satu variabel (tidak ada nilai yang hilang). Saya ingin membuat 3 cluster berdasarkan satu variabel itu. Algoritma pengelompokan mana yang digunakan, k-means, EM, DBSCAN dll.? Pertanyaan utama saya adalah, dalam keadaan apa saya harus menggunakan k-means di atas EM atau …
16 clustering 

3
Membuat taruhan besar, pintar (er)
Saya sudah mencoba kode algoritma untuk menyarankan taruhan di 1X2 (game berbobot). Pada dasarnya, setiap pertandingan memiliki serangkaian pertandingan (tim kandang vs tim tamu): 1: rumah menang X: seri 2: kemenangan tandang Untuk setiap pertandingan dan simbol ( 1, Xdan 2), saya akan menetapkan persentase yang mewakili peluang / kemungkinan …

11
Cara memulai dan belajar R?
Saya telah mencoba beberapa kali untuk "melakukannya sendiri" - tetapi dengan keberhasilan yang terbatas. Saya adalah pengguna SPSS biasa dan memiliki pengalaman SAS. Akan menghargai satu atau dua pointer dari seseorang yang memiliki latar belakang yang sama dan sekarang menggunakan R.
16 r  references 

1
Bisakah saya menggunakan Kolmogorov-Smirnov untuk membandingkan dua distribusi empiris?
Apakah boleh menggunakan uji good-of-fit Kolmogorov-Smirnov untuk membandingkan dua distribusi empiris untuk menentukan apakah mereka tampaknya berasal dari distribusi dasar yang sama, daripada membandingkan satu distribusi empiris ke distribusi referensi yang ditentukan sebelumnya? Biarkan saya mencoba bertanya dengan cara lain. Saya mengumpulkan N sampel dari beberapa distribusi di satu lokasi. …

2
Kapan kita menggabungkan reduksi dimensi dengan pengelompokan?
Saya mencoba melakukan pengelompokan tingkat dokumen. Saya membangun matriks frekuensi istilah-dokumen dan saya mencoba mengelompokkan vektor-vektor dimensi tinggi ini menggunakan k-means. Alih-alih langsung mengelompokkan, apa yang saya lakukan adalah pertama-tama menerapkan dekomposisi vektor singular LSA (Latent Semantic Analysis) untuk mendapatkan matriks U, S, Vt, memilih ambang yang sesuai menggunakan plot …

1
Menghasilkan sampel acak dari distribusi khusus
Saya mencoba untuk menghasilkan sampel acak dari pdf kustom menggunakan R. Pdf saya adalah: fX(x)=32(1−x2),0≤x≤1fX(x)=32(1−x2),0≤x≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 Saya menghasilkan sampel yang seragam dan kemudian mencoba mengubahnya menjadi distribusi khusus saya. Saya melakukan ini dengan menemukan cdf dari distribusi saya ( FX(x)FX(x)F_{X}(x) ) dan mengaturnya …
16 r  sampling  uniform 

2
Apa sebenarnya artinya 'kumpulan data'?
Saya berpikir bahwa 'kumpulan data' hanya berarti menggabungkan data yang sebelumnya dibagi menjadi beberapa kategori ... pada dasarnya, mengabaikan kategori-kategori dan membuat data menetapkan satu 'kumpulan' raksasa data. Saya kira ini adalah pertanyaan lebih banyak tentang terminologi daripada aplikasi statistik. Sebagai contoh: Saya ingin membandingkan 2 situs, dan di dalam …




3
Perkiraan median yang tidak bias
Misalkan kita memiliki variabel acak didukung pada dari mana kita dapat mengambil sampel. Bagaimana kita bisa menghasilkan estimasi median ?XXX[0,1][0,1][0,1]XXX Kita tentu saja dapat menghasilkan beberapa sampel dan mengambil median sampel, tetapi saya mengerti ini secara umum tidak akan memihak. Catatan: pertanyaan ini terkait, tetapi tidak identik, dengan pertanyaan terakhir …
16 sampling 

3
Apakah dapat dipertahankan untuk membuat stratifikasi data yang ditetapkan berdasarkan ukuran residual dan melakukan perbandingan dua sampel?
Ini adalah sesuatu yang saya lihat dilakukan sebagai semacam metode ad-hoc dan tampaknya sangat mencurigakan bagi saya tetapi mungkin saya kehilangan sesuatu. Saya telah melihat ini dilakukan dalam beberapa regresi tetapi mari kita tetap sederhana: yi=β0+β1xi+εiyi=β0+β1xi+εi y_{i} = \beta_{0} + \beta_{1} x_{i} + \varepsilon_{i} Sekarang ambil residu dari model yang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.