Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Perbedaan antara distribusi nol dan distribusi sampel
Saya mengajukan pertanyaan ini untuk klarifikasi tentang istilah antara "distribusi nol" dan "distribusi sampel". Saya menemukan bahwa ketika seseorang mengatakan distribusi nol , sebenarnya mereka berarti hal yang sama seperti ketika orang lain mengatakan distribusi sampling . Dalam artikel pengujian hipotesis ini [1], Anda dapat melihat deskripsi contoh berikut ini …



1
Lengkapi statistik yang cukup
Saya baru-baru ini mulai mempelajari kesimpulan statistik. Saya telah mengatasi berbagai masalah dan ini membuat saya benar-benar bingung. Misalkan menjadi sampel acak dari distribusi diskrit yang ditetapkan dengan probabilitas nilai , di mana adalah bilangan bulat. Tunjukkan bahwa tidak ada statistik yang cukup lengkap.X1,…,XnX1,…,XnX_1,\dots,X_n1313\frac{1}{3}θ−1, θ, or θ+1θ−1, θ, or θ+1\theta-1,\space\theta,\space\text{or}\space\theta+1θθ\theta …


1
Persamaan yang benar untuk kovarians sampel tidak berat tertimbang
Saya sedang mencari persamaan yang tepat untuk menghitung kovarians sampel yang tidak bias tertimbang. Sumber-sumber internet sangat jarang pada tema ini dan mereka semua menggunakan persamaan yang berbeda. Persamaan yang paling mungkin saya temukan adalah persamaan ini: qjk=∑Ni=1wi(∑Ni=1wi)2−∑Ni=1w2i∑Ni=1wi(xij−x¯j)(xik−x¯k).qjk=∑i=1Nwi(∑i=1Nwi)2−∑i=1Nwi2∑i=1Nwi(xij−x¯j)(xik−x¯k).q_{jk}=\frac{\sum_{i=1}^{N}w_i}{\left(\sum_{i=1}^{N}w_i\right)^2-\sum_{i=1}^{N}w_i^2} \sum_{i=1}^N w_i \left( x_{ij}-\bar{x}_j \right) \left( x_{ik}-\bar{x}_k \right) . Dari: https://en.wikipedia.org/wiki/Sample_mean_and_sample_covariance#Weighted_samples Tentu …

1
Apa arti dari superskrip dalam dan ?
Dalam konteks inferensi berbasis kemungkinan, saya telah melihat beberapa notasi mengenai parameter yang menarik yang saya temukan sedikit membingungkan. Misalnya, notasi seperti dan .pθ(x)pθ(x)p_{\theta}(x)Eθ[S(θ)]Eθ[S(θ)]{\mathbb E}_{\theta}\left[S(\theta)\right] Apa signifikansi parameter ( ) dalam notasi subskrip di atas? Dengan kata lain, bagaimana seharusnya dibaca?θθ\theta Asumsi pertama saya adalah bahwa itu berarti "dengan parameter …

3
Mengapa svm tidak sebagus pohon keputusan pada data yang sama?
Saya baru mengenal pembelajaran mesin dan mencoba menggunakan scikit-learning (sklearn) untuk menangani masalah klasifikasi. Baik DecisionTree dan SVM dapat melatih classifier untuk masalah ini. Saya menggunakan sklearn.ensemble.RandomForestClassifierdan sklearn.svm.SVCmenyesuaikan data pelatihan yang sama (sekitar 500.000 entri dengan 50 fitur per entri). The RandomForestClassifier keluar dengan classifier di sekitar satu menit. The …

2
Kumpulan data uji yang sangat tidak seimbang dan data pelatihan yang seimbang dalam klasifikasi
Saya memiliki satu set pelatihan dengan sekitar 3000 contoh positif dan 3000 contoh negatif. Tetapi kumpulan data pengujian saya sangat tidak seimbang. Set positif hanya memiliki 50 instance dan negatif memiliki 1500 instance. Hal ini menyebabkan presisi sangat rendah. Apakah ada pendekatan untuk menyelesaikan masalah ini? Saya menggunakan SVM untuk …

1
Arti korelasi parsial
Dari Wikipedia Secara formal, korelasi parsial antara dan diberi satu set variabel pengendali , ditulis ρ_ {XY · Z} , adalah korelasi antara residual RX dan RY yang dihasilkan dari regresi linier X dengan Z dan Y dengan Z , masing-masing.XXXYYYnnnZ={Z1,Z2,…,Zn}Z={Z1,Z2,…,Zn}Z = \{Z_1, Z_2, …, Z_n\}ρXY⋅ZρXY·Zρ_{XY·Z}RXRXRXRYRYRYXXXZZZYYYZZZ Dikatakan sebelumnya bahwa korelasi …

2
Bisakah sampel terlalu besar untuk ANOVA atau uji-t?
Saya memiliki hampir satu juta kumpulan data dan setiap kali saya menjalankan uji perbandingan rata-rata, baik ANOVA atau uji-t, saya mendapatkan tingkat signifikansi kurang dari 0,0001 pada SPSS. Saya khawatir sampel saya sangat besar sehingga tentu saja ketika saya membandingkan cara itu akan terlihat sangat berbeda. Bisakah sampel terlalu besar …

1
Pisau cukur Occam sudah usang?
Saya melihat buku-buku Vapnik tentang pembelajaran statistik ... Saya membaca beberapa bab pertama. Ngomong-ngomong, yang paling mengejutkanku adalah dia berpikir pisau cukur Occam sudah usang. Saya pikir itu terkait dengan situasi di mana dengan asumsi dimensi yang lebih tinggi meningkatkan kecocokan secara signifikan. Apakah saya mengerti benar? Benarkah pisau cukur …



Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.