Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Mengapa kita perlu Bootstrapping?
Saat ini saya sedang membaca "Semua Statistik" karya Larry Wasserman dan bingung dengan sesuatu yang ditulisnya dalam bab tentang memperkirakan fungsi statistik model nonparametrik. Dia menulis "Kadang-kadang kita dapat menemukan kesalahan standar estimasi fungsi statistik dengan melakukan beberapa perhitungan. Namun dalam kasus lain tidak jelas bagaimana memperkirakan kesalahan standar". Saya …

1
Integrasi Metropolis-Hastings - mengapa strategi saya tidak berhasil?
Asumsikan saya memiliki fungsi g(x)g(x)g(x) yang ingin saya integrasikan ∫∞−∞g(x)dx.∫−∞∞g(x)dx. \int_{-\infty}^\infty g(x) dx. Tentu saja dengan asumsi g(x)g(x)g(x) menjadi nol pada titik akhir, tidak ada semburan, fungsi yang bagus. Salah satu cara yang saya telah mengutak-atik adalah dengan menggunakan algoritma Metropolis-Hastings untuk menghasilkan daftar sampel x1,x2,…,xnx1,x2,…,xnx_1, x_2, \dots, x_n dari …

3
Fungsi ETS (), bagaimana cara menghindari ramalan yang tidak sesuai dengan data historis?
Saya sedang mengerjakan alogoritma di R untuk mengotomatiskan perhitungan perkiraan bulanan. Saya menggunakan, antara lain, fungsi ets () dari paket perkiraan untuk menghitung perkiraan. Ini bekerja dengan sangat baik. Sayangnya, untuk beberapa seri waktu tertentu, hasil yang saya dapatkan aneh. Silakan, cari di bawah kode yang saya gunakan: train_ts<- ts(values, …

3
tanh vs sigmoid di jaring saraf
Saya minta maaf sebelumnya atas fakta bahwa saya masih akan mempercepat ini. Saya mencoba memahami pro dan kontra menggunakan tanh (peta -1 hingga 1) vs sigmoid (peta 0 hingga 1) untuk fungsi aktivasi neuron saya. Dari bacaan saya itu terdengar seperti hal kecil dengan perbedaan kecil. Dalam praktik untuk masalah …

1
Apakah komponen PCA dari data Gaussian multivarian secara statistik independen?
Apakah komponen PCA (dalam analisis komponen utama) secara statistik independen jika data kami terdistribusi normal multivarian? Jika demikian, bagaimana ini dapat ditunjukkan / dibuktikan? Saya bertanya karena saya melihat posting ini , di mana jawaban teratas menyatakan: PCA tidak membuat asumsi Gaussianity eksplisit. Ia menemukan vektor eigen yang memaksimalkan varians …
16 pca  independence  svd 


2
Untuk distribusi mana saja ada estimator tidak bias berbentuk tertutup untuk simpangan baku?
Untuk distribusi normal, ada penaksir yang tidak bias dari standar deviasi yang diberikan oleh: σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2−−−−−−−−−−−−√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} Alasan mengapa hasil ini tidak begitu dikenal tampaknya karena sebagian besar merupakan curio daripada masalah impor besar . Buktinya tercakup di utas ini ; itu mengambil keuntungan dari properti utama dari distribusi …


2
Apa yang akan menjadi contoh model yang benar-benar sederhana dengan kemungkinan yang sulit dipecahkan?
Perkiraan perhitungan Bayesian adalah teknik yang sangat keren untuk pemasangan pada dasarnya setiap model stokastik, yang ditujukan untuk model-model di mana kemungkinannya tidak dapat diterapkan (katakanlah, Anda dapat mengambil sampel dari model jika Anda memperbaiki parameter tetapi Anda tidak dapat menghitung kemungkinan secara numerik, algoritmik, atau analitis menghitung kemungkinan). Saat …

2
Bagaimana melakukan analisis data eksplorasi untuk memilih algoritma pembelajaran mesin yang sesuai
Kami sedang mempelajari pembelajaran mesin melalui Machine Learning: A Probabilistic Perspective (Kevin Murphy). Sementara teks menjelaskan landasan teoretis dari masing-masing algoritma, ia jarang mengatakan dalam kasus apa algoritma yang lebih baik, dan ketika itu, tidak mengatakan bagaimana mengatakan dalam kasus apa saya masuk. Sebagai contoh, untuk pilihan kernel, saya telah …


3
Apa langkah konvolusi dalam Jaringan Syaraf Tiruan Convolutional?
Saya mempelajari jaringan saraf convolutional (CNNs) karena aplikasi mereka dalam visi komputer. Saya sudah terbiasa dengan jaringan saraf feed-foward standar, jadi saya berharap beberapa orang di sini dapat membantu saya mengambil langkah ekstra dalam memahami CNN. Inilah yang saya pikirkan tentang CNN: Dalam NN feed-foward tradisional, kami memiliki data pelatihan …

2
Mengapa standar deviasi didefinisikan sebagai sqrt dari varians dan bukan sebagai sqrt dari jumlah kuadrat atas N?
Hari ini saya mengajar kelas pengantar statistik dan seorang siswa mendatangi saya dengan sebuah pertanyaan, yang saya ulangi di sini sebagai: "Mengapa standar deviasi didefinisikan sebagai sqrt of variance dan bukan sebagai sqrt dari jumlah kuadrat atas N?" Kami mendefinisikan varians populasi:σ2=1N∑(xi−μ)2σ2=1N∑(xi−μ)2\sigma^2=\frac{1}{N}\sum{(x_i-\mu)^2} Dan standar deviasi: .σ=σ2−−√=1N√∑(xi−μ)2−−−−−−−−−−√σ=σ2=1N∑(xi−μ)2\sigma=\sqrt{\sigma^2}=\frac{1}{\sqrt{N}}\sqrt{\sum{(x_i-\mu)^2}} Interpretasi kami dapat memberikan …

2
Pertanyaan tentang standardisasi dalam regresi ridge
Hai teman-teman, saya menemukan satu atau dua makalah yang menggunakan regresi ridge (untuk data bola basket). Saya selalu diminta untuk menstandardisasi variabel saya jika saya menjalankan regresi punggungan, tetapi saya hanya diminta untuk melakukan ini karena punggungan adalah varian skala (regresi punggungan tidak benar-benar bagian dari kursus kami, jadi dosen …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.