Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Taruhan Blackwell
Saya telah membaca tentang paradoks taruhan Blackwell di lemari Futility . Berikut ringkasannya: Anda disajikan dua amplop, dan . Amplop berisi jumlah uang acak, tetapi Anda tidak tahu apa-apa tentang distribusi tentang uang itu. Anda membuka satu, memeriksa berapa banyak uang di sana ( ), dan harus memilih: ambil amplop …



2
Berapa fraksi percobaan ulang yang akan memiliki ukuran efek dalam interval kepercayaan 95% dari percobaan pertama?
Mari tetap berpegang pada situasi ideal dengan pengambilan sampel acak, populasi Gaussian, varian yang sama, tanpa peretasan P, dll. Langkah 1. Anda menjalankan eksperimen yang mengatakan membandingkan dua mean sampel, dan menghitung interval kepercayaan 95% untuk perbedaan antara dua mean populasi. Langkah 2. Anda menjalankan lebih banyak eksperimen (ribuan). Perbedaan …

2
Arti elip percaya diri yang nyata
Membaca tentang arti sebenarnya dari elips kepercayaan 95%, saya cenderung menemukan 2 penjelasan: Elips yang berisi 95% data Bukan yang di atas, tetapi elips yang menjelaskan perbedaan data. Saya tidak yakin saya mengerti dengan benar tetapi mereka tampaknya berarti bahwa jika titik data baru masuk, ada kemungkinan 95% bahwa varian …

1
Bagaimana interval kepercayaan dihitung untuk fungsi ACF?
Misalnya, dalam R jika Anda memanggil acf()fungsinya, ia akan memplot sebuahogram korelasi secara default, dan menggambar interval kepercayaan 95%. Melihat kode, jika Anda menelepon plot(acf_object, ci.type="white"), Anda melihat: qnorm((1 + ci)/2)/sqrt(x$n.used) sebagai batas atas untuk jenis white-noise. Bisakah seseorang menjelaskan teori di balik metode ini? Mengapa kita mendapatkan qnorm 1 …


1
Seleksi variabel vs Seleksi model
Jadi saya mengerti bahwa pemilihan variabel adalah bagian dari pemilihan model. Tapi apa sebenarnya yang terdiri dari pemilihan model? Apakah lebih dari yang berikut: 1) pilih distribusi untuk model Anda 2) pilih variabel penjelas,? Saya bertanya ini karena saya membaca artikel Burnham & Anderson: AIC vs BIC di mana mereka …

4
Bagaimana cara (secara sistematis) menyesuaikan tingkat pembelajaran dengan Gradient Descent sebagai Pengoptimal?
Orang luar ke bidang ML / DL; memulai kursus Belajar Udacity Deep yang didasarkan pada Tensorflow; melakukan penugasan 3 masalah 4; mencoba menyesuaikan tingkat belajar dengan konfigurasi berikut: Ukuran batch 128 Jumlah langkah: cukup untuk mengisi 2 zaman Ukuran lapisan tersembunyi: 1024, 305, 75 Inisialisasi berat: terpotong normal dengan std. …

2
ICC sebagai korelasi yang diharapkan antara dua unit yang ditarik secara acak yang berada dalam kelompok yang sama
Dalam pemodelan bertingkat, korelasi intraclass sering dihitung dari efek acak ANOVA ysaya j= γ00+ uj+ esaya jyij=γ00+uj+eij y_{ij} = \gamma_{00} + u_j + e_{ij} di mana kamujuju_j adalah tingkat-2 residual dan esaya jeije_{ij} adalah residual level-1. Kemudian kita mendapatkan σ^2kamuσ^u2\hat{\sigma}_u^2 dan σ 2 e untuk varians dari u j dan …

1
Akankah ada Tribble yang tidak bahagia di Oz?
Inilah masalah lucu yang dibawa oleh seorang siswa kepada saya. Meskipun pada awalnya diutarakan dalam istilah peluru yang saling memusnahkan yang ditembakkan secara berkala dengan pistol, saya pikir Anda mungkin menikmati presentasi yang lebih damai. Di dunia Oz yang datar dan tak terbatas, Yellow Brick Road dimulai di pusat Kota …

4
mendeteksi jumlah puncak dalam rekaman audio
Saya mencoba mencari cara untuk mendeteksi jumlah suku kata dalam korpus rekaman audio. Saya pikir proxy yang baik mungkin adalah puncak dalam file wave. Inilah yang saya coba dengan file saya berbicara dalam bahasa Inggris (kasus penggunaan saya yang sebenarnya adalah dalam Kiswahili). Transkrip rekaman contoh ini adalah: "Ini saya …

3
Apakah asumsi kesalahan Normal menyiratkan bahwa Y juga Normal?
Kecuali saya salah, dalam model linier, distribusi respons diasumsikan memiliki komponen sistematis dan komponen acak. Istilah kesalahan menangkap komponen acak. Oleh karena itu, jika kita mengasumsikan bahwa istilah kesalahan terdistribusi secara normal, bukankah itu menyiratkan bahwa responsnya juga terdistribusi secara normal? Saya pikir memang demikian, tetapi pernyataan seperti di bawah …

1
Bagaimana menangani overdispersi dalam regresi Poisson: kuasi-kemungkinan, GLM binomial negatif, atau efek acak tingkat subjek?
Saya telah menemukan tiga proposal untuk menangani overdispersi dalam variabel respon Poisson dan semua model awal efek tetap: Gunakan model kuasi; Gunakan GLM binomial negatif; Gunakan model campuran dengan efek acak tingkat subjek. Tapi yang mana yang harus dipilih, dan mengapa? Apakah ada kriteria aktual di antara ini?


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.