Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Mengapa ecdf menggunakan fungsi langkah dan bukan interpolasi linier?
Fungsi CDF empiris biasanya diperkirakan dengan fungsi langkah. Apakah ada alasan mengapa ini dilakukan sedemikian rupa dan tidak dengan menggunakan interpolasi linier? Apakah fungsi langkah memiliki sifat teoretis yang menarik yang membuat kita lebih menyukainya? Berikut adalah contoh keduanya: ecdf2 <- function (x) { x <- sort(x) n <- length(x) …
13 r  distributions  ecdf 

1
Paket GBM vs. Caret menggunakan GBM
Saya telah menggunakan model tuning caret, tetapi kemudian menjalankan kembali model menggunakan gbmpaket. Ini adalah pemahaman saya bahwa caretpaket menggunakan gbmdan hasilnya harus sama. Namun, hanya menjalankan tes cepat menggunakan data(iris)menunjukkan perbedaan dalam model sekitar 5% menggunakan RMSE dan R ^ 2 sebagai metrik evaluasi. Saya ingin menemukan kinerja model …

2
Fungsi atau kernel kovarian - apa sebenarnya mereka?
Saya agak baru di bidang proses Gaussian dan bagaimana mereka diterapkan dalam pembelajaran mesin. Saya terus membaca dan mendengar tentang fungsi kovarian yang menjadi daya tarik utama dari metode ini. Jadi, adakah yang bisa menjelaskan secara intuitif apa yang terjadi dalam fungsi kovarian ini? Kalau tidak, jika Anda bisa menunjukkan …



1
Statistik yang Cukup Lengkap: Seragam (a, b)
Biarkan menjadi sampel acak dari distribusi seragam pada , di mana . Biarkan dan menjadi statistik pesanan terbesar dan terkecil. Tunjukkan bahwa statistik adalah statistik yang cukup lengkap untuk parameter . X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n)(a,b)(a,b)(a,b)a&lt;ba&lt;ba < bY1Y1Y_1YnYnY_n(Y1,Yn)(Y1,Yn)(Y_1, Y_n)θ=(a,b)θ=(a,b)\theta = (a, b) Tidak masalah bagi saya untuk menunjukkan kecukupan menggunakan …

2
Bagaimana cara menentukan Wilayah Penolakan ketika tidak ada UMP?
Pertimbangkan model regresi linier ,y = X β+ uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} ,u ∼N( 0 , σ2Saya )u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) .E( u ∣ X ) = 0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} Biarkan vs H 1 : σ 2 0 ≠ σ 2 .H0: σ20= σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1: σ20≠ σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 Kita dapat menyimpulkan bahwa , di manadim(X)=n×k. DanMXadalah notasi …

3
Regresi linier sederhana, nilai-p dan AIC
Saya menyadari bahwa topik ini telah muncul beberapa kali sebelumnya, misalnya di sini , tetapi saya masih tidak yakin bagaimana cara terbaik untuk menafsirkan hasil regresi saya. Saya memiliki dataset yang sangat sederhana, terdiri dari kolom nilai x dan kolom nilai y , dibagi menjadi dua kelompok sesuai dengan lokasi …


2
Menjelaskan Varian Model Regresi
Ini mungkin penjelasan sederhana (saya berharap sih). Saya telah melakukan beberapa analisis regresi di Matlab menggunakan kotak alat regresi. Namun, saya menemukan studi yang menyatakan ini: "Menggunakan analisis regresi, adalah mungkin untuk membuat model prediksi menggunakan hanya empat fitur sonik yang menjelaskan 60% dari varians" Tautan ke artikel ada di …
13 variance 


2
Apakah normalitas sendi merupakan syarat yang diperlukan agar jumlah variabel acak normal menjadi normal?
Dalam komentar yang mengikuti jawaban saya untuk pertanyaan terkait, Pengguna ssdecontrol dan Glen_b bertanya apakah normalitas gabungan dan diperlukan untuk menyatakan normalitas jumlah X + Y ? Normalitas sendi itu sudah cukup , tentu saja, sudah terkenal. Pertanyaan tambahan ini tidak dibahas di sana, dan mungkin layak dipertimbangkan sendiri.XXXYYYX+YX+YX+Y Karena …

1
Apa itu F1 Optimal Threshold? Bagaimana cara menghitungnya?
Saya telah menggunakan fungsi h2o.glm () di R yang memberikan tabel kontingensi dalam hasil bersama dengan statistik lainnya. Tabel kontingensi dipimpin " Palang Tab berdasarkan Ambang Batas Optimal F1 " Wikipedia mendefinisikan Skor F1 atau Skor F sebagai rata-rata harmonis dari presisi dan daya ingat. Tapi bukankah Precision dan Recall …
13 threshold 

2
Formula untuk interval kepercayaan 95% untuk
Saya mencari di Google dan mencari di stats.stackexchange tetapi saya tidak dapat menemukan rumus untuk menghitung interval kepercayaan 95% untuk nilai untuk regresi linier. Adakah yang bisa menyediakannya?R2R2R^2 Bahkan lebih baik, katakanlah saya telah menjalankan regresi linier di bawah ini dalam R. Bagaimana saya menghitung interval kepercayaan 95% untuk nilai …

3
Hasil teoritis di balik Jaringan Syaraf Tiruan
Saya baru saja membahas Jaringan Syaraf Tiruan pada kursus Machine Learning Coursera dan saya ingin tahu lebih banyak teori di baliknya. Saya menemukan motivasi bahwa mereka meniru biologi agak tidak memuaskan. Pada permukaan tampak bahwa pada setiap level kita mengganti kovariat dengan kombinasi linier mereka. Dengan melakukannya berulang kali, kami …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.