Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Gambaran komprehensif fungsi kerugian?
Saya mencoba untuk mendapatkan perspektif global tentang beberapa ide penting dalam pembelajaran mesin, dan saya bertanya-tanya apakah ada perawatan komprehensif dari berbagai konsep kerugian (kuadrat, log, engsel, proksi, dll.). Saya sedang memikirkan sesuatu yang sejalan dengan presentasi formal yang lebih komprehensif dan komprehensif dari John Langford tentang Kehilangan Fungsi Semantik …

5
Membandingkan varian pengamatan berpasangan
Saya memiliki pengamatan berpasangan ( , ) diambil dari distribusi yang tidak diketahui umum, yang memiliki momen pertama dan kedua terbatas, dan simetris di sekitar mean.NNNXiXiX_iYiYiY_i Biarkan deviasi standar (tanpa syarat pada ), dan sama untuk Y. Saya ingin menguji hipotesis σXσX\sigma_XXXXYYYσYσY\sigma_Y H0H0H_0 :σX=σYσX=σY\sigma_X = \sigma_Y H1H1H_1 :σX≠σYσX≠σY\sigma_X \neq \sigma_Y …


5
Interpretasi hasil yang tidak signifikan sebagai "tren"
Baru-baru ini, dua rekan kerja yang berbeda telah menggunakan semacam argumen tentang perbedaan antara kondisi yang tampaknya salah bagi saya. Kedua rekan kerja ini menggunakan statistik, tetapi mereka bukan ahli statistik. Saya seorang pemula dalam statistik. Dalam kedua kasus, saya berpendapat bahwa, karena tidak ada perbedaan yang signifikan antara dua …

1
Stan
Saya sedang membaca dokumentasi Stan yang dapat diunduh dari sini . Saya sangat tertarik dengan implementasi diagnostik Gelman-Rubin. Makalah asli Gelman & Rubin (1992) mendefinisikan faktor skala pengurangan potensial (PSRF) sebagai berikut: Biarkan menjadi rantai Markov ke- i sampel, dan biarkan ada rantai M independen keseluruhan sampel. Biarkan ˉ X …

1
Regresi dimensi tinggi: mengapa
Saya mencoba membaca tentang penelitian di bidang regresi dimensi tinggi; ketika ppp lebih besar dari nnn , yaitu, p>>np>>np >> n . Sepertinya istilah logp/nlog⁡p/n\log p/n sering muncul dalam hal tingkat konvergensi untuk estimator regresi. Sebagai contoh, di sini , persamaan (17) mengatakan bahwa fit β^β^\hat{\beta} memenuhi 1n∥Xβ^−Xβ∥22=OP(σlogpn−−−−−√∥β∥1).1n‖Xβ^−Xβ‖22=OP(σlog⁡pn‖β‖1). \dfrac{1}{n}\|X\hat{\beta} - …

3
Multi-layer perceptron vs jaringan saraf dalam
Ini adalah pertanyaan tentang terminologi. Kadang-kadang saya melihat orang menyebut jaringan saraf yang dalam sebagai "perceptrons berlapis-lapis", mengapa demikian? Saya diajari perceptron, adalah pengklasifikasi lapisan tunggal (atau regresi) dengan keluaran ambang biner menggunakan cara spesifik untuk melatih bobot (bukan back-prop). Jika output perceptron tidak sesuai dengan target output, kami menambah …

1
Memilih antara prior beta yang tidak informatif
Saya mencari prior yang tidak informatif untuk distribusi beta agar dapat bekerja dengan proses binomial (Hit / Miss). Pada awalnya saya berpikir tentang menggunakan α=1,β=1α=1,β=1\alpha=1, \beta=1 yang menghasilkan PDF yang seragam, atau Jeffrey sebelumnya α=0.5,β=0.5α=0.5,β=0.5\alpha=0.5, \beta=0.5 . Tapi saya sebenarnya mencari prior yang memiliki efek minimum pada hasil posterior, dan …

2
Mengapa distribusi T digunakan untuk pengujian hipotesis koefisien regresi linier?
Dalam praktiknya, menggunakan uji-T standar untuk memeriksa signifikansi koefisien regresi linier adalah praktik umum. Mekanisme perhitungannya masuk akal bagi saya. Mengapa distribusi-T dapat digunakan untuk memodelkan statistik uji standar yang digunakan dalam pengujian hipotesis regresi linier? Statistik uji standar yang saya maksud di sini: T0=βˆ−β0SE(βˆ)T0=β^−β0SE(β^) T_{0} = \frac{\widehat{\beta} - \beta_{0}}{SE(\widehat{\beta})}


3
Apa hubungan antara distribusi Beta dan model regresi logistik?
Pertanyaan saya adalah: Apa hubungan matematis antara distribusi Beta dan koefisien model regresi logistik ? Sebagai ilustrasi: fungsi logistik (sigmoid) diberikan oleh f(x)=11+exp(−x)f(x)=11+exp⁡(−x)f(x) = \frac{1}{1+\exp(-x)} dan digunakan untuk memodelkan probabilitas dalam model regresi logistik. Biarkan AAA menjadi dikotomis (0,1)(0,1)(0,1) mencetak hasil dan XXX sebuah matriks desain. Model regresi logistik diberikan …


5
Ukuran "varians" dari matriks kovarians?
Jika data 1d, varians menunjukkan sejauh mana titik data berbeda satu sama lain. Jika datanya multidimensi, kita akan mendapatkan matriks kovarians. Apakah ada ukuran yang memberikan satu angka bagaimana titik data berbeda satu sama lain secara umum untuk data multi-dimensi? Saya merasa bahwa mungkin sudah ada banyak solusi, tetapi saya …

2
Akurasi vs area di bawah kurva ROC
Saya membuat kurva ROC untuk sistem diagnostik. Area di bawah kurva kemudian non-parametrik diperkirakan menjadi AUC = 0,89. Ketika saya mencoba menghitung akurasi pada pengaturan ambang optimal (titik terdekat dengan titik (0, 1)), saya mendapatkan akurasi sistem diagnostik menjadi 0,8, yang kurang dari AUC! Ketika saya memeriksa akurasi pada pengaturan …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.