Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Bagaimana cara menilai kemiringan dari kotak petak?
Cara memutuskan kemiringan dengan melihat plot kotak yang dibangun dari data ini: 340, 300, 520, 340, 320, 290, 260, 330 Satu buku mengatakan, "Jika kuartil bawah lebih jauh dari median daripada kuartil atas, maka distribusinya cenderung negatif." Beberapa sumber lain mengatakan kurang lebih sama. Saya membuat boxplot menggunakan R. Ini …

4
GEE: memilih struktur korelasi kerja yang tepat
Saya adalah seorang ahli epidemiologi yang mencoba memahami GEE untuk menganalisis studi kohort dengan benar (menggunakan regresi Poisson dengan tautan log, untuk memperkirakan Risiko Relatif). Saya punya beberapa pertanyaan tentang "korelasi kerja" yang saya ingin seseorang lebih berpengetahuan untuk menjelaskan: (1) Jika saya memiliki pengukuran berulang pada individu yang sama, …
19 gee 

1
Hitung dan buat grafik batas keputusan LDA
Saya melihat plot LDA (analisis diskriminan linier) dengan batas keputusan dari The Elements of Statistics Learning : Saya mengerti bahwa data diproyeksikan ke ruang bagian dimensi yang lebih rendah. Namun, saya ingin tahu bagaimana kita mendapatkan batas keputusan dalam dimensi asli sehingga saya dapat memproyeksikan batas keputusan ke ruang bagian …

1
Ketika Jacobian analitik tersedia, apakah lebih baik untuk memperkirakan Hessian dengan , atau dengan perbedaan terbatas dari Jacobian?
Katakanlah saya menghitung beberapa parameter model, meminimalkan jumlah kuadrat residu, dan saya berasumsi kesalahan saya adalah Gaussian. Model saya menghasilkan turunan analitik, sehingga pengoptimal tidak perlu menggunakan perbedaan hingga. Setelah fit selesai, saya ingin menghitung kesalahan standar dari parameter yang dipasang. Secara umum, dalam situasi ini, Hessian dari fungsi kesalahan …

1
Karet dan koefisien (glmnet)
Saya tertarik memanfaatkan caret untuk membuat kesimpulan pada set data tertentu. Apakah mungkin untuk melakukan hal berikut: menghasilkan koefisien model glmnet yang saya latih dalam caret. Saya ingin menggunakan glmnet karena pemilihan fitur bawaan karena saya tidak percaya glm memilikinya? selain metrik ROC, apakah ada metrik lain yang dapat saya …
19 caret  glmnet 


2
Bootstrapping - apakah saya harus menghapus outlier terlebih dahulu?
Kami telah menjalankan uji coba fitur produk baru dan ingin mengukur apakah peningkatan pada pendapatan signifikan. Pengamatan kami jelas tidak terdistribusi normal (sebagian besar pengguna kami tidak membelanjakan, dan di antara mereka yang melakukannya, sangat condong ke banyak pembelanja kecil dan beberapa pembelanja sangat besar). Kami telah memutuskan untuk menggunakan …

2
Hutan acak terlalu cocok?
Saya bereksperimen dengan hutan acak dengan scikit-belajar dan saya mendapatkan hasil yang bagus dari set pelatihan saya, tetapi hasil yang relatif buruk pada set tes saya ... Inilah masalah (terinspirasi dari poker) yang saya coba selesaikan: Kartu hole pemain A, kartu hole pemain B dan flop (3 kartu), pemain mana …


4
Apakah analisis kekuatan diperlukan dalam Statistik Bayesian?
Saya telah meneliti Bayesian mengambil statistik klasik belakangan ini. Setelah membaca tentang faktor Bayes saya bertanya-tanya apakah analisis daya merupakan keharusan dalam pandangan statistik ini. Alasan utama saya untuk bertanya-tanya ini adalah faktor Bayes yang tampaknya hanya rasio kemungkinan. Setelah itu seperti 25: 1 sepertinya saya bisa menyebutnya malam. Apakah …

1
Mendapatkan nilai-p untuk "multinom" di R (paket nnet)
Bagaimana cara saya mendapatkan nilai-p menggunakan multinomfungsi nnetpaket R? Saya memiliki dataset yang terdiri dari "Skor patologi" (Absen, Ringan, Parah) sebagai variabel hasil, dan dua efek utama: Usia (dua faktor: dua puluh / tiga hari) dan Kelompok Perawatan (empat faktor: terinfeksi tanpa ATB; terinfeksi + ATB1; terinfeksi + ATB2; terinfeksi …

3
Hubungan antara regresi ridge dan regresi PCA
Saya ingat pernah membaca di suatu tempat di web hubungan antara regresi ridge (dengan regularisasi) dan regresi PCA: saat menggunakan -regregulated regulated dengan hyperparameter , jika , maka regresi tersebut setara dengan menghapus Variabel PC dengan nilai eigen terkecil.ℓ 2 λ λ → 0ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2λλ\lambdaλ → 0λ→0\lambda \to 0 Mengapa ini …

4
Masalah dengan bukti harapan Bersyarat sebagai prediktor terbaik
Saya punya masalah dengan bukti E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] yang sangat mungkin mengungkapkan kesalahpahaman yang lebih dalam dari harapan dan harapan bersyarat. Buktinya saya tahu sebagai berikut (versi lain dari bukti ini dapat ditemukan di sini ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} E\Big[\big(Y - g(x)\big)^2\Big]\\ = &\arg \min_{g(X)} E …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.