Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



2
Menghitung interval kepercayaan untuk regresi logistik
Saya menggunakan regresi logistik binomial untuk mengidentifikasi apakah paparan has_xatau has_ydampak kemungkinan bahwa pengguna akan mengklik sesuatu. Model saya adalah sebagai berikut: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) Ini output dari model saya: Call: glm(formula = has_clicked ~ has_x + has_y, family = …

4
Penerimaan hipotesis nol
Ini adalah pertanyaan diskusi tentang persimpangan statistik dan ilmu pengetahuan lainnya. Saya sering menghadapi masalah yang sama: para peneliti di bidang saya cenderung mengatakan bahwa tidak ada efek ketika nilai-p tidak kurang dari tingkat signifikansi. Pada awalnya, saya sering menjawab ini bukan cara kerja pengujian hipotesis. Mengingat seberapa sering pertanyaan …

2
Apa itu Bayes Error dalam pembelajaran mesin?
http://www.deeplearningbook.org/contents/ml.html menjelaskan kesalahan bayes seperti di bawah ini Model yang ideal adalah oracle yang hanya tahu distribusi probabilitas sebenarnya yang menghasilkan data. Bahkan model seperti itu masih akan menimbulkan beberapa kesalahan pada banyak masalah, karena mungkin masih ada kebisingan dalam distribusi. Dalam kasus pembelajaran yang diawasi, pemetaan dari x ke …

3
Metode untuk mengatasi masalah data yang hilang dalam pembelajaran mesin
Hampir semua basis data yang ingin kita prediksi menggunakan algoritma pembelajaran mesin akan menemukan nilai yang hilang untuk beberapa karakteristik. Ada beberapa pendekatan untuk mengatasi masalah ini, untuk mengecualikan garis yang memiliki nilai yang hilang sampai mereka mengisi dengan nilai rata-rata dari karakteristik. Saya ingin menggunakan pendekatan yang agak lebih …

1
Bagaimana menafsirkan entropi diferensial?
Saya baru-baru ini membaca artikel ini pada entropi distribusi probabilitas diskrit. Ini menjelaskan cara berpikir yang baik tentang entropi sebagai bit angka yang diharapkan (setidaknya ketika menggunakan log2log2\log_2 dalam definisi entropi Anda) yang diperlukan untuk menyandikan pesan ketika penyandian Anda optimal, mengingat kemungkinan distribusi kata-kata yang Anda gunakan. Namun, ketika …

2
Apa itu "baseline" dalam kurva recall presisi
Saya mencoba memahami kurva recall presisi, saya mengerti apa itu precision dan recall tapi yang saya tidak mengerti adalah nilai "baseline". Saya sedang membaca tautan ini https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ dan saya tidak mengerti bagian dasar seperti yang ditunjukkan dalam "Kurva Precision-Recall dari pengklasifikasi sempurna" apa fungsinya? dan bagaimana kita menghitungnya? Apakah ini …

3
Bagaimana cara memperkirakan probabilitas kelas `predict.randomForest`?
Bagaimana randomForestpaket memperkirakan probabilitas kelas saat saya menggunakan predict(model, data, type = "prob")? Saya menggunakan rangeruntuk melatih hutan acak menggunakan probability = Targumen untuk memprediksi probabilitas. rangermengatakan dalam dokumentasi bahwa: Menumbuhkan hutan probabilitas seperti di Malley et al. (2012). Saya mensimulasikan beberapa data dan mencoba kedua paket dan memperoleh hasil …

1
Metode perbandingan multipel mana yang digunakan untuk model lmer: lsmeans atau glht?
Saya menganalisis set data menggunakan model efek campuran dengan satu efek tetap (kondisi) dan dua efek acak (peserta karena desain subjek dan pasangan dalam). Model ini dihasilkan dengan lme4paket: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Selanjutnya, saya melakukan uji rasio kemungkinan model ini terhadap model tanpa efek tetap (kondisi) dan memiliki perbedaan yang signifikan. Ada …

3
Utilitas teorema Frisch-Waugh
Saya seharusnya mengajar teorema Frish Waugh di bidang ekonometrika, yang belum saya pelajari. Saya telah memahami matematika di baliknya dan saya harap idenya juga "koefisien yang Anda dapatkan untuk koefisien tertentu dari model linier berganda sama dengan koefisien model regresi sederhana jika Anda" menghilangkan "pengaruh regressor lain". Jadi ide teoretis …

5
Apakah lebih baik melakukan analisis data eksplorasi hanya pada set data pelatihan?
Saya sedang melakukan analisis data eksplorasi (EDA) pada dataset. Kemudian saya akan memilih beberapa fitur untuk memprediksi variabel dependen. Pertanyaannya adalah: Apakah saya harus melakukan EDA hanya pada dataset pelatihan saya? Atau haruskah saya bergabung dengan pelatihan dan menguji kumpulan data kemudian melakukan EDA pada keduanya dan memilih fitur berdasarkan …

1
Masalah parameter insidental
Saya selalu berjuang untuk mendapatkan esensi sejati dari masalah parameter insidental. Saya membaca dalam beberapa kesempatan bahwa penduga efek tetap dari model data panel nonlinier dapat sangat bias karena masalah parameter insidental "terkenal". Ketika saya meminta penjelasan yang jelas tentang masalah ini, jawabannya adalah: Asumsikan bahwa data panel memiliki N …

2
Rata-rata ROC untuk validasi silang 10 kali lipat dengan estimasi probabilitas
Saya berencana untuk menggunakan validasi silang 10 kali lipat bertingkat yang diulang (sekitar 10 kali) pada sekitar 10.000 kasus menggunakan algoritma pembelajaran mesin. Setiap kali repetisi akan dilakukan dengan seed acak berbeda. Dalam proses ini saya membuat 10 contoh estimasi probabilitas untuk setiap kasus. 1 instance estimasi probabilitas untuk masing-masing …
15 roc 

2
Bagaimana bobot diperbarui dalam metode pembelajaran batch dalam jaringan saraf?
Bisakah seseorang tolong beri tahu saya bagaimana saya seharusnya membangun jaringan saraf menggunakan metode batch? Saya telah membaca bahwa, dalam mode batch, untuk semua sampel dalam set pelatihan, kami menghitung kesalahan, delta dan dengan demikian bobot delta untuk setiap neuron dalam jaringan dan kemudian alih-alih segera memperbarui bobot, kami mengakumulasikannya, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.