Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
regresi untuk data sudut / bundar
Saya telah mengawasi masalah pembelajaran di mana targetnya bersudut. Jika saya akan melakukan regresi sederhana maka angka 360 dan 1 akan jauh untuk model saya, tetapi sebenarnya mereka dekat dan memprediksi koordinat x dan y rasanya tidak benar, karena saya mencoba memprediksi hanya satu angka di sini. Apa cara yang …

1
Pesanan lag untuk uji kausalitas Granger
Misalkan saya sedang mempertimbangkan beberapa variabel independen untuk kemungkinan inklusi dalam model ARIMAX yang saya kembangkan. Sebelum memasang variabel yang berbeda, saya ingin menyaring variabel yang menunjukkan kausalitas terbalik dengan menggunakan tes Granger (saya menggunakan granger.testfungsi dari MSBVARpaket dalam R, meskipun, saya percaya penindasan lain bekerja dengan cara yang sama). …

2
Deteksi outlier menggunakan regresi
Dapatkah regresi digunakan untuk deteksi lier. Saya mengerti bahwa ada cara untuk meningkatkan model regresi dengan menghapus outlier. Tetapi tujuan utama di sini bukan untuk mencocokkan model regresi tetapi mencari tahu liers menggunakan regresi

1
Pros dari jarak Jeffries Matusita
Menurut beberapa makalah yang saya baca, jarak Jeffries dan Matusita biasa digunakan. Tetapi saya tidak dapat menemukan banyak informasi tentang itu kecuali rumus di bawah ini JMD (x, y) =∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Ini mirip dengan jarak Euclidean kecuali untuk akar kuadrat E (x, y) =∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} Jarak JM diklaim lebih dapat diandalkan daripada …

2
Fungsi Kerugian Persentil
Solusi untuk masalah ini: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] dikenal sebagai median XXX , tetapi seperti apa fungsi kerugian untuk persentil lainnya? Contoh: persentil X ke-25 adalah solusi untuk: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Apa LLL dalam kasus ini?

5
Algoritma Metropolis Hastings
Saya perlu mempelajari metode Markov Chain Monte Carlo, untuk lebih spesifik saya perlu mempelajari algoritma Metropolis Hastings dan semua tentang itu seperti kriteria konvergensi. Siapa yang dapat meresepkan saya buku, atau kertas, atau situs web, yang menjelaskan argumen ini menggunakan istilah sederhana, tetapi tanpa sepele?
11 references  mcmc 

3
Bagaimana cara melatih regresi (logistik?) Di R menggunakan fungsi kerugian L1?
Saya bisa melatih regresi logistik dalam Rmenggunakan glm(y ~ x, family=binomial(logit))) tapi, IIUC, ini mengoptimalkan kemungkinan log. Apakah ada cara untuk melatih model menggunakan fungsi kehilangan linier ( L1L1L_1 ) (yang dalam hal ini sama dengan jarak variasi total )? Yaitu, diberi vektor numerik xxx dan vektor sedikit (logis) yyy …
11 logistic 

5
Intuisi tentang definisi kovarians
Saya mencoba memahami Kovarian dua variabel acak dengan lebih baik dan memahami bagaimana orang pertama yang memikirkannya, sampai pada definisi yang secara rutin digunakan dalam statistik. Saya pergi ke wikipedia untuk memahaminya dengan lebih baik. Dari artikel tersebut, tampaknya ukuran atau kuantitas kandidat yang baik untuk harus memiliki properti berikut:Co …

2
Regresi Logistik: Menafsirkan Variabel Kontinu
Saya punya beberapa pertanyaan tentang menafsirkan rasio odds untuk variabel kontinu dalam regresi logistik. Saya merasa seperti ini adalah pertanyaan dasar tentang regresi logistik (dan mungkin tentang regresi secara umum), dan meskipun saya sedikit malu bahwa saya tidak tahu jawabannya, saya akan menelan harga diri saya dan bertanya sehingga saya …


1
Bagaimana kita memprediksi kejadian langka?
Saya sedang mengembangkan model prediksi risiko asuransi. Model-model ini adalah "peristiwa langka" seperti prediksi maskapai tanpa pertunjukan, deteksi kesalahan perangkat keras, dll. Ketika saya menyiapkan kumpulan data saya, saya mencoba menerapkan klasifikasi, tetapi saya tidak dapat memperoleh pengklasifikasi yang berguna karena tingginya proporsi kasus negatif . Saya tidak punya banyak …


4
Pengantar statistik non-parametrik
Saya telah mempelajari statistik selama dua tahun terakhir. Hampir semua yang saya pelajari adalah tentang statistik parametrik. Sekarang saya ingin mempelajari lebih lanjut tentang statistik non-parametrik. Adakah yang bisa menyarankan beberapa pengantar singkat (mungkin dapat dibaca juga) ke daerah ini?

3
Algoritma apa yang harus saya gunakan untuk mengelompokkan dataset biner besar ke dalam beberapa kategori?
Saya memiliki matriks besar (650K baris * 62 kolom) data biner (hanya 0-1 entri). Matriksnya sebagian besar jarang: sekitar 8% diisi. Saya ingin mengelompokkannya menjadi 5 grup - misalnya dinamai dari 1 hingga 5. Saya telah mencoba pengelompokan hierarkis dan tidak dapat menangani ukurannya. Saya juga telah menggunakan algoritma clustering …

2
Metode umum untuk menurunkan kesalahan standar
Sepertinya saya tidak dapat menemukan metode umum untuk memperoleh kesalahan standar di mana saja. Saya telah mencari di google, situs web ini dan bahkan di buku teks tetapi yang bisa saya temukan adalah rumus untuk kesalahan standar untuk rata-rata, varians, proporsi, rasio risiko, dll ... dan bukan bagaimana rumus-rumus ini …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.