Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

5
Apakah biaya lintas-entropi masuk akal dalam konteks regresi?
Apakah biaya lintas-entropi masuk akal dalam konteks regresi (berlawanan dengan klasifikasi)? Jika demikian, dapatkah Anda memberikan contoh mainan melalui TensorFlow? Jika tidak, mengapa tidak? Saya membaca tentang cross-entropy di Neural Networks dan Deep Learning oleh Michael Nielsen dan sepertinya sesuatu yang secara alami dapat digunakan untuk regresi maupun klasifikasi, tetapi …


4
Mengapa pencocokan skor kecenderungan bekerja untuk inferensi kausal?
Pencocokan skor kecenderungan digunakan untuk membuat kesimpulan kausal dalam studi observasional (lihat makalah Rosenbaum / Rubin ). Apa intuisi sederhana di balik mengapa ia bekerja? Dengan kata lain, mengapa jika kita memastikan probabilitas untuk berpartisipasi dalam pengobatan adalah sama untuk kedua kelompok, efek perancu menghilang, dan kita dapat menggunakan hasilnya …

1
Cara memperbaiki non-konvergensi di LogisticRegressionCV
Saya menggunakan scikit-belajar untuk melakukan regresi logistik dengan crossvalidation pada set data (sekitar 14 parameter dengan> 7000 pengamatan normal). Saya juga memiliki target classifier yang memiliki nilai 1 atau 0. Masalah yang saya miliki adalah bahwa terlepas dari pemecah yang digunakan, saya terus mendapatkan peringatan konvergensi ... model1 = linear_model.LogisticRegressionCV(cv=10,verbose=1,n_jobs=-1,scoring='roc_auc',solver='newton-cg',penalty='l2') …

2
Bagaimana cara menghitung nilai yang diharapkan dari distribusi normal standar?
Saya ingin belajar bagaimana menghitung nilai yang diharapkan dari variabel acak kontinu. Tampaknya nilai yang diharapkan adalah di mana adalah fungsi kepadatan probabilitas .f ( x ) XE[X]=∫∞−∞xf(x)dxE[X]=∫−∞∞xf(x)dxE[X] = \int_{-\infty}^{\infty} xf(x)\mathrm{d}xf(x)f(x)f(x)XXX Misalkan fungsi kerapatan probabilitas adalah yang merupakan kepadatan dari distribusi normal standar.f ( x ) = 1XXXf(x)=12π−−√e−x22f(x)=12πe−x22f(x) = \frac{1}{\sqrt{2\pi}}e^{\frac{-x^{2}}{2}} …


4
Bagaimana saya harus memeriksa asumsi linearitas ke logit untuk variabel independen kontinu dalam analisis regresi logistik?
Saya bingung dengan asumsi linearitas terhadap logit untuk variabel prediktor kontinu dalam analisis regresi logistik. Apakah kita perlu memeriksa hubungan linier sambil menyaring prediktor potensial menggunakan analisis regresi logistik univariabel? Dalam kasus saya, saya menggunakan analisis regresi logistik ganda untuk mengidentifikasi faktor-faktor yang terkait dengan status gizi (hasil dikotomis) di …


1
Bagaimana cara propagasi balik bekerja di jaringan saraf siam?
Saya telah mempelajari arsitektur jaringan saraf siam yang diperkenalkan oleh Yann LeCun dan rekan-rekannya pada tahun 1994 untuk pengakuan tanda tangan ( “Verifikasi tanda tangan menggunakan waktu tunda jaringan saraf siamese” .pdf , NIPS 1994) Saya memahami ide umum arsitektur ini, tetapi saya benar-benar tidak dapat memahami cara kerja backpropagation …


2
Apa itu penyusutan?
Kata susut banyak dilemparkan ke lingkaran tertentu. Tapi apa susutnya, sepertinya tidak ada definisi yang jelas. Jika saya memiliki deret waktu (atau kumpulan pengamatan dari suatu proses), apa sajakah cara saya dapat mengukur beberapa jenis penyusutan empiris pada deret tersebut? Apa saja jenis susut teoretis yang dapat saya bicarakan? Bagaimana …

3
Ukuran sampel diperlukan untuk memperkirakan probabilitas "sukses" dalam uji coba Bernoulli
Misalkan sebuah game menawarkan acara yang setelah selesai, baik memberikan hadiah, atau tidak memberikan apa pun. Mekanisme yang tepat untuk menentukan apakah hadiah diberikan tidak diketahui, tetapi saya berasumsi generator nomor acak digunakan, dan jika hasilnya lebih besar dari nilai hard-coded, Anda mendapatkan hadiahnya. Jika pada dasarnya saya ingin merekayasa …

1
Koneksi antara (d-prime) dan AUC (Area Di Bawah Kurva ROC); asumsi yang mendasarinya
Dalam pembelajaran mesin, kita dapat menggunakan area di bawah kurva ROC (sering disingkat AUC , atau AUROC) untuk merangkum seberapa baik suatu sistem dapat membedakan antara dua kategori. Dalam teori pendeteksian sinyal seringkali (indeks sensitivitas) digunakan untuk tujuan yang sama. Keduanya terhubung erat, dan saya percaya mereka setara satu sama …

2
Intuisi sejenak tentang rata-rata distribusi?
Dapatkah seseorang memberikan intuisi tentang mengapa momen yang lebih tinggi dari distribusi probabilitas pXpXp_X , seperti momen ketiga dan keempat, masing-masing berhubungan dengan kemiringan dan kurtosis? Secara khusus, mengapa penyimpangan tentang rata-rata dinaikkan ke kekuatan ketiga atau keempat akhirnya diterjemahkan menjadi ukuran skewness dan kurtosis? Apakah ada cara untuk menghubungkan …

6
Bagaimana mengkarakterisasi perubahan mendadak?
Pertanyaan ini mungkin terlalu mendasar. Untuk tren sementara dari suatu data, saya ingin mengetahui titik di mana perubahan "mendadak" terjadi. Sebagai contoh, pada gambar pertama yang ditunjukkan di bawah ini, saya ingin mengetahui titik perubahan menggunakan beberapa metode statistik. Dan saya ingin menerapkan metode seperti itu di beberapa data lain …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.