Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Menggabungkan beberapa metrik untuk memberikan perbandingan / peringkat objek k [Permintaan Pertanyaan dan Referensi]
Mengumpulkan metrik tentang objeknnnkkk Misalkan saya mengumpulkan metrik tentang objek . Saya mencari cara yang valid untuk membandingkan objek sehingga mereka dapat "diperingkat". Saya pikir ini mungkin tanah yang terinjak dengan baik (statistik olahraga seperti total quarterback rating dll) tetapi saya tidak terbiasa dengan bidang ini.nnnkkkkkk Saya ingin menjawab pertanyaan …

1
Drop outlier berdasarkan “2,5 kali RMSE”
Dalam Kahneman dan Deaton (2010) , penulis menulis yang berikut:††^\dagger Regresi ini menjelaskan 37% dari varians, dengan root mean square error (RMSE) dari 0,67852. Untuk menghilangkan pencilan dan laporan pendapatan yang tidak masuk akal, kami menjatuhkan pengamatan di mana nilai absolut dari perbedaan antara pendapatan kayu dan prediksi melebihi 2,5 …

3
Apakah ada makalah yang sangat dikutip tentang statistik yang sebenarnya menyebarkan praktik statistik yang buruk?
Jelas ada banyak cara untuk menyalahgunakan metode statistik. Apakah Anda mengetahui contoh praktik statistik buruk yang pertama kali dipublikasikan sebagai saran eksplisit (misalnya, "Anda harus menggunakan metode ini untuk ..."), dalam jurnal akademis terkemuka yang kemudian dikutip berulang kali? Contohnya mungkin 10 peristiwa per aturan prediktor yang sering digunakan untuk …

1
Apakah regresi logistik memaksimalkan kemungkinan juga juga memaksimalkan AUC dari model linier?
Diberikan set data dengan hasil biner y∈{0,1}ny∈{0,1}ny\in\{0,1\}^n dan beberapa matriks prediktor X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} , model regresi logistik standar memperkirakan koefisien βMLEβMLE\beta_{MLE} yang memaksimalkan kemungkinan binomial. Ketika XXX adalah peringkat penuh βMLEβMLE\beta_{MLE} adalah unik; ketika pemisahan sempurna tidak ada, itu terbatas. Apakah model kemungkinan maksimum ini juga memaksimalkan ROC AUC (alias …


2
Apakah ambang keputusan hiperparameter dalam regresi logistik?
Kelas yang diprediksi dari regresi logistik (biner) ditentukan dengan menggunakan ambang pada probabilitas keanggotaan kelas yang dihasilkan oleh model. Seperti yang saya pahami, biasanya 0,5 digunakan secara default. Tetapi memvariasikan ambang akan mengubah klasifikasi yang diprediksi. Apakah ini berarti ambangnya adalah hiperparameter? Jika demikian, mengapa (misalnya) tidak mungkin untuk dengan …

5
Pertanyaan filosofis tentang regresi logistik: mengapa nilai ambang batas yang optimal tidak dilatih?
Biasanya dalam regresi logistik, kami cocok dengan model dan mendapatkan beberapa prediksi pada set pelatihan. Kami kemudian melakukan validasi silang pada prediksi pelatihan tersebut (seperti di sini ) dan memutuskan nilai ambang batas optimal berdasarkan pada sesuatu seperti kurva ROC. Mengapa kita tidak memasukkan validasi silang dari ambang ke dalam …

1
Mengapa MLE masuk akal, mengingat probabilitas sampel individu adalah 0?
Ini semacam pemikiran aneh yang saya miliki ketika meninjau beberapa statistik lama dan untuk beberapa alasan saya sepertinya tidak bisa memikirkan jawabannya. PDF kontinu memberi tahu kita kepadatan nilai pengamatan dalam rentang tertentu. Yaitu, jika X∼N(μ,σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2) , misalnya, maka probabilitas bahwa realisasi jatuh antara aaa dan bbb hanyalah …

4
Apa gunanya regresi univariat sebelum regresi multivariat?
Saat ini saya sedang mengerjakan masalah di mana kami memiliki dataset kecil dan tertarik pada efek kausalitas dari perawatan pada hasilnya. Penasihat saya telah menginstruksikan saya untuk melakukan regresi univariat pada setiap prediktor dengan hasilnya sebagai respons, kemudian tugas pengobatan sebagai respons. Yaitu, saya diminta untuk menyesuaikan regresi dengan satu …

8
Bagaimana memperlakukan respons survei yang tidak logis
Saya telah mengirimkan survei ke sampel artis. Salah satu pertanyaannya adalah untuk menunjukkan persentase pendapatan yang diperoleh dari: aktivitas artistik, dukungan pemerintah, pensiun swasta, aktivitas yang tidak terkait dengan seni. Sekitar 65% dari individu telah menjawab sedemikian sehingga jumlah persentasenya adalah 100. Yang lain tidak: misalnya, ada yang menjawab bahwa …
13 survey  bias 


3
Apakah skor tes benar-benar mengikuti distribusi normal?
Saya sudah mencoba mempelajari distribusi mana yang akan digunakan dalam GLM, dan saya agak bingung kapan harus menggunakan distribusi normal. Di salah satu bagian dari buku teks saya, dikatakan bahwa distribusi normal bisa baik untuk pemodelan nilai ujian. Pada bagian selanjutnya, ia menanyakan distribusi apa yang sesuai untuk memodelkan klaim …


2
Mengapa pemilihan subset terbaik tidak disukai dibandingkan dengan laso?
Saya membaca tentang pemilihan subset terbaik dalam Elemen buku pembelajaran statistik. Jika saya memiliki 3 prediktor , saya membuat 2 3 = 8x1,x2,x3x1,x2,x3x_1,x_2,x_323=823=82^3=8 himpunan bagian: Subset tanpa prediktor himpunan bagian dengan prediktor x1x1x_1 himpunan bagian dengan prediktor x2x2x_2 bagian dengan prediktor x3x3x_3 himpunan bagian dengan prediktor x1,x2x1,x2x_1,x_2 himpunan bagian dengan …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.