Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Memahami uji Kolmogorov-Smirnov dalam R
Saya mencoba untuk memahami output dari fungsi tes Kolmogorov-Smirnov (dua sampel, dua sisi). Ini tes sederhana. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) …

2
Klasifikasi dengan Peningkatan Gradien: Cara mempertahankan prediksi dalam [0,1]
Pertanyaan Saya berjuang untuk memahami bagaimana prediksi disimpan dalam interval ketika melakukan klasifikasi biner dengan Gradient Boosting.[0,1][0,1][0,1] Asumsikan kita sedang mengerjakan masalah klasifikasi biner, dan fungsi tujuan kita adalah hilangnya log, , di mana adalah variabel target dan adalah model kami saat ini.y ∈ { 0 , 1 } H−∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog⁡(Hm(xsaya))+(1-ysaya)catatan⁡(1-Hm(xsaya))-\sum …


1
Cara menemukan / memperkirakan fungsi kerapatan peluang dari fungsi kerapatan dalam R
Misalkan saya punya variabel suka Xdengan distribusi tidak dikenal. Dalam Mathematica, dengan menggunakan SmoothKernelDensityfungsi kita dapat memiliki fungsi kerapatan yang diperkirakan. Perkiraan fungsi kerapatan ini dapat digunakan bersama dengan PDFfungsi untuk menghitung probabilitas fungsi kerapatan dari suatu nilai seperti Xdalam bentuk PDF[density,X]asumsi bahwa "kerapatan" adalah hasil dari SmoothKernelDensity. Akan lebih …
17 r  pdf  cdf 


2
Tinjauan literatur tentang regresi non-linear
Adakah yang tahu artikel ulasan yang bagus untuk literatur statistik tentang regresi non-linear? Saya terutama tertarik pada hasil konsistensi dan asimptotik. Yang menarik adalah model yi t= m ( xi t, θ ) + ϵi t,ysayat=m(xsayat,θ)+ϵsayat,y_{it} = m(x_{it},\theta) + \epsilon_{it}, untuk data panel. Yang kurang menarik adalah metode non-parametrik. Saran …



4
Menafsirkan kesamaan cosinus negatif
Pertanyaan saya mungkin konyol. Jadi saya akan minta maaf sebelumnya. Saya mencoba menggunakan model GLOVE yang sudah dilatih oleh Stanford NLP group ( tautan ). Namun, saya perhatikan bahwa hasil kesamaan saya menunjukkan beberapa angka negatif. Itu segera mendorong saya untuk melihat file data kata-vektor. Rupanya, nilai-nilai dalam kata vektor …

4
Apakah mungkin untuk memberikan gambar berukuran variabel sebagai input ke jaringan saraf convolutional?
Bisakah kita memberikan gambar dengan ukuran variabel sebagai input ke jaringan saraf convolutional untuk deteksi objek? Jika memungkinkan, bagaimana kita bisa melakukan itu? Tetapi jika kita mencoba memotong gambar, kita akan kehilangan sebagian dari gambar dan jika kita mencoba untuk mengubah ukuran, maka, kejelasan gambar akan hilang. Apakah ini berarti …

4
Jika saya menginginkan model yang dapat ditafsirkan, apakah ada metode selain Regresi Linier?
Saya bertemu dengan beberapa ahli statistik yang tidak pernah menggunakan model selain Regresi Linier untuk prediksi karena mereka percaya bahwa "model ML" seperti meningkatkan acak hutan atau gradien sulit untuk dijelaskan atau "tidak dapat ditafsirkan". Dalam Regresi Linier, mengingat bahwa kumpulan asumsi diverifikasi (normalitas kesalahan, homoskedastisitas, tidak ada multi-collinearity), uji-t …

4
Mengapa independensi menyiratkan nol korelasi?
Pertama-tama, saya tidak menanyakan ini: Mengapa nol korelasi tidak menyiratkan independensi? Ini ditujukan (agak baik) di sini: /math/444408/why-does-zero-correlation-not-imply-independence Yang saya tanyakan adalah kebalikannya ... katakanlah dua variabel sepenuhnya independen satu sama lain. Tidak bisakah mereka memiliki sedikit korelasi secara kebetulan? Bukankah seharusnya ... independensi menyiratkan korelasi SANGAT KECIL?



4
Tentang George Box, Galit Shmueli dan metode ilmiahnya?
(Pertanyaan ini mungkin sepertinya lebih cocok untuk Philosophy SE. Saya berharap bahwa ahli statistik dapat mengklarifikasi kesalahpahaman saya tentang pernyataan Box dan Shmueli, maka saya mempostingnya di sini). George Box (dari ARIMA fame) berkata: "Semua model salah, tetapi beberapa berguna." Galit Shmueli dalam makalahnya yang terkenal "To Explain or Predict" …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.