Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Ringkasan kecocokan GAM
Jika kami cocok dengan GAM seperti: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Di mana, kami menggunakan dataset College, yang dapat ditemukan di dalam …
12 anova  gam 

5
Apakah regresi linier sudah usang? [Tutup]
Ditutup . Pertanyaan ini didasarkan pada pendapat . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga dapat dijawab dengan fakta dan kutipan dengan mengedit posting ini . Ditutup 2 tahun yang lalu . Saat ini saya berada dalam kelas regresi linier, tetapi saya tidak dapat menghilangkan …

2
Memahami Regresi Logistik dan kemungkinannya
Bagaimana cara estimasi parameter / Pelatihan regresi logistik bekerja? Saya akan mencoba untuk menempatkan apa yang saya dapatkan sejauh ini. Outputnya adalah y dari fungsi logistik yang berbentuk probabilitas tergantung pada nilai x: P( y= 1 | x ) = 11 + e- ωTx≡ σ( ωTx )P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P( y= 0 …

2
Contoh menunjukkan
Cara membuat contoh distribusi probabilitas yang memegang berlaku, dengan asumsi ?E(1X)=1E(X)E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1 Ketidaksetaraan yang mengikuti dari ketidaksetaraan Jensen untuk RV bernilai positif adalah seperti (ketimpangan terbalik jika ). Ini karena pemetaan adalah cembung untuk dan cekung untuk . Setelah kondisi kesetaraan dalam ketidaksetaraan Jensen, saya kira distribusinya harus merosot agar kesetaraan …

1
Bagaimana data yang hilang dapat ditangani saat menggunakan splines atau polinomial pecahan?
Saya membaca Multivariable Model Building: Pendekatan Pragmatis untuk Analisis Regresi Berdasarkan Polinomial Fraksional untuk Pemodelan Variabel Berkelanjutan oleh Patrick Royston dan Willie Sauerbrei. Sejauh ini, saya terkesan dan ini pendekatan yang menarik yang belum saya pertimbangkan sebelumnya. Tetapi penulis tidak berurusan dengan data yang hilang. Memang, pada hal. 17 mereka …

3
Apakah ada seseorang yang lebih cepat dari Usain Bolt saat ini?
EDIT: Saya lebih tertarik pada masalah teknis dan metodologi untuk menentukan kemungkinan maksimum "benar" dalam populasi tertentu yang diberikan sampel statistik. Ada masalah dengan memperkirakan kemungkinan pelari yang lebih cepat daripada Tn. Bolt dari waktu dasbor yang mengatur rekor yang jelas dan halus. Humor saya dengan membayangkan ini tidak terjadi. …


3
Apakah optimasi PCA cembung?
Fungsi objektif dari Principal Component Analysis (PCA) adalah meminimalkan kesalahan rekonstruksi dalam norma L2 (lihat bagian 2.12 di sini . Pandangan lain sedang mencoba untuk memaksimalkan varians pada proyeksi. Kami juga memiliki posting yang sangat baik di sini: Apa fungsi tujuan PCA ? ). Pertanyaan saya adalah apakah optimasi PCA …

2
Splines dalam GLM dan GAM
Apakah salah bahwa splines hanya tersedia dalam model GAM, dan tidak dalam model GLM? Saya mendengar ini beberapa waktu lalu, dan bertanya-tanya apakah ini hanya kesalahpahaman, atau ada kebenarannya. Berikut ini ilustrasi:


2
Apakah kompetisi Kaggle baru saja dimenangkan secara kebetulan?
Kompetisi Kaggle menentukan peringkat akhir berdasarkan set tes yang diadakan. Satu set tes yang diadakan adalah sampel; mungkin tidak mewakili populasi yang dimodelkan. Karena setiap pengiriman seperti hipotesis, algoritme yang memenangkan kompetisi mungkin saja, secara kebetulan, akhirnya cocok dengan set tes yang lebih baik daripada yang lain. Dengan kata lain, …

2
Apakah salah memilih fitur berdasarkan nilai-p?
Ada beberapa posting tentang cara memilih fitur. Salah satu metode menggambarkan pentingnya fitur berdasarkan t-statistik. Dalam R varImp(model)diterapkan pada model linier dengan fitur standar , nilai absolut t-statistik untuk setiap parameter model digunakan. Jadi, pada dasarnya kita memilih fitur berdasarkan t-statistiknya, artinya seberapa tepat koefisiennya. Tetapi apakah ketepatan koefisien saya …

2
Bagaimana cara menggunakan filter Kalman?
Saya memiliki lintasan objek dalam ruang 2D (permukaan). Lintasan diberikan sebagai urutan (x,y)koordinat. Saya tahu bahwa pengukuran saya berisik dan kadang-kadang saya memiliki outlier yang jelas. Jadi, saya ingin memfilter pengamatan saya. Sejauh yang saya mengerti filter Kalman, itu melakukan apa yang saya butuhkan. Jadi, saya mencoba menggunakannya. Saya menemukan …

2
Plot QQ terlihat normal tetapi uji Shapiro-Wilk mengatakan sebaliknya
Dalam R, saya memiliki sampel 348 tindakan, dan ingin tahu apakah saya dapat berasumsi bahwa itu didistribusikan secara normal untuk tes di masa mendatang. Pada dasarnya mengikuti jawaban Stack lain , saya melihat plot kepadatan dan plot QQ dengan: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) Saya tidak memiliki pengalaman yang kuat …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.