Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



3
Cara memperluas bingkai data di R
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki makna historis. Saat ini tidak menerima jawaban atau interaksi baru. Saya mengalami masalah saat melakukan beberapa analisis dengan R. Saya memiliki kerangka data seperti ini: Name | Group | Count Person 1 | A | 3 …
15 r 

1
Notasi penaksir (tilde vs. hat)
1. Apakah ada konvensi penamaan mengenai topi dan simbol tilde dalam statistik? Saya menemukan β menggambarkan sebuah estimator untuk β ( Wikipedia ) Tapi saya juga menemukan ~ β menggambarkan sebuah estimator untuk β ( Wolfram ). Apakah ada perbedaan artinya? Di web saya menemukan beberapa perbedaan tetapi saya tidak …
15 notation 

2
Bagaimana cara memilih antara berbagai formula Adjusted
Saya telah memikirkan formula R-squared yang disesuaikan yang diusulkan oleh: Yehezkiel (1930), yang saya percaya adalah yang saat ini digunakan dalam SPSS. R2adjusted=1−(N−1)(N−p−1)(1−R2)Radjusted2=1−(N−1)(N−p−1)(1−R2)R^2_{\rm adjusted} = 1 - \frac{(N-1)}{(N-p-1)} (1-R^2) Olkin dan Pratt (1958) R2unbiased=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)Runbiased2=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)R^2_{\rm unbiased} = 1 - \frac{(N-3)(1-R^2)}{(N-p-1)} - \frac{2(N-3)(1-R^2)^2}{(N-p-1)(N-p+1)} Dalam keadaan apa (jika ada) saya lebih suka 'disesuaikan' …

1
Bagaimana cara mendapatkan R-kuadrat untuk fit loess?
Bagaimana cara menghitung statistik R-squared ( ) dalam R untuk dan / atau fungsi output? Misalnya untuk data ini:r2r2r^2loesspredict cars.lo <- loess(dist ~ speed, cars) cars.lp <- predict(cars.lo, data.frame(speed = seq(5, 30, 1)), se = TRUE) cars.lpmemiliki dua larik fituntuk model dan se.fituntuk kesalahan standar.
15 r  r-squared  loess 

3
Apakah ada cara untuk menonaktifkan fitur penyetelan parameter (kisi) di CARET?
CARET akan secara otomatis menggunakan tuning grid yang telah ditentukan sebelumnya untuk membangun berbagai model sebelum memilih model akhir, dan kemudian melatih model akhir pada data pelatihan lengkap. Saya bisa menyediakan tuning grid saya sendiri hanya dengan satu kombinasi parameter. Namun bahkan dalam kasus ini, CARET "memilih" model terbaik di …
15 r  caret 

5
Dapatkah saya mengabaikan koefisien untuk level faktor yang tidak signifikan dalam model linier?
Setelah mencari klarifikasi tentang koefisien model linier di sini saya punya pertanyaan lanjutan tentang non-signfikan (nilai p tinggi) untuk koefisien tingkat faktor. Contoh: Jika model linier saya menyertakan faktor dengan 10 level, dan hanya 3 level tersebut yang memiliki nilai p signifikan yang terkait dengannya, ketika menggunakan model untuk memprediksi …

3
Bagaimana saya mengevaluasi standar deviasi?
Saya telah mengumpulkan tanggapan dari 85 orang tentang kemampuan mereka untuk melakukan tugas-tugas tertentu. Responsnya ada pada skala Likert lima poin: 5 = Sangat Bagus, 4 = Bagus, 3 = Rata-rata, 2 = Buruk, 1 = Sangat Buruk, Nilai rata-rata adalah 2,8 dan standar deviasi adalah 0,54. Saya mengerti apa …


4
Apakah para ahli berbahaya?
Saya membaca "Peran Catur dalam Penelitian Kecerdasan Buatan" ( pdf ) dan yang menarik, ia mengatakan: Pengalaman [...] menunjukkan bahwa input dari para pakar catur, meskipun secara umum bermanfaat, tidak dapat dipercaya sepenuhnya. Contoh yang baik dari ini adalah fungsi evaluasi Pemikiran Dalam. Beberapa perubahan oleh ahli catur manusia yang …

2
Bahasa apa yang digunakan untuk pemrograman genetika
Sebagai bagian dari tugas saya harus menulis algoritma pemrograman genetika yang melakukan prediksi tingkat polusi atmosfer. Karena saya tidak punya pengalaman, siapa pun bisa mengarahkan saya ke proposisi bahasa pemrograman di mana program yang dikembangkan akan ditulis . Klarifikasi: Saya tidak bertanya bahasa apa yang akan saya gunakan untuk menulis …

3
Apa itu proses analisis data yang praktis bagus?
Saya ingin tahu, atau memiliki referensi tentang, proses analisis yang sebagian besar dilalui oleh analis data statistik untuk setiap proyek analisis data. Jika saya membuat "daftar", untuk menyelesaikan proyek analisis data, seorang analis harus: pertama mengumpulkan persyaratan untuk proyek, rencanakan / rancang analisis datanya berdasarkan persyaratan tersebut sebelumnya sebenarnya data …

2
LASSO / LARS vs metode umum ke spesifik (GETS)
Saya telah bertanya-tanya, mengapa metode pemilihan model LASSO dan LARS begitu populer walaupun pada dasarnya mereka hanyalah variasi dari seleksi langkah-ke depan (dan karenanya menderita ketergantungan jalur)? Demikian pula, mengapa metode General to Specific (GETS) untuk pemilihan model sebagian besar diabaikan, meskipun mereka melakukan lebih baik daripada LARS / LASSO …

4
Klasifikasi dengan data tinggi lemak
Saya perlu melatih classifier linier pada laptop saya dengan ratusan ribu titik data dan sekitar sepuluh ribu fitur. Apa saja pilihan saya? Bagaimana keadaan seni untuk jenis masalah ini? Sepertinya penurunan gradien stokastik adalah arah yang menjanjikan, dan menurut saya ini adalah yang terbaik: "Pegasos: Perkiraan awal Sub-GrAdient SOlver untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.