Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Regresi untuk model bentuk ?
Saya memiliki dataset yang merupakan statistik dari forum diskusi web. Saya melihat distribusi jumlah balasan yang diharapkan dimiliki suatu topik. Secara khusus, saya telah membuat dataset yang memiliki daftar jumlah balasan topik, dan kemudian jumlah topik yang memiliki jumlah balasan tersebut. "num_replies","count" 0,627568 1,156371 2,151670 3,79094 4,59473 5,39895 6,30947 7,23329 …

2
Koreksi bias dalam varian tertimbang
Untuk varians tak tertimbang terdapat varians sampel yang dikoreksi bias, ketika rerata diperkirakan dari data yang sama: Var(X):=1Var ( X) : = 1n∑saya( xsaya- μ )2Var(X): =1n∑saya(xsaya-μ)2\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2Var ( X) : = 1n - 1∑saya( xsaya- E[ X] )2Var(X): =1n-1∑saya(xsaya-E[X])2\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Saya sedang mencari mean dan varian tertimbang, …

3
Pemodelan regresi dengan varian yang tidak sama
Saya ingin menyesuaikan model linier (lm) di mana varians residual jelas tergantung pada variabel penjelas. Cara saya tahu untuk melakukan ini adalah dengan menggunakan glm dengan keluarga Gamma untuk memodelkan varians, dan kemudian menempatkan kebalikannya ke dalam bobot dalam fungsi lm (contoh: http://nitro.biosci.arizona.edu/r/chapter31 .pdf ) Aku ingin tahu: Apakah ini …

4
Nilai yang diharapkan dari logaritma natural
Saya tahu dengan konstanta, jadi mengingat , mudah untuk dipecahkan. Saya juga tahu bahwa Anda tidak dapat menerapkannya ketika ini merupakan fungsi nonlinear, seperti dalam kasus ini , dan untuk menyelesaikannya, saya harus melakukan perkiraan dengan Taylor. Jadi pertanyaan saya adalah bagaimana cara menyelesaikan ?? apakah saya juga memperkirakan dengan …


1
Apakah penaksir yang tidak konsisten lebih disukai?
Konsistensi jelas merupakan penaksir properti yang alami dan penting, tetapi adakah situasi di mana mungkin lebih baik menggunakan penaksir yang tidak konsisten daripada yang konsisten? Lebih khusus lagi, adakah contoh estimator yang tidak konsisten yang mengungguli estimator konsisten yang masuk akal untuk semua n terbatasnnn (sehubungan dengan beberapa fungsi kerugian …

3
Pengelompokan atau klasifikasi yang diawasi?
Pertanyaan kedua adalah bahwa saya menemukan dalam suatu diskusi di suatu tempat di web berbicara tentang "pengelompokan terawasi", sejauh yang saya tahu, pengelompokan tanpa pengawasan, jadi apa sebenarnya arti di balik "pengelompokan yang diawasi"? Apa bedanya dengan "klasifikasi"? Ada banyak tautan yang membicarakan hal itu: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervised_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf …



4
Cara menulis rumus model linier dengan 100 variabel dalam R
Terkunci . Pertanyaan ini dan jawabannya dikunci karena pertanyaannya di luar topik tetapi memiliki signifikansi historis. Saat ini tidak menerima jawaban atau interaksi baru. Apakah ada cara mudah dalam R untuk membuat regresi linier atas model dengan 100 parameter dalam R? Katakanlah kita memiliki vektor Y dengan 10 nilai dan …
22 r 




3
Model stabilitas ketika berhadapan dengan besar , kecil masalah
Pengantar: Saya memiliki dataset dengan "p besar, n kecil masalah" klasik. Jumlah sampel yang tersedia n = 150 sedangkan jumlah prediktor yang mungkin p = 400. Hasilnya adalah variabel kontinu. Saya ingin menemukan deskriptor yang paling "penting", yaitu, yang merupakan kandidat terbaik untuk menjelaskan hasil dan membantu membangun teori. Setelah …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.