Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
-tests vs -tests?
Saya mencoba mencari tahu apa perbedaan antara uji- dan uji- .ztttzzz Sejauh yang saya tahu, untuk kedua kelas tes, seseorang menggunakan statistik tes yang sama, sesuatu dalam bentuk b^- Cseˆ( b^)b^−Cse^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} di mana adalah beberapa statistik sampel, adalah beberapa referensi (lokasi) konstan (yang tergantung pada rincian pengujian), dan …

1
Manipulasi model regresi logistik
Saya ingin memahami apa yang dilakukan kode berikut. Orang yang menulis kode tidak lagi berfungsi di sini dan hampir tidak berdokumen. Saya diminta untuk menyelidikinya oleh seseorang yang berpikir " ini model regresi logistik bayesian " bglm <- function(Y,X) { # Y is a vector of binary responses # X …


4
Keuntungan apa yang dimiliki regresi Poisson daripada regresi linier dalam kasus ini?
Saya telah diberikan satu set data yang berisi jumlah penghargaan yang diterima oleh siswa di satu sekolah menengah di mana prediktor jumlah penghargaan yang diperoleh termasuk jenis program di mana siswa terdaftar dan skor pada ujian akhir mereka dalam matematika. Saya bertanya-tanya apakah ada yang bisa memberi tahu saya mengapa …

1
Apa perbedaan antara statistik / metode distribusi bebas dan statistik non-parametrik?
Dari Wikipedia Arti pertama dari non-parametrik meliputi teknik yang tidak bergantung pada data milik distribusi tertentu. Ini termasuk, antara lain: metode distribusi bebas, yang tidak mengandalkan asumsi bahwa data diambil dari distribusi probabilitas yang diberikan. Karena itu adalah kebalikan dari statistik parametrik. Ini termasuk model statistik non-parametrik, inferensi dan uji …

1
pas fungsi eksponensial menggunakan kuadrat terkecil vs model linier umum vs kuadrat terkecil nonlinier
Saya memiliki kumpulan data yang mewakili peluruhan eksponensial. Saya ingin mencocokkan fungsi eksponensial untuk data ini. Saya sudah mencoba log mentransformasikan variabel respons dan kemudian menggunakan kuadrat terkecil agar sesuai dengan garis; menggunakan model linier umum dengan fungsi log link dan distribusi gamma di sekitar variabel respons; dan menggunakan kuadrat …

2
Menafsirkan hasil k-means clustering di R
Saya menggunakan kmeansinstruksi R untuk melakukan algoritma k-means pada dataset iris Anderson. Saya punya pertanyaan tentang beberapa parameter yang saya dapatkan. Hasilnya adalah: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 Dalam hal ini, apa arti "Cluster berarti"? Apakah rata-rata jarak semua objek di dalam kluster? Juga …

2
Bagaimana cara menggabungkan hasil regresi logistik dan hutan acak?
Saya baru belajar mesin. Saya menerapkan regresi logistik dan hutan acak pada dataset yang sama. Jadi saya mendapatkan variabel penting (koefisien absolut untuk regresi logistik dan variabel penting untuk hutan acak). Saya berpikir untuk menggabungkan keduanya untuk mendapatkan kepentingan variabel akhir. Adakah yang bisa berbagi pengalamannya? Saya sudah memeriksa bagging, …

2
Membandingkan dua model regresi linier
Saya ingin membandingkan dua model regresi linier yang mewakili tingkat degradasi mRNA dari waktu ke waktu dalam dua kondisi yang berbeda. Data untuk setiap model dikumpulkan secara independen. Berikut ini dataset. Waktu (jam) log (Perawatan A) log (pengobatan B) 0 2.02 1.97 0 2.04 2.06 0 1,93 1,96 2 2.02 …

1
Kernelised k Neighbor Terdekat
Saya baru mengenal kernel dan telah mengalami kesulitan saat mencoba kernelkan kNN. Persiapan Saya menggunakan kernel polinomial: K( X , y ) = ( 1 + ⟨ x , y ⟩ )dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d KNN Euclidean khas Anda menggunakan metrik jarak berikut: d( x , y …

1
Densitas Y = log (X) untuk X yang didistribusikan Gamma
Pertanyaan ini terkait erat dengan pos ini Misalkan saya memiliki variabel acak , dan saya mendefinisikan . Saya ingin menemukan fungsi kepadatan probabilitas .X∼Gamma(k,θ)X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y=log(X)Y=log⁡(X)Y = \log(X)YYY Saya awalnya berpikir saya hanya akan mendefinisikan fungsi distribusi kumulatif X, melakukan perubahan variabel, dan mengambil "bagian dalam" dari integral sebagai …

1
Memprediksi logit yang dipesan di R
Saya mencoba melakukan regresi logit yang dipesan. Saya menjalankan model seperti itu (hanya model kecil yang bodoh memperkirakan jumlah perusahaan di pasar dari ukuran pendapatan dan populasi). Pertanyaan saya adalah tentang prediksi. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Ketika saya menjalankan prediksi (yang saya coba gunakan untuk mendapatkan prediksi y), hasilnya …

2
Apakah solusi PCA unik?
Ketika saya menjalankan PCA pada set data tertentu, apakah solusi yang diberikan kepada saya unik? Yaitu, saya mendapatkan satu set koordinat 2d, berdasarkan jarak interpoint. Apakah mungkin untuk menemukan setidaknya satu pengaturan poin lagi yang akan memenuhi kendala ini? Jika jawabannya ya, bagaimana saya bisa menemukan solusi yang berbeda?
12 pca 

2
Pemilihan fitur dan penyetelan parameter dengan tanda sisipan untuk hutan acak
Saya memiliki data dengan beberapa ribu fitur dan saya ingin melakukan pemilihan fitur rekursif (RFE) untuk menghapus yang tidak informatif. Saya melakukan ini dengan tanda sisipan dan RFE. Namun, saya mulai berpikir, jika saya ingin mendapatkan kecocokan regresi terbaik (hutan acak, misalnya), kapan saya harus melakukan penyetelan parameter ( mtryuntuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.