Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Kapan z-transform cocok?
Saya ingin menguji korelasi sampel untuk signifikansi, menggunakan nilai-p, yaiturrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. Saya mengerti bahwa saya dapat menggunakan z-transform Fisher untuk menghitungnya zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) dan menemukan nilai-p oleh p=2P(Z>zobs)p=2P(Z>zobs)p = 2P\left(Z>z_{obs}\right) menggunakan distribusi normal standar. Pertanyaan saya adalah: seberapa besar nnn seharusnya transformasi …

2
Regresi linier vs nonlinear
Saya memiliki satu set nilai dan yang secara teoritis terkait secara eksponensial:xxxyyy y=axby=axby = ax^b Salah satu cara untuk mendapatkan koefisien adalah dengan menerapkan logaritma natural di kedua sisi dan menyesuaikan model linier: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Cara lain untuk memperoleh ini …

1
Ketika membangun model regresi menggunakan pemodelan / set validasi yang terpisah, apakah pantas untuk "menyirkulasi ulang" data validasi?
Misalkan saya punya pemisahan 80/20 antara pemodelan / pengamatan validasi. Saya telah memasukkan model ke set data pemodelan, dan saya merasa nyaman dengan kesalahan yang saya lihat pada set data validasi. Sebelum saya meluncurkan model saya untuk menilai pengamatan di masa depan, apakah pantas untuk menggabungkan validasi kembali dengan data …

3
Memilih tes statistik berdasarkan hasil yang lain (mis. Normalitas)
Jadi saya telah mendengarnya mengatakan bahwa itu bukan ide yang baik untuk memilih satu uji statistik berdasarkan hasil yang lain. Ini tampaknya aneh bagiku. Sebagai contoh, orang sering memilih untuk menggunakan tes non parametrik ketika beberapa tes lain menunjukkan bahwa residu tidak terdistribusi secara normal. Pendekatan ini tampaknya diterima secara …


1
Hutan dan prediksi acak
Saya mencoba memahami cara kerja Random Forest. Saya memiliki pemahaman tentang bagaimana pohon dibangun tetapi tidak dapat memahami bagaimana Random Forest membuat prediksi dari sampel kantong. Adakah yang bisa memberi saya penjelasan sederhana, tolong? :)

4
Kecocokan skor kecenderungan dengan data panel
Saya memiliki satu set data longitudinal individu dan beberapa dari mereka harus menjalani perawatan dan yang lainnya tidak. Semua individu dalam sampel dari lahir sampai usia 18 dan pengobatan terjadi pada usia tertentu di antara rentang itu. Usia perawatan mungkin berbeda di setiap kasus. Dengan menggunakan pencocokan skor kecenderungan, saya …

1
Variabel dependen terstandarisasi dalam grup dalam model data panel?
Apakah standardisasi variabel dependen dalam kelompok pengidentifikasi masuk akal? Kertas kerja berikut (Perlambatan deforestasi di Amazon Legal; Harga atau Kebijakan?, Pdf ) menggunakan variabel dependen terstandardisasi untuk menganalisis pengaruh perubahan kebijakan umum di Brasil terhadap deforestasi. Standarisasi dilakukan sebagai berikut: Yn e wi t= Yi t- Ysaya¯¯¯¯¯s d( Ysayat)Ysayatnew=Ysayat-Ysaya¯sd(Ysayat) Y^{new}_{it} …

2
Kapan Harus Log / Exp Variabel Anda saat menggunakan Model Hutan Acak?
Saya sedang melakukan regresi menggunakan Hutan Acak untuk memprediksi harga berdasarkan beberapa atribut. Kode ditulis dalam Python menggunakan Scikit-learn. Bagaimana Anda memutuskan apakah Anda harus mengubah variabel Anda menggunakan exp/ logsebelum menggunakannya agar sesuai dengan model regresi? Apakah perlu ketika menggunakan pendekatan Ensemble seperti Hutan Acak?

1
Asimptotik / teori sampel besar - Mengapa harus peduli?
Saya harap pertanyaan ini tidak ditandai "terlalu umum" dan semoga diskusi dimulai yang bermanfaat bagi semua. Dalam statistik, kami menghabiskan banyak waktu mempelajari teori sampel besar. Kami sangat tertarik dalam menilai sifat asimptotik dari estimator kami termasuk apakah mereka asimtotik tidak memihak, efisien asimtotik, distribusi asimptotik mereka dan sebagainya. Kata …

1
Prediksi pada model efek campuran: apa yang harus dilakukan dengan efek acak?
Mari kita pertimbangkan dataset hipotetis ini: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) bisa kita gunakan lmeuntuk memodelkan respons dengan model efek acak: require(nlme) model <- …

1
Apakah bootstrap kesalahan standar dan interval kepercayaan sesuai dalam regresi di mana asumsi homoseksualitas dilanggar?
Jika dalam regresi OLS standar dua asumsi dilanggar (distribusi kesalahan yang normal, homoseksualitas), apakah bootstrap kesalahan standar dan interval kepercayaan merupakan alternatif yang tepat untuk sampai pada hasil yang bermakna sehubungan dengan pentingnya koefisien regresi? Apakah tes signifikan dengan kesalahan standar bootstrap dan interval kepercayaan masih "berfungsi" dengan heteroskedastisitas? Jika …

4
Interpolasi data influenza yang menghemat rata-rata mingguan
Edit Saya telah menemukan kertas yang menggambarkan dengan tepat prosedur yang saya butuhkan. Satu-satunya perbedaan adalah bahwa makalah menginterpolasi data rata-rata bulanan ke harian, sambil mempertahankan rata-rata bulanan. Saya mengalami kesulitan untuk mengimplementasikan pendekatan di R. Setiap petunjuk dihargai. Asli Untuk setiap minggu, saya memiliki data jumlah berikut (satu nilai …

1
Apa yang kontingen dalam tabel kontingensi?
The Merriam-Webster kamus mendefinisikan kontingen peristiwa atau situasi sebagai 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : intended for …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.