Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Hutan Acak tidak bisa berpakaian?
Saya telah membaca beberapa literatur yang hutan acak tidak bisa pakai terlalu banyak. Walaupun ini terdengar hebat, tampaknya terlalu bagus untuk menjadi kenyataan. Apakah mungkin bagi rf untuk berpakaian berlebihan?


2
Bagaimana cara mengubah ambang batas untuk klasifikasi dalam R randomForests?
Semua literatur Pemodelan Distribusi Spesies menunjukkan bahwa ketika memprediksi ada / tidaknya suatu spesies menggunakan model yang menghasilkan probabilitas (misalnya, RandomForests), pilihan ambang batas probabilitas yang digunakan untuk benar-benar mengklasifikasikan suatu spesies sebagai ada atau tidaknya adalah penting dan kita harus tidak selalu mengandalkan default 0,5. Saya butuh bantuan dengan …

2
Bagaimana Statistik Chi Squared Pearson memperkirakan Distribusi Chi Squared
Jadi jika Statistik Kuadrat Pearson Pearson's diberikan untuk tabel , maka bentuknya adalah:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Maka ini mendekati χ2n−1χn−12\chi_{n-1}^2 , Distribusi Chi-Squared dengan n−1n−1n-1 derajat kebebasan, karena ukuran sampel NNN semakin besar. Yang tidak saya mengerti adalah bagaimana perkiraan asimptotik ini bekerja. Saya merasa EiEiE_i di penyebutnya …

2
Berapakah estimasi kemungkinan maksimum dari kovarians data normal bivariat ketika mean dan varians diketahui?
Misalkan kita memiliki sampel acak dari distribusi normal bivariat yang memiliki nol sebagai mean dan varians, sehingga satu-satunya parameter yang tidak diketahui adalah kovarians. Apa MLE dari kovarian? Saya tahu itu harus seperti tapi bagaimana kita tahu ini?1n∑nj=1xjyj1n∑j=1nxjyj\frac{1}{n} \sum_{j=1}^{n}x_j y_j


1
Mengapa mengantongi menggunakan sampel bootstrap?
Bagging adalah proses menciptakan N pelajar pada N sampel bootstrap yang berbeda, kemudian mengambil rata-rata prediksi mereka. Pertanyaan saya adalah: Mengapa tidak menggunakan jenis sampling lainnya? Mengapa menggunakan sampel bootstrap?
10 bagging 

2
Caret varImp untuk model randomForest
Saya mengalami kesulitan memahami bagaimana varImpfungsi ini bekerja untuk model randomForest dengan caretpaket. Pada contoh di bawah ini, fitur var3 sama pentingnya dengan varImpfungsi caret , tetapi model final randomForest yang mendasarinya memiliki kepentingan nol untuk fitur var3. Mengapa demikian? require(randomForest) require(caret) rf <- train(x, y, method = "rf", trControl …
10 r  caret  random-forest 

1
Apakah validasi hold-out merupakan perkiraan yang lebih baik untuk “mendapatkan data baru” daripada k-fold CV?
Saya telah memikirkan kembali jawaban yang saya berikan pada pertanyaan beberapa minggu yang lalu Hold-out cross-validation menghasilkan satu set tes yang dapat digunakan berulang kali untuk demonstrasi. Kita semua tampaknya setuju bahwa ini dalam banyak hal adalah fitur negatif, karena satu set keluar mungkin menjadi non-representatif melalui keacakan. Selain itu, …


2
Intervensi Dengan Perbedaan
Ketika melakukan analisis intervensi dengan data deret waktu (alias Rangkaian Waktu Terputus) seperti yang dibahas di sini misalnya, salah satu persyaratan yang saya miliki adalah memperkirakan total keuntungan (atau kerugian) akibat intervensi - yaitu jumlah unit yang diperoleh atau hilang (variabel Y ). Tidak sepenuhnya memahami bagaimana memperkirakan fungsi intervensi …


3
Apakah mungkin dalam R (atau secara umum) untuk memaksa koefisien regresi menjadi tanda tertentu?
Saya bekerja dengan beberapa data dunia nyata dan model regresi menghasilkan beberapa hasil yang berlawanan dengan intuisi. Biasanya saya mempercayai statistik tetapi pada kenyataannya beberapa hal ini tidak benar. Masalah utama yang saya lihat adalah bahwa peningkatan dalam satu variabel menyebabkan peningkatan respons ketika, pada kenyataannya, mereka harus berkorelasi negatif. …

2
Distribusi stabil yang dapat dikalikan?
Distribusi yang stabil tidak berubah-ubah berdasarkan konvolusi. Apa sub-keluarga dari distribusi stabil juga ditutup dengan perkalian? Dalam arti bahwa jika dan , maka fungsi kepadatan probabilitas produk, (hingga konstanta normalisasi) juga termasuk dalam ?f ∈ F g ∈ F f ⋅ g FFFFf∈Ff∈Ff\in Fg∈Fg∈Fg\in F f⋅gf⋅gf \cdot gFFF Catatan: Saya …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.