Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
randomForest memilih regresi daripada klasifikasi
Saya menggunakan paket randomForest dalam R dan menggunakan data iris, hutan acak yang dihasilkan adalah klasifikasi tetapi ketika saya menggunakan dataset dengan sekitar 700 fitur (fitur-fiturnya adalah masing-masing piksel dalam gambar 28x28 piksel) dan kolom label dinamai label, yang randomForestdihasilkan adalah regresi. Saya menggunakan baris berikut: rf <- randomForest(label ~ …
12 r  random-forest 

1
model Bayesian hierarkis vs Bayes empiris
Apakah Anda menganggap HBM vs EB sebagai dua alternatif di mana hyperparameter "dalam permainan" menjadi sampel / diperkirakan / dll? Jelas ada hubungan antara keduanya. Apakah Anda menganggap HBM lebih "sepenuhnya Bayesian" daripada EB? Adakah tempat di mana saya bisa melihat apa perbedaan antara "sepenuhnya Bayesian" dan alternatif lain? Terima …



1
Mengapa menggunakan variabel yang dicatat?
Mungkin, ini adalah pertanyaan yang sangat mendasar tetapi saya sepertinya tidak dapat menemukan jawaban yang kuat untuk itu. Saya harap di sini, saya bisa. Saat ini saya membaca makalah sebagai persiapan untuk tesis master saya sendiri. Saat ini, saya sedang membaca sebuah makalah yang meneliti hubungan antara tweet dan fitur …

5
Apakah orang Bayesian pernah berargumen bahwa ada kasus-kasus di mana pendekatan mereka menggeneralisasi / tumpang tindih dengan pendekatan frequentist?
Apakah orang Bayesian pernah berargumen bahwa pendekatan mereka menggeneralisasikan pendekatan frequentist, karena orang dapat menggunakan prior non-informatif dan karenanya, dapat memulihkan struktur model frequentist yang khas? Adakah yang bisa merujuk saya ke tempat di mana saya bisa membaca tentang argumen ini, jika memang digunakan? EDIT: Pertanyaan ini mungkin diutarakan bukan …

3
SVD dari matriks dengan nilai yang hilang
Misalkan saya memiliki matriks rekomendasi gaya Netflix, dan saya ingin membangun model yang memprediksi peringkat film masa depan yang potensial untuk pengguna tertentu. Menggunakan pendekatan Simon Funk, orang akan menggunakan keturunan gradien stokastik untuk meminimalkan norma Frobenius antara matriks penuh dan item-by-item * pengguna-oleh-pengguna matriks dikombinasikan dengan istilah regularisasi L2. …


2
PCA dan hutan acak
Untuk kompetisi Kaggle baru-baru ini, saya (secara manual) mendefinisikan 10 fitur tambahan untuk set pelatihan saya, yang kemudian akan digunakan untuk melatih classifier hutan acak. Saya memutuskan untuk menjalankan PCA pada dataset dengan fitur-fitur baru, untuk melihat bagaimana mereka dibandingkan satu sama lain. Saya menemukan bahwa ~ 98% varians dibawa …

2
Perbedaan antara analisis faktor eksploratori dan konfirmasi dalam menentukan independensi konstruk
Para peneliti sering menggunakan dua ukuran yang memiliki item yang sangat mirip dan berpendapat bahwa mereka mengukur hal-hal yang berbeda (misalnya, "Saya selalu khawatir ketika saya berada di sekitar mobil"; "Saya takut mobil"). Mari kita memanggil langkah-langkah hipotetis Ketakutan Mobil Mengukur dan Kecemasan dari Skala Mobil. Saya tertarik untuk menguji …

2
Bagaimana cara mengurangi jumlah item menggunakan analisis faktor, konsistensi internal, dan teori respons item bersamaan?
Saya sedang dalam proses mengembangkan kuesioner secara empiris dan saya akan menggunakan angka acak untuk mengilustrasikannya. Untuk konteks, saya mengembangkan kuesioner psikologis yang bertujuan menilai pola pikir yang umumnya diidentifikasi pada individu yang memiliki gangguan kecemasan. Sebuah item bisa terlihat seperti "Saya perlu memeriksa oven berulang kali karena saya tidak …

4
Perbedaan deret waktu sebelum Arima atau di dalam Arima
Apakah lebih baik untuk membedakan rangkaian (dengan asumsi perlu) sebelum menggunakan Arima ATAU lebih baik menggunakan parameter d dalam Arima? Saya terkejut betapa berbedanya nilai-nilai yang dipasang tergantung pada rute mana yang diambil dengan model dan data yang sama. Atau apakah saya melakukan sesuatu yang salah? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), …
12 r  time-series  arima 


1
Apa itu koreksi bias? [Tutup]
Ditutup . Pertanyaan ini membutuhkan detail atau kejelasan . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Tambahkan detail dan jelaskan masalahnya dengan mengedit posting ini . Ditutup 4 tahun yang lalu . Saya telah melihat banyak tempat di mana mereka memiliki dataset input / output di mana mereka …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.