Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana ARMA / ARIMA terkait dengan pemodelan efek campuran?
Dalam analisis data panel, saya telah menggunakan model multi-level dengan efek acak / campuran untuk menangani masalah auto-korelasi (yaitu, pengamatan dikelompokkan dalam individu dari waktu ke waktu) dengan parameter lain yang ditambahkan untuk menyesuaikan beberapa spesifikasi waktu dan guncangan minat. . ARMA / ARIMA tampaknya dirancang untuk mengatasi masalah serupa. …

3
Apa artinya distribusi terpotong?
Dalam sebuah artikel penelitian tentang analisis sensitivitas model persamaan diferensial biasa dari sistem dinamis, penulis memberikan distribusi parameter model sebagai distribusi Normal (rata-rata = 1e-4, std = 3e-5) terpotong ke kisaran [0,5e -4 1.5e-4]. Dia kemudian menggunakan sampel dari distribusi terpotong ini untuk simulasi model. Apa artinya memiliki distribusi terpotong …

1
Ketika over / under-sampling kelas tidak seimbang, apakah memaksimalkan akurasi berbeda dari meminimalkan biaya kesalahan klasifikasi?
Pertama-tama, saya ingin menjelaskan beberapa tata letak umum yang digunakan buku Penambangan Data yang menjelaskan cara menangani Kumpulan Data Tidak Seimbang . Biasanya bagian utama dinamai Dataset Tidak Seimbang dan mencakup dua subbagian ini: Klasifikasi Sensitif Biaya dan Teknik Pengambilan Sampel. Tampaknya menghadapi masalah dengan kelas langka, Anda dapat melakukan …


4
Bagaimana cara mencerna konteks statistik?
Pertama, saya kira tidak semua anggota aktif situs yang menarik ini adalah ahli statistik sebagai pekerjaan mereka. Kalau tidak, pertanyaan yang diajukan sebagai berikut tidak masuk akal! Tentu saja saya menghormati mereka, tetapi saya membutuhkan penjelasan yang sedikit lebih praktis daripada konseptual. Saya mulai dengan contoh dari Wikipedia untuk mendefinisikan …

8
Apa "algoritme panas" untuk pembelajaran mesin?
Ini adalah pertanyaan naif dari seseorang yang mulai belajar belajar mesin. Saya membaca hari ini buku "Pembelajaran Mesin: Perspektif algoritmik" dari Marsland. Saya merasa buku ini bermanfaat sebagai pengantar, tetapi sekarang saya ingin membahas algoritma canggih, yang saat ini memberikan hasil terbaik. Saya sebagian besar tertarik pada bioinformatika: pengelompokan jaringan …


3
Bagaimana cara menggunakan fungsi tes Levene di R?
Saya seorang pemula untuk statistik dan R dan saya memiliki masalah dengan menggunakan fungsi Levene (saya ingin memeriksa kesetaraan varian dua sampel). Dokumentasi mengatakan bahwa saya harus menjalankan: levene.test (y, group) Tetapi saya tidak tahu apa yang harus saya masukkan sebagai y dan grup? Saya memiliki dua sampel berbeda yang …


2
Apakah ada perbedaan dalam pendekatan Bayesian dan sering untuk EDA?
Sederhananya: Apakah ada perbedaan dalam pendekatan Bayesian dan Frequentist untuk Analisis Data Eksplorasi? Saya tahu tidak ada bias yang melekat dalam metode EDA sebagai histogram adalah histogram, sebar sebar adalah sebar sebar, dll, juga tidak saya menemukan contoh perbedaan dalam bagaimana EDA diajarkan atau disajikan (mengabaikan makalah teoretis khusus oleh …

1
Menafsirkan jarak dari hyperplane di SVM
Saya memiliki beberapa keraguan dalam memahami SVM secara intuitif. Asumsikan kita telah melatih model SVM untuk klasifikasi menggunakan beberapa alat standar seperti SVMLight atau LibSVM. Ketika kami menggunakan model ini untuk prediksi pada data uji, model menghasilkan file yang memiliki nilai "alpha" untuk setiap titik uji. Jika nilai alpha positif, …


1
Menghasilkan nilai dari distribusi Gaussian multivarian
Saat ini saya mencoba untuk nilai-nilai simulasi dari berdimensi variabel acak yang memiliki distribusi normal multivariat dengan mean vector dan kovarians matriks .NNNXXXμ=(μ1,...,μN)Tμ=(μ1,...,μN)T\mu = (\mu_1,...,\mu_N)^TSSS Saya berharap untuk menggunakan prosedur yang sama dengan metode inverse CDF, yang berarti bahwa saya ingin pertama menghasilkan berdimensi seragam variabel acak dan kemudian steker …

2
Contoh penggalian teks dengan R (paket tm)
Saya menghabiskan tiga hari mencoba-coba tmsetelah membaca kertas konsep oleh seorang teman di mana ia menjelajahi corpus teks dengan UCINET, menunjukkan awan teks, grafik jaringan dua mode dan Dekomposisi Nilai Tunggal (dengan grafik, menggunakan Stata). Saya berlari di bawah sejumlah besar masalah: pada Mac OS X, ada masalah dengan Java …
14 r  text-mining 

2
Pemilihan model Box-Jenkins
Prosedur pemilihan model Box-Jenkins dalam analisis deret waktu dimulai dengan melihat fungsi autokorelasi dan autokorelasi parsial dari seri tersebut. Plot ini dapat menyarankan dan sesuai dalam model ARMA . Prosedur berlanjut dengan meminta pengguna untuk menerapkan kriteria AIC / BIC untuk memilih model yang paling pelit di antara mereka yang …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.