Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Model Biner (Probit dan Logit) dengan Offset Logaritmik
Adakah yang memiliki derivasi bagaimana offset bekerja dalam model biner seperti probit dan logit? Dalam masalah saya, jendela tindak lanjut dapat bervariasi panjangnya. Misalkan pasien mendapatkan suntikan profilaksis sebagai pengobatan. Tembakan terjadi pada waktu yang berbeda, jadi jika hasilnya adalah indikator biner dari apakah ada kambuh yang terjadi, Anda perlu …


2
Bagaimana cara menerapkan jaringan saraf pada masalah klasifikasi multi-label?
Deskripsi: Biarkan domain masalah menjadi klasifikasi dokumen di mana terdapat satu set vektor fitur, masing-masing milik 1 atau lebih kelas. Misalnya, dokumen doc_1mungkin milik Sportsdan Englishkategori. Pertanyaan: Menggunakan jaringan saraf untuk klasifikasi, apa label untuk vektor fitur? apakah itu akan menjadi vektor yang membentuk semua kelas sehingga nilai 0 diberikan …

1
Kriteria untuk memilih model "terbaik" dalam Model Markov Tersembunyi
Saya memiliki kumpulan data deret waktu yang saya coba paskan dengan Hidden Markov Model (HMM) untuk memperkirakan jumlah status laten dalam data. Kode pseudo saya untuk melakukan ini adalah sebagai berikut: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest …

2
Model campuran dengan 1 observasi per level
Saya menyesuaikan model efek acak dengan glmerbeberapa data bisnis. Tujuannya adalah untuk menganalisis kinerja penjualan oleh distributor, dengan mempertimbangkan variasi regional. Saya memiliki variabel berikut: distcode: ID distributor, dengan sekitar 800 level region: ID geografis tingkat atas (utara, selatan, timur, barat) zone: geografi tingkat menengah bersarang di dalam region, sekitar …

2
Hubungan dan perbedaan antara deret waktu dan regresi?
Apa hubungan dan perbedaan antara deret waktu dan regresi? Untuk model dan asumsi , apakah benar bahwa model regresi mengasumsikan independensi antara variabel output untuk nilai yang berbeda dari variabel input, sedangkan model deret waktu tidak? Apa perbedaan lainnya? Untuk metode , dari situs web oleh Darlington Ada sejumlah pendekatan …

4
Diharapkan nomor saya akan aktif setelah menggambar kartu sampai saya mendapatkan kartu as, 2, 3, dan sebagainya
Saya mengalami beberapa masalah dalam menyelesaikan yang berikut ini. Anda mengambil kartu dari tumpukan kartu 52 kartu standar tanpa penggantian sampai Anda mendapatkan kartu As. Anda menarik dari apa yang tersisa sampai Anda mendapatkan 2. Anda melanjutkan dengan 3. Berapa angka yang diharapkan Anda akan berada setelah seluruh dek habis? …

2
Bagaimana saya mengambil sampel dari distribusi diskrit (kategorikal) dalam ruang log?
Misalkan saya memiliki distribusi diskrit yang ditentukan oleh vektor sehingga kategori akan digambar dengan probabilitas dan seterusnya. Saya kemudian menemukan bahwa beberapa nilai dalam distribusi sangat kecil sehingga mereka melemahkan representasi angka floating point komputer saya, jadi, sebagai kompensasi, saya melakukan semua perhitungan saya dalam ruang-log. Sekarang saya punya log …


3
Kapan efek tetap benar-benar diperbaiki?
Pertimbangkan model efek tak teramati linier dari tipe: mana adalah karakteristik yang tidak diobservasi tetapi waktu-invarian dan adalah kesalahan, dan indeks masing-masing pengamatan dan waktu. Pendekatan tipikal dalam regresi efek tetap (FE) adalah dengan menghapus melalui individu dummies (LSDV) / de-meaning atau dengan first differencing. c e i t c …


1
Algoritma untuk normalisasi data time-series real-time?
Saya sedang mengerjakan suatu algoritma yang mengambil dalam suatu vektor dari titik data terbaru dari sejumlah aliran sensor dan membandingkan jarak euclidean ke vektor sebelumnya. Masalahnya adalah bahwa aliran data yang berbeda berasal dari sensor yang sama sekali berbeda, sehingga mengambil jarak euclidean sederhana akan secara dramatis terlalu menekankan beberapa …


2
Dapatkah nilai-p untuk uji korelasi Pearson dihitung hanya dari koefisien korelasi dan ukuran sampel?
Latar belakang: Saya membaca satu artikel di mana penulis melaporkan korelasi Pearson 0,754 dari ukuran sampel 878. Menghasilkan nilai p untuk uji korelasi adalah signifikansi "bintang dua" (yaitu p <0,01). Namun, saya berpikir bahwa dengan ukuran sampel yang besar, nilai-p yang sesuai harus kurang dari 0,001 (yaitu tiga bintang signifikan). …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.