Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Bisakah kita menggunakan sampel bootstrap yang lebih kecil dari sampel asli?
Saya ingin menggunakan bootstrap untuk memperkirakan interval kepercayaan untuk estimasi parameter dari dataset panel dengan N = 250 perusahaan dan T = 50 bulan. Estimasi parameter mahal secara komputasi (beberapa hari perhitungan) karena penggunaan penyaringan Kalman dan estimasi nonlinier kompleks. Oleh karena itu, menggambar (dengan penggantian) B (dalam ratusan atau …

1
Kapan menggunakan Exponential Smoothing vs ARIMA?
Saya baru-baru ini menyegarkan pengetahuan peramalan saya sambil mengerjakan ramalan bulanan di tempat kerja dan membaca buku Rob Hyndman, tetapi satu-satunya tempat saya berjuang adalah ketika menggunakan model perataan eksponensial vs model ARIMA. Apakah ada aturan praktis di mana Anda harus menggunakan satu metodologi vs yang lain? Juga, karena Anda …



1
Mengapa teorema limit pusat bekerja dengan satu sampel?
Saya selalu diajari bahwa CLT bekerja ketika Anda mengulangi pengambilan sampel, dengan masing-masing sampel cukup besar. Sebagai contoh, bayangkan saya memiliki negara dengan 1.000.000 penduduk. Pemahaman saya tentang CLT adalah bahwa bahkan jika distribusi ketinggian mereka tidak normal, jika saya mengambil 1000 sampel dari 50 orang (yaitu melakukan 1.000 survei …


1
Apa metode terbaik untuk meta-analisis jaringan?
Sekarang ada beberapa pendekatan berbeda untuk melakukan meta-analisis jaringan atau perbandingan pengobatan campuran. Yang paling umum digunakan dan dapat diakses mungkin adalah sebagai berikut: dalam kerangka Bayesian : pendekatan interaksi desain-dengan-pengobatan di WinBUGS (misalnya Jackson et al ); pemodelan Bayesian berbasis lengan hirarkis di WinBUGS (misalnya Zhao et al ); …

3
Pengkodean Tanggal / Waktu (data cyclic) untuk Neural Networks
Bagaimana cara menyandikan tanggal dan waktu acara untuk jaringan saraf? Saya tidak memiliki rangkaian waktu terus menerus, tetapi beberapa peristiwa dengan tanggal dan waktu, dan saya menganalisis beberapa jenis minat. Ketertarikan ini berbeda antara pagi dan malam, dan berbeda antara hari kerja, dan antara musim panas dan musim dingin, dan …

2
Apakah metode bayesian secara inheren berurutan?
Yaitu, untuk melakukan analisis sekuensial (Anda tidak tahu sebelumnya berapa banyak data yang akan Anda kumpulkan) dengan metode yang sering membutuhkan perawatan khusus; Anda tidak bisa hanya mengumpulkan data sampai nilai p cukup kecil atau interval kepercayaan menjadi cukup pendek. Tetapi ketika melakukan analisis Bayesian, apakah ini menjadi perhatian? Bisakah …

5
Bagaimana menganalisis tren dalam deret waktu non-periodik
Misalkan saya mengikuti deret waktu non-periodik. Jelas trennya menurun dan saya ingin membuktikannya dengan beberapa tes (dengan p-value ). Saya tidak dapat menggunakan regresi linier klasik karena korelasi temporal (serial) yang kuat antar nilai. library(forecast) my.ts <- ts(c(10,11,11.5,10,10.1,9,11,10,8,9,9, 6,5,5,4,3,3,2,1,2,4,4,2,1,1,0.5,1), start = 1, end = 27,frequency = 1) plot(my.ts, col = …
12 r  time-series 

2
Bagaimana cara operasi DepthConcat dalam 'Melangkah lebih dalam dengan konvolusi' bekerja?
Membaca Melangkah lebih dalam dengan konvolusi Saya menemukan lapisan DepthConcat , sebuah blok bangunan dari modul awal yang diusulkan , yang menggabungkan output beberapa tensor dengan berbagai ukuran. Penulis menyebutnya "Filter Concatenation". Tampaknya ada implementasi untuk Torch , tapi saya tidak begitu mengerti, apa fungsinya. Adakah yang bisa dijelaskan dengan …


1
Scikit predict_proba interpretasi keluaran
Saya bekerja dengan perpustakaan scikit-learn dengan python. Dalam kode di bawah ini, saya memprediksi probabilitas tetapi saya tidak tahu cara membaca output. Menguji data from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) Pisahkan dataset X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, …

4
Apa tujuan dari normalisasi baris
Saya mengerti alasan di balik normalisasi kolom, karena hal itu menyebabkan fitur-fitur menjadi tertimbang sama rata, bahkan jika mereka tidak diukur pada skala yang sama - namun, sering dalam literatur tetangga terdekat, baik kolom dan baris dinormalisasi. Apa normalisasi baris untuk / mengapa menormalkan baris? Secara khusus, bagaimana hasil normalisasi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.