Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



2
Apa perbedaan antara PCA dan PCA asimptotik?
Dalam dua makalah pada tahun 1986 dan 1988 , Connor dan Korajczyk mengusulkan pendekatan untuk pemodelan pengembalian aset. Karena rangkaian waktu ini biasanya memiliki lebih banyak aset daripada pengamatan periode waktu, mereka mengusulkan untuk melakukan PCA pada kovarian lintas-seksi pengembalian aset. Mereka menyebut metode ini Asymptotic Principal Component Analysis (APCA, …
23 pca  econometrics 



2
Forensik statistik: Benford dan seterusnya
Metode luas apa yang ada untuk mendeteksi kecurangan, anomali, fudging, dll. Dalam karya ilmiah yang diproduksi oleh pihak ketiga? (Saya termotivasi untuk menanyakan hal ini oleh perselingkuhan Marc Hauser baru-baru ini .) Biasanya untuk pemilihan dan penipuan akuntansi, beberapa varian dari Hukum Benford dikutip. Saya tidak yakin bagaimana ini dapat …

5
Apa yang salah dengan algoritma pengocokan “naif” ini?
Ini adalah tindak lanjut dari pertanyaan Stackoverflow tentang mengacak array secara acak . Ada algoritma yang sudah mapan (seperti Knuth-Fisher-Yates Shuffle ) yang harus digunakan untuk mengocok array, daripada mengandalkan implementasi ad-hoc "naif". Saya sekarang tertarik untuk membuktikan (atau menyangkal) bahwa algoritma naif saya rusak (seperti pada: tidak menghasilkan semua …


1
Apa sebenarnya mekanisme perhatian?
Mekanisme perhatian telah digunakan dalam berbagai makalah Deep Learning dalam beberapa tahun terakhir. Ilya Sutskever, kepala penelitian di Open AI, dengan antusias memuji mereka: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Eugenio Culurciello di Purdue University telah mengklaim bahwa RNN dan LSTM harus ditinggalkan demi jaringan saraf murni berdasarkan perhatian: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Ini tampaknya berlebihan, tetapi tidak …

1
Penjelasan tentang min_child_weight dalam algoritma xgboost
The definisi parameter min_child_weight di xgboost diberikan sebagai: jumlah minimum contoh berat badan (goni) yang dibutuhkan pada anak. Jika langkah partisi pohon menghasilkan simpul daun dengan jumlah bobot contoh kurang dari min_child_weight, maka proses pembangunan akan berhenti mempartisi lebih lanjut. Dalam mode regresi linier, ini hanya sesuai dengan jumlah minimum …


2
Mengapa ada dua formulasi / notasi kerugian logistik yang berbeda?
Saya telah melihat dua jenis formulasi kehilangan logistik. Kita dapat dengan mudah menunjukkan bahwa keduanya identik, satu-satunya perbedaan adalah definisi label .yyy Formulasi / notasi 1, :y∈{0,+1}y∈{0,+1}y \in \{0, +1\} L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog⁡(p)−(1−y)log⁡(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) di mana , di mana fungsi logistik memetakan angka nyata hingga 0,1 interval.p=11+exp(−βTx)p=11+exp⁡(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)}βTxβTx\beta^T x Formulasi / …

3
Apakah
Pertanyaan ini dimigrasikan dari Stack Overflow karena dapat dijawab di Cross Validated. Bermigrasi 3 tahun yang lalu . Dalam statistik kami melakukan regresi linier, yang paling awal dari mereka. Secara umum, kita tahu bahwa semakin tinggi R2R2R^2 semakin baik, tetapi apakah pernah ada skenario di mana tinggi R2R2R^2akan menjadi model …


3
AIC versus validasi silang dalam seri waktu: kasus sampel kecil
Saya tertarik pada pemilihan model dalam pengaturan deret waktu. Untuk konkret, anggaplah saya ingin memilih model ARMA dari kumpulan model ARMA dengan pesanan lag yang berbeda. Maksud utamanya adalah perkiraan . Pemilihan model dapat dilakukan oleh validasi silang, penggunaan kriteria informasi (AIC, BIC), antara metode lainnya. Rob J. Hyndman menyediakan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.