2
Mengapa tidak overfitting jaringan saraf yang merusak untuk klasifikasi MNIST?
Saya memiliki jaringan saraf sederhana (NN) untuk klasifikasi MNIST. Ini termasuk 2 lapisan tersembunyi, masing-masing dengan 500 neuron. Oleh karena itu dimensi NN adalah: 784-500-500-10. ReLU digunakan di semua neuron, softmax digunakan pada output, dan cross-entropy adalah fungsi loss. Apa yang membingungkan saya adalah mengapa overfitting tampaknya tidak menghancurkan NN? …