Neural Network 的 Gradient 到底怎麼算出來的?本文從符號定義出發,逐一拆解 Backpropagation 的四大公式 BP(1) 到 BP(4),帶你看懂誤差如何一層一層往回傳遞。
為什麼 Gradient Descent 訓練 Neural Network 太慢?本文介紹 Stochastic Gradient Descent 如何用 Mini-Batch 加快參數更新,並釐清 Batch Size 與 Epoch 的意義。
用「山谷與球」的比喻看懂 Gradient Descent:從 Cost Function 出發,一步步推導 Gradient Vector 與參數更新規則,並說明 Learning Rate 扮演的角色。
純量是 0 維、向量是 1 維,但同一本書卻又說 [1, 2, 3, 4, 5] 是「5 維向量」。其實 Dimension 有兩種意義:Tensor 的軸數,以及向量所處空間的維度。本文從 Scalar、Vector、Matrix、Tensor 的關係出發,把這兩種說法一次講清楚,並說明如何依上下文判斷。
Neural Network 要學什麼、又怎麼知道自己學得好不好?本文介紹 MNIST 資料集的組成與 One-Hot Encoding 標籤,並說明 Cost Function 如何把一組 weight 與 bias 的好壞濃縮成一個數字。
模型的 Error 由 Bias 與 Variance 組成,而且降低一個往往會推高另一個。本文用身高預測體重的例子,說明 Underfitting、Overfitting 與兩者之間的權衡。
為什麼手寫數字辨識的 Neural Network,Output Layer 要用 10 個 Neuron,而不是理論上就夠用的 4 個?從 Hidden Layer 如何抓出圖像局部特徵談起,實際感受 Neural Network 是怎麼「看懂」一張手寫數字圖像的。