Machine Learning

為什麼分類的損失函數幾乎都是交叉熵

把 softmax 加交叉熵對 logit 的導數一路算出來,結果剛好是預測機率減去標籤。這篇從一個三類別的小例子走進這個梯度,看它為什麼乾淨、又為什麼信心錯得越離譜就修得越用力。

2026-08-06 · 5 min read · 2373 words · KbWen · ZH