簡化到極致
Transformer 的核心只有一個問題:
「在處理這個詞的時候,我該注意哪些其他詞?」
Self-Attention 三部曲
- Query × Key → Score:計算每個詞之間的關聯強度
- Softmax:把分數轉成機率權重(總和 = 1)
- Weight × Value:用權重對 Value 加權求和 → 得到這個位置的輸出
就是這麼簡單。
為什麼需要 Multi-Head?
單頭注意力可能只關注一種關係(例如主詞-動詞)。Multi-head 讓模型同時關注多種關係:語法結構、語意關聯、距離遠近等。
一句話總結
Transformer 不是魔法,只是一種非常聰明的方式,告訴模型「這句話裡誰跟誰有關係」。
初學建議:先手算一個 2×2 矩陣的 attention,比看十篇 paper 都有用。
討論 (0)
— 尚無回覆,登入後參與討論 —
— 登入後參與討論 —