LoRA 是什麼?
Low-Rank Adaptation,一種參數高效的微調方法。只訓練一小部分新增參數,不改變原模型權重。
為什麼不用 Full Fine-tuning?
- 成本:Full fine-tuning 需要多張 A100,LoRA 在單張 3090 上就能跑 7B 模型
- 彈性:可以為不同任務訓練多個 LoRA adapter,共用一個 base model
- 不會 catastrophic forgetting:base model 權重鎖定,不會忘記原有能力
實戰 tips
- rank 設 8-16 通常就夠了,太高反而 overfit
- alpha 設 rank 的兩倍是常見起手式
- 數據質量 > 數量:500 條高品質 instruction data >> 5000 條噪音
踩過的坑
訓練 loss 一直不降?檢查你的 tokenizer,很可能 pad_token 沒設好,或是 instruct template 有格式錯誤。
你用過哪個 LoRA 框架?PEFT、unsloth 還是 llama-factory?
討論 (0)
— 尚無回覆,登入後參與討論 —
— 登入後參與討論 —