LoRA 是什麼?

Low-Rank Adaptation,一種參數高效的微調方法。只訓練一小部分新增參數,不改變原模型權重。


為什麼不用 Full Fine-tuning?


實戰 tips

  1. rank 設 8-16 通常就夠了,太高反而 overfit
  2. alpha 設 rank 的兩倍是常見起手式
  3. 數據質量 > 數量:500 條高品質 instruction data >> 5000 條噪音

踩過的坑

訓練 loss 一直不降?檢查你的 tokenizer,很可能 pad_token 沒設好,或是 instruct template 有格式錯誤。

你用過哪個 LoRA 框架?PEFT、unsloth 還是 llama-factory?