🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎓
微调的格式魔法SFT(监督微调)看似只是"拿对话数据继续训练",但数据格式的影响远超想象。同样的数据,用"Human: / Assistant:"格式训练的效果可能远好于"用户: / 助手:"——因为预训练阶段模型见过的指令格式会强烈影响微调效果。这就是为什么开源模型通常附带严格的prompt模板。
一句话总结
💡
SFT 用指令-回答对微调预训练模型,使其学会按指令格式输出,从"续写文本"转变为"遵循指令"。
常见误区
这些坑别踩
✗
误区 1
SFT 数据越多越好。
✓
正确理解
高质量小数据集(如 LIMA 的 1k 条)往往优于大量低质数据,质量重于数量。
✗
误区 2
SFT 会教会模型新知识。
✓
正确理解
SFT 主要是对齐输出格式与行为,注入新知识主要靠预训练或继续预训练。
✗
误区 3
SFT 后模型就不会出错。
✓
正确理解
SFT 改善指令遵循但幻觉等问题仍存在,需进一步对齐。