**微调(fine-tuning)**是在预训练 LLM 的基础上,用你自己的数据集——几百到几千条示例——继续训练,让模型的权重本身发生改变。Prompt 是每次请求时给模型下指令,微调则是改写默认值:行为被固化进模型,不再需要每次去要求。
简述原理
从一个现成模型出发,用「输入–输出」示例对继续训练,示范你想要的行为。全量微调更新所有权重,成本高;实践中大多数微调用 LoRA 等参数高效方法——冻结基座模型,只训练小小的适配器层——成本降到一张消费级 GPU 就能微调一个开源权重模型。闭源厂商则以托管 API 的形式为部分模型提供微调服务。
微调 vs. prompting vs. RAG
三者常被混为一谈,但分工其实很清楚:
- Prompting 改变的是单次调用的行为——灵活、即时、无需训练。先试它;前沿模型对详细指令的遵循已经很好。
- RAG 在查询时补充知识——适合会变化的事实、模型没见过的私有数据。
- 微调是持久地改变行为——语气、输出格式、领域惯例,或者把 prompting 只能做对 90% 的工作流练到稳定。
经典错误是用微调去教事实:权重是一个有损且昂贵的知识存储,检索一步就能原文取出的东西,不该往权重里塞。
什么时候值得
微调对得起成本的场景:大规模的稳定结构化输出、system prompt 押不住的品牌语气、或让一个便宜小模型在某个窄任务上追平前沿模型(常见的降本打法:微调紧凑的开源模型,按任务成本击穿 API 价格)。它还能缩短 prompt——每次调用都要重复的指令挪进权重,省下 token。GLM-5.2 这类 MIT 许可模型和 Kimi K2.7 Code 这类开源权重编程模型之所以是热门基座,正是因为许可证对微调完全放开。