**温度(temperature)**是控制 LLM 选下一个 token 时「敢赌多大」的旋钮。模型的原始输出并不是一个词,而是词表里每个 token 的概率。温度在抽取之前重塑这份概率:调低时分布被削尖,头号热门几乎必中;调高时分布被压平,冷门 token 也有了真实的机会。这个名字借自统计物理——温度越高粒子越躁动——同一个思想,用在了选词上。
数字各代表什么
0 时,模型永远选概率最高的那个 token——接近确定性,同样的提示词进,(几乎)同样的答案出。0.7–1.0 附近,模型大致按学到的概率比例采样——聊天场景的自然默认值。推到 1.5–2,低概率 token 频繁胜出,文字先变得出人意料,继而语无伦次。旁边通常还有两个相关旋钮:top-p(只从累计概率覆盖如 90% 的最小 token 集合里采样)和 top-k(只看概率前 k 名),都是在温度重塑分布之前,先把荒谬的长尾剪掉。
怎么设
经验法则:看这个任务有几个正确答案。代码生成、数据抽取、一切只有唯一正解的活——调低(0–0.3),你要的是模型每次都给出它最有把握的判断。头脑风暴、营销文案、小说——调高(0.8–1.2),第十个点子跟第一个不一样,本来就是目的。两个提醒:温度 0 不保证输出逐比特一致(GPU 调度会引入微小的不确定性);低温也不防幻觉——一个自信的错误 token 在温度 0 时更容易被选中,而不是更不容易。自信和正确是两回事。
一条实用提醒
推理模型改变了规矩:多家厂商在「思考型」模型上忽略或限制温度参数,因为推理链内部的采样随机性弊大于利。如果模型文档说保持默认 1——那就保持 1,风格问题交给提示词去解决。