术语表

推理(Inference)

最后更新:2026-07-13

**推理(inference)**就是使用训练好的模型:你发入输入,权重保持冻结,输出返回。训练是创造模型的一次性过程,长达数月;推理是此后的每一次使用——每条聊天回复、每次代码补全、每张生成图。经济账也照此划分:训练是一次付清的固定成本,推理是每个请求都要付的边际成本——规模上去之后,按 token 计价的 API 账单本质上就是推理账单。

LLM 推理时发生了什么

两个阶段,瓶颈各不相同。**Prefill(预填充)**并行处理你的整个提示词——算力瓶颈,这是长提示词还没输出就先花钱的原因。**Decode(解码)**随后逐 token 生成回复,每一步都依赖之前的全部内容——显存带宽瓶颈,这是文字一个词一个词往外蹦的原因。常见指标正好对应这两段:首 token 延迟量 prefill,每秒 token 数量 decode。把上下文窗口塞到 50 万 token,两个阶段都会更慢更贵——「能塞」不等于「该塞」,这是又一条理由。

推理为什么变便宜——还养出一个行业

几年间,每 token 价格跌了几个数量级,靠的是更强的硬件加一整摞软件技巧:量化(用更少的比特存权重)、批处理(多个用户共享一次 GPU 前向)、KV 缓存(不为每个新 token 重算提示词)、投机解码(小模型起草、大模型验收),以及每个 token 只激活一小部分权重的混合专家架构。便宜的推理还催生了一个市场:推理服务商(Groq、Together、Fireworks、DeepInfra 等)竞相把开源权重模型跑得比别家更快更便宜——同一个模型,谁来跑,速度和价格可以差很远。

跟你有什么关系

选模型时你真正在选的是一笔推理交易:在你能接受的延迟下,每块钱买到多少质量。推理时代的算盘还变了——「思考型」模型回答前会多花几千个 token 来推演,刻意用更多推理算力换更好的答案。让这笔交换划算的,正是快而便宜的推理。

来源

← 全部术语