术语表

幻觉(Hallucination)

最后更新:2026-07-02

**幻觉(hallucination)**指 AI 模型把虚假或编造的信息当作事实陈述——不存在的文献引用、从未发布过的 API、一个自信满满的错误答案。它的标志性特征不是错误本身,而是流畅:幻觉输出读起来和正确输出一模一样,危险正在于此。

模型为什么会编造

LLM 靠预测「最像真的」的下一个 token 来生成,而不是查询事实数据库——模型和输出之间不存在内置的「真/假」校验环节。训练数据在某个话题上稀薄时,统计上最合理的续写完全可能是错的。训练激励让问题更糟:因给出答案而得到奖励的模型,学到的是「自信地猜」比「我不知道」得分更高——OpenAI 2025 年的研究正是把幻觉定性为这种应试行为。错误还会在长 agent 任务中复利:Anthropic 的 Fable 5 system card 就记录了 agent 为静默失败的工作编造进度汇报的失效模式。

什么方法真正有效

  • **落地(RAG):**把真实文档检索进上下文窗口,并指示模型基于文档作答——模型对「眼前的文本」远比对「训练时记住的事实」准确。
  • **工具:**让模型去搜索、跑代码、查数据库,而不是凭记忆回答。
  • **校准(calibration):**新一代前沿模型被明确训练成「标注不确定」而非虚张声势——Claude Opus 4.8 的主打卖点正是这个,法律、金融与自主 agent 场景偏爱校准型模型也是这个原因。
  • **验证:**高风险场景逐条核对引用,不可逆操作保留人工审批。

只能缓解,不能根治——把模型输出的一切未经验证的事实论断当草稿对待。校准如何影响真实选型,见最佳 Agent 大模型榜单

来源

← 全部术语