**多模态(multimodal)**描述的是能处理多种数据类型的 AI 模型——文本、图像、音频、视频,而不只有文本。这个词覆盖两个方向:理解非文本输入(看懂截图、听懂语音),以及生成非文本输出(产出一张图或一段视频)。底层原理是把一切都转换成同一个网络能处理的 token 或向量——一张图变成一格格的 patch token,就像一句话变成一个个词 token。
「原生多模态」vs. 拼装货
值得留意的限定词是**原生(natively)**多模态:一个从头就在混合媒体上训练的网络,对比一个外挂了独立编码器的文本 LLM,或事后接上去的扩散生成器。原生训练让能力跨模态迁移——看到图表的模型能在同一次前向传播里推理它,而不是读一个独立视觉模块给的有损文字描述。GPT-5.5 对文本、图像、音频、视频原生全模态;MiniMax M3 从第零步就多模态训练且开源权重;Kimi K2.7 Code 原生读图与视频,支撑「截图改代码」工作流。
实践中为什么重要
多模态决定了模型能不能接某类工作流:对着截图调试、从扫描 PDF 提取表格、听得出语气的语音客服、视频问答。对 agent 也关键——computer-use agent 必须看得见屏幕。别想当然,先看模型页的输入/输出行:「支持图像」的实际含义从真·原生理解到一层薄薄的 OCR 包装都有,而且图像、音频 token 的计价常与文本分开。
输出这一侧
以生成为主的多模态模型自成一类——见图像、视频与音频模型目录。边界正从两头模糊:LLM 长出了眼睛和耳朵,生成器学会了理解语言,GPT Image 2 这类混合系统则有意站在中间。