多模态大模型:让 AI 不只读文字,还能看懂图、听懂话
GPT-4V、Gemini、Qwen-VL 能看图听声。本文用最直白的方式讲清多模态的底层思路——把图/语音编码成和文字同一向量空间的 token 再统一推理,给出多模态接口最小调用,以及成本、幻觉、隐私等边界。

早期大模型只吃文字。现在 GPT-4V、Gemini、Qwen-VL 这类多模态模型已经能看图说话、能听语音、能读表格。多模态让 AI 从「文本处理器」变成「能感知世界」的助手——你甩一张截图、一段录音、一版设计稿,它都能接得住。
背景:为什么要多模态
真实世界的信息大量是非文本的:产品截图、监控画面、会议录音、扫描合同。只处理文字的 AI,面对用户发来的图片和语音就直接「失明失聪」。把感知模态补齐,AI 才能真正嵌入工作流。
怎么做到的
核心思路一句话:把图、语音先编码成和文字同一个「向量空间」的 token,再和文本拼在一起喂给同一个 transformer。模型不区来源,统一当成 token 序列处理。
- 视觉:用视觉编码器(如 ViT)把图片切成小块(patch),逐块编码成 token。
- 音频:把语音转成频谱图,再按类似视觉的方式编码。
- 之后文本、图像、音频 token 混在一起进入 LLM,统一推理。
一个最小可运行的例子
以多模态接口为例,把图片 URL 作为「图片类型」内容传给模型:
from openai import OpenAI
client = OpenAI()
resp = client.chat.completions.create(
model="gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这张图里有什么?"},
{"type": "image_url", "image_url": {"url": "https://example.com/cat.png"}},
],
}],
)
print(resp.choices[0].message.content)
取舍与边界
- 成本高:多模态输入 token 更贵,图片按分辨率切片计费,长视频更是烧钱。
- 幻觉更隐蔽:模型可能「看错」图里的细节(比如把 3 看成 8),且错误无法像文字那样逐字核对。
- 延迟更大:编码 + 超长上下文,响应比纯文本慢一截。
- 安全与隐私:能看图也意味着能读敏感截图,上传前要做好脱敏。
Tips
- 用户发图/发文件的场景,直接上多模态模型,别再自己写 OCR/预处理硬抠。
- 图片分辨率按需给,不必盲目传原图,能省不少 token。
- 关键事实(数字、名称)让模型同时给「出处」,降低看错风险。
- 涉及隐私的图片,先在端上脱敏再上传。
- 把多模态当作「感知层」,决策和结构化仍交给后面的逻辑。



