多模态大模型:让 AI 不只读文字,还能看懂图、听懂话

GPT-4V、Gemini、Qwen-VL 能看图听声。本文用最直白的方式讲清多模态的底层思路——把图/语音编码成和文字同一向量空间的 token 再统一推理,给出多模态接口最小调用,以及成本、幻觉、隐私等边界。

多模态大模型:让 AI 不只读文字,还能看懂图、听懂话

早期大模型只吃文字。现在 GPT-4V、Gemini、Qwen-VL 这类多模态模型已经能看图说话、能听语音、能读表格。多模态让 AI 从「文本处理器」变成「能感知世界」的助手——你甩一张截图、一段录音、一版设计稿,它都能接得住。

背景:为什么要多模态

真实世界的信息大量是非文本的:产品截图、监控画面、会议录音、扫描合同。只处理文字的 AI,面对用户发来的图片和语音就直接「失明失聪」。把感知模态补齐,AI 才能真正嵌入工作流。

怎么做到的

核心思路一句话:把图、语音先编码成和文字同一个「向量空间」的 token,再和文本拼在一起喂给同一个 transformer。模型不区来源,统一当成 token 序列处理。

  • 视觉:用视觉编码器(如 ViT)把图片切成小块(patch),逐块编码成 token。
  • 音频:把语音转成频谱图,再按类似视觉的方式编码。
  • 之后文本、图像、音频 token 混在一起进入 LLM,统一推理。

一个最小可运行的例子

以多模态接口为例,把图片 URL 作为「图片类型」内容传给模型:

from openai import OpenAI
client = OpenAI()

resp = client.chat.completions.create(
    model="gpt-4o",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张图里有什么?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/cat.png"}},
        ],
    }],
)
print(resp.choices[0].message.content)

取舍与边界

  • 成本高:多模态输入 token 更贵,图片按分辨率切片计费,长视频更是烧钱。
  • 幻觉更隐蔽:模型可能「看错」图里的细节(比如把 3 看成 8),且错误无法像文字那样逐字核对。
  • 延迟更大:编码 + 超长上下文,响应比纯文本慢一截。
  • 安全与隐私:能看图也意味着能读敏感截图,上传前要做好脱敏。

Tips

  • 用户发图/发文件的场景,直接上多模态模型,别再自己写 OCR/预处理硬抠。
  • 图片分辨率按需给,不必盲目传原图,能省不少 token。
  • 关键事实(数字、名称)让模型同时给「出处」,降低看错风险。
  • 涉及隐私的图片,先在端上脱敏再上传。
  • 把多模态当作「感知层」,决策和结构化仍交给后面的逻辑。

KEEP READING