现在的大模型已经非常全能了,不仅能帮你总结长文本、写代码,还能生成高质量图片、视频等。如果小伙伴们用过早期的 AI(比如早期的 ChatGPT),就会发现那时候的大模型,能力基本只限于处理文本:你给它一堆文字,它就回你一堆文字。
可如果大模型只会处理文本,那它无论怎么发展,能力都很有限。所以研究人员希望大模型能像人一样,“看得懂” 图片、“听得懂” 声音。能做到这些的大模型,就叫作 “多模态模型(Multimodal Models)”。

什么是多模态模型?
想要搞懂 “多模态模型” 这个概念,我们得先理解 “模态” 是什么。在计算机科学里,所谓的 “模态”,指的是 “信息存在的一种形式”。比如:
- 纯文字、代码,是一种模态(文本模态)。
- 各种照片、插画、截图,是一种模态(图像模态)。
- 语音、音乐、环境音,是一种模态(音频模态)。
- 电影、短视频、监控录像,是一种模态(视频模态)。

传统的 AI 大多都是 “单模态” 的。比如,做语音识别的 AI(像手机里的语音助手)根本看不懂图片,做人脸识别的 AI 也根本听不懂你在说什么。

而现在的 “多模态模型”,指的是能同时输入、处理、甚至输出 2 种或 2 种以上不同模态信息的 “全能型大模型”。

多模态模型能帮我们干什么?
当大模型进化成 “多模态模型”,拥有了 “视觉” 和 “听觉” 之后,它的生产力就直接起飞了,主要体现在以下几个方面。
1. 自动看视频找重点
我们可以直接扔给大模型一个长达数十小时的监控录像,它能又快又准地告诉你:“第 32 分钟发生了车祸”。
或者扔给它一个 120 分钟的电影,它能够给你提炼剧情摘要、自动生成解说字幕,全程都不需要你手动去拖进度条。

2. 辅助分析医疗影像
把一张复杂的医院 X 光片、CT 报告、或者皮肤患处的照片发给大模型,它能结合最前沿的医学文献,帮你快速指出疑似病灶的位置,并给出严谨的分析建议(当然,这只能作为辅助参考,最终诊断还得听专业医生的)。

3. 看图写代码
对于 Web 开发工程师来说,这简直是降维打击。我们再也不用对着设计师给的 UI 效果图,苦哈哈地手动量尺寸、写 CSS 布局了。
我们可以直接把一张网页设计原型图(甚至是随手画在白纸上的草图)扔给多模态模型,再下一道指令:“请帮我把这张图变成一个能运行的网页。” 大模型几秒钟内就能把完整的代码写出来。

这里需要先澄清一个常见误区:“看懂图片”和“生成图片”,其实是两种不同的能力。
这篇文章要介绍的多模态,主要指 AI 能够 “看懂、听懂”,也就是理解图片、声音等不同类型的信息。
至于 AI 生成图片、视频,则属于另一类技术,通常会用到 “扩散模型(Diffusion Model)”。两者的用途和底层原理并不相同,提前分清这一点,后面学习时就不容易混淆。
多模态模型是怎么工作的?
很多小伙伴一定会纳闷:文字在计算机里是用编码表示的,图片是由无数个像素点组成的,而声音是一段连绵起伏的波形。这几样八竿子打不着的东西,大模型到底是怎么把它们联系到一起的呢?
实际上,多模态模型的底层秘诀在于:统一的语义空间。
研究者们并没有为图片、声音单独造一个大模型,而是通过一种叫作 “跨模态对齐(Alignment)” 的技术,硬是把图片和声音,也翻译成了大模型能听懂的 “Token”。
举个简单例子,当多模态模型看到一张 “猫咪晒太阳” 的照片时,它是这样去理解和处理的:
- 处理图像:大模型的 “图像转换模块” 会把这张图片转化为一串数学向量。
- 处理文本:与此同时,当它读到 “一只可爱的猫躺在草地上” 这段文字时,也会把它转化为一串向量。
- 概念重叠:在模型深层的 “大脑”(也就是语义空间)里,研究者通过大量训练,让这两串原本不同的向量无限接近、最终重叠在一起。

这样一来,在大模型的眼里,那张具体的猫咪照片,和 “猫” 这个抽象的汉字,指代的是同一个核心概念。于是它 “看图” 就相当于在 “读字”,“听声音” 也相当于在读一段文字,从而实现了跨模态的理解。
拼接多模态 vs 原生多模态
在大模型的发展过程中,多模态其实经历了两个阶段,这也是很多初学者容易混淆的地方:
- 拼接多模态(早期):就像是一个 “草台班子”。比如你对 AI 说话,它在底层其实是先使用 “语音识别工具” 把你的声音转成文字,再把文字丢给大模型处理,最后大模型生成的文字,再用 “朗读软件” 读出来。这种方式会丢失掉你说话时的语气、情绪和停顿,反应也很慢。
- 原生多模态(现在):也就是 Native Multimodal。现在的顶级大模型,在从零开始训练时,就是直接把声音、图像、文本混合在一起喂给它的。它能直接 “听懂” 原始的声音波形,不需要任何中间的文字翻译。
这就是为什么,如今顶级 AI 的语音对话能聊得那么自然——你可以随时打断它,它也能听出你语气里的犹豫和情绪。而早些年的语音助手(比如老款 Siri)总是显得很呆板,而且还慢半拍。差别就在于:前者是 “原生多模态”,后者是 “拼接” 出来的。
常见的顶级多模态模型
目前行业内的顶尖大模型,几乎全都进化成了 “多模态模型”。
- GPT 系列(OpenAI):不仅能飞快地理解图片,甚至能以极低的延迟和你进行真正的语音实时对答,连你的呼吸声、语气里的情绪都能精准捕捉。
- Claude 系列(Anthropic):业界公认的 “看图写代码” 和理解复杂图表(比如财报折线图、工程架构图)的天花板。
- Gemini 系列(谷歌):凭借超长上下文窗口,可以直接吃下几个小时的超清视频,并在里面进行 “大海捞针” 般的跨模态搜寻。
- 国产多模态优选:国产大模型同样处于世界第一梯队。比如 Qwen(通义千问)和智谱 GLM,它们不仅中文理解能力极强,在识别中文菜单、国内发票、甚至复杂的中文证件方面,表现甚至超越了海外巨头,是国内企业做多模态落地的首选。

