这篇被 TMLR 接收的 60 页综述,由马里兰大学牵头、联合 KAUST 与牛津大学等十家机构的 16 位作者完成。
它做的事可以概括成一句话:把多模态沿着智能体的每个功能模块系统捋一遍,看它究竟改变了什么,以及为此付出了什么代价。
决定一个智能体能力上限的,往往不是骨干模型的参数量,而是感知与推理之间那道信息瓶颈被压缩掉了多少。

论文信息
| 标题 | A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks |
| arXiv | 2608.20379v1,2026 年 6 月 |
| 状态 | 已被 TMLR 接收,正文 60 页 |
| 作者 | 16 人,马里兰大学为主,联合 KAUST、牛津大学、新加坡国立大学等 |
研究动机
现有 LLM Agent 综述大多默认分析对象为文本 Agent,多模态要么被简化为一个外接视觉编码器,要么整体略过。本文设定了三个目标:沿感知、推理、规划、记忆、行动五个功能模块逐一分析多模态带来的改变;建立以模态为中心的分类体系;除能力外,量化性能、效率、可扩展性、延迟、可靠性五个维度的代价。
第三点是本文与同类综述的主要差异。多数综述只做能力排名,本文额外量化了部署代价。
基础架构:三组件
| 组件 | 功能 | 现代实现 |
|---|---|---|
| Perception | 将原始多模态输入转换为接地表征 | CNN、跨注意力机制、原生多模态处理 |
| Orchestrator | 推理、规划、记忆管理 | 基础模型 |
| Action | 执行决策并接收环境反馈 | 工具调用、UI 导航、代码执行、具身控制 |
三代感知融合策略
第一代:委托感知(Delegated Perception)
文本 LLM 作为控制器,编排现成的视觉或音频专家模型,将非文本模态转换为 caption、bounding box 或 transcript 后回传 LLM。代表工作包括 HuggingGPP、Visual ChatGPT、MM-ReAct、VisProg。核心缺陷是多模态输入向文本表示转换过程中的信息损失。
第二代:晚期融合(Late-Fusion)
采用冻结编码器提取特征,经可训练投影层映射至 LLM 嵌入空间。Flamingo 的 Perceiver Resampler 是该范式的奠基工作。该范式的关键工程优势在于开源、可本地部署、可蒸馏为小规模模型。
第三代:早期融合(Early-Fusion)
采用统一架构,将文本、像素块、音频波 token 化至统一词表,通过共享自注意力层实现原生跨模态注意力。代表工作包括 GPT-4o、Gemini 1.5、Chameleon、Fuyu-8B、Janus-Pro。
四域基准表现
机器人与物理具身
RT-2 将机器人动作与视觉—语言 token 联合 token 化,新物体任务成功率 62%,相较 RT-1 的 32% 提升 30 个百分点。OpenVLA 是该路线的代表性结果:7B 参数、97 万条机器人演示,跨 29 项评估任务的绝对成功率比 55B 的 RT-2-X 高 16.5 个百分点。π0 系列以连续流匹配替代离散动作 token 化,从 3B 骨干实现 50 Hz 控制频率,相较 RT-2 的 1 至 3 Hz 提升一个数量级。
架构整合比参数规模更重要。
GUI 与 Web 导航
WebArena 上 GPT-4 系智能体成功率 14.41%,人类为 78.24%。VisualWebArena 上 GPT-4V 结合 SoM 表示为 16.4%,人类为 88.7%。60 至 70 个百分点的差距横跨全部融合策略,论文将其归因于三个未解问题:像素级坐标接地、多步规划、错误恢复。
近期工作中,UI-TARS-2 通过多轮强化学习与数据飞轮在 OSWorld 上达 47.5%;Agent S2 采用架构分解,将接地委托给专用视觉模块、规划交给通用推理器,相对单体基线提升 32.7%。
长视频理解与检索
核心矛盾在于:小时级视频遇上注意力的二次复杂度,上下文窗口被数千帧耗尽。解法不是全序列编码,而是将视频视为可供探索的环境。VideoMind 以 Chain-of-LoRA 将各角色实现为 Qwen2-VL 骨干上的轻量 adapter,2B 参数模型性能超过 78B 参数模型。VLog 采用生成式检索,124M 参数模型性能与 LLaMA-2-7B 持平。
长视频理解的瓶颈在于推理与检索策略而非视觉编码容量。
多媒体内容生成与编辑
GenArtist 以 GPT-4V 感知生成结果并通过规划树执行自我纠错,可检测文本系统无法识别的属性绑定失败与空间关系错误,在 T2I-CompBench 上相较 DALL·E 3 提升逾 20%。该域的评估困境:缺乏真实多轮编辑样本与 ground truth,MagicBrush 几乎是唯一的大规模多轮编辑基准。
部署代价的四个维度
效率:OpenVLA 的 7B 模型配合 4-bit 量化在单张消费级 GPU 上达到约 6 Hz 吞吐;RT-2 的 55B 模型需多 TPU 云推理才能维持 1 至 3 Hz 控制频率;π0 达 50 Hz。CogAgent 使高分辨率图像处理的 FLOPs 随视觉特征线性而非二次增长,计算量降至约二十五分之一。
可扩展性:承担前期基础设施投入,比长期依赖每次调用均计费的重型专有 API 更可持续。
延迟:密集视觉验证提升错误恢复能力,但将控制频率压至不适用于真实操作的区间。速度与可靠性在当前框架下相互制约。
可靠性:新方向是从事后验证转向事前预演,Code2World 通过生成可渲染代码模拟下一界面状态,使候选动作可在执行前被评估。
七个开放问题
- 复杂环境中的接地鸿沟:GUI 域存在 60 至 70 个百分点的性能差距
- 性能与效率的权衡未解:尚无单一架构能同时达到 SOTA 性能与部署可行性
- 长程记忆与推理的脆弱性:误差累积、信念修正与状态一致性维护均未解决
- 结果不可验证与基准污染:大量 SOTA 结果建立在闭源 API 之上,无法独立复现
- 对抗鲁棒性缺失:多模态输入扩大了攻击面
- 安全关键失效模式:智能体易被无关或虚假视觉特征干扰
- 多模态接地与推理中的幻觉:即便感知准确,推理骨干仍可能幻觉出物理可供性
五个未来方向
- 统一多模态表征与推理:构建面向下游规划与控制显式优化的表征空间
- 面向终身学习的可扩展记忆架构:从 RAG 演进到能对自身知识状态进行推理的记忆系统
- 用于化解权衡的混合架构:分层系统、蒸馏框架、MoE 设计
- 超越视觉—语言的模态扩展:触觉与力觉、3D 空间推理、跨模态消歧均尚缺乏系统研究
- 多智能体间的原生多模态通信协议:探索潜在空间通信、统一视觉编解码器
写在最后
论文将「架构整合比参数规模更重要」作为核心结论,OpenVLA 7B 优于 55B、VideoMind 2B 优于 78B、VLog 124M 与 7B 持平三组数据均支持该判断。
但细看这三组对比,胜出方同时也是在目标域数据上专门微调过的一方。因此起决定作用的究竟是架构整合,还是领域特化?若为后者,该结论的成立条件需重新界定。