Multimodal Agent AI Survey: Paradigms, Learning Mechanisms, and Applications
本文是关于多模态 AI 智能体的综述文章,发表于 2024 年 1 月。文章讨论多模态智能体系统如何嵌入物理和虚拟环境,核心方向是智能体、多模态、环境嵌入。
Background
Large Foundation Models(LLM 和 VLM)可以处理以前被认为仅限于人类专家或特定领域算法的复杂任务。这些任务包括数学推理、专业的法律与医学问题,以及为机器人和游戏 AI 生成复杂计划。这是构建 Agent 的核心基础。
Embodied AI 利用 LLM 的 WWW 规模领域知识和涌现式零样本具身能力来执行复杂的任务规划和推理。它将自然语言指令分解为一系列子任务,以自然语言或 Python 代码的形式表示,然后使用低级控制器执行这些子任务。
AI 智能体不仅可以在训练阶段学习,还可以从与用户的实时交互中学习。学习方式包括用户主动纠正其错误,以及通过观察用户交互来隐式学习。通过不断的交互,智能体可以提升自身的能力。大部分 LLM 在最后一次训练后不会更新知识库与内部参数,只能通过上下文学习来进行学习。
Agent AI Integration
Why AI Agents
基于 LLM 和 VLM 的基础模型在具身人工智能领域仍然表现出有限的性能。它们在理解、生成、编辑以及与未见过环境或场景交互方面尤其薄弱。
通过集成智能体人工智能框架,大型基础模型能够更深入地理解用户输入,形成复杂且自适应的人机交互系统,即大型动作模型。集成智能体的视觉语言模型为通用具身系统(如规划、问题解决和学习)在复杂环境中的发展开辟了新的可能性。
AI 智能体系统通常具备以下能力:
- 预测建模:比如预测文本的延续、问题的答案、机器人的下一步行动
- 决策制定:在某些应用中,智能体可以根据其推理做出决策,如推荐系统
- 处理模糊性:根据上下文和训练推断最可能的解释来处理模糊输入 注意,其所有能力都存在很强的局限性,受限于训练数据和训练策略。
Downsides and Advantages
将 LLM 引入 AI Agent 效果显著,取得了卓越的研究成果,当前研究热度也很高。但生成式 AI 存在固有缺陷,这些缺陷也一并被带入了现在的智能体系统中。与此同时,一些改进思路也被带了进来。
Hallucination 生成式人工智能会产生幻觉,生成无意义的内容或与源材料不符的内容。幻觉可以分为两类:内在幻觉和外在幻觉。内在幻觉指与源材料相矛盾,外在幻觉指生成的文本包含源材料中原本未包含的额外信息。
减少语言生成中幻觉率的一些有前景的途径包括使用检索增强生成(Retrieval-Augmented Generation)。但在多模态智能体系统的背景下,视觉语言模型已被证明会产生幻觉,因为它完全依赖预训练知识库,可能无法准确理解它们所部署的世界状态的动态。
Biases and Inclusivity 偏见难以避免,它源于训练所使用的数据、语言模型本身的能力限制以及训练策略的不足。虽然研究者采取了很多方法来控制,但读者仍要意识到回应中可能存在的偏见,并以批判性思维进行解读。
Data Privacy and Usage 这是在互联网时代无法被忽视的问题。在智能体的设计中,最好能够通过匿名化的方式保护用户的隐私。
Imitation Learning and Generalization 通过模仿学习而不是参数更新缓慢的强化学习来增强智能体的能力,从而实现泛化。
Inference Augmentation 通过各种方法来增强 AI 智能体的推理能力,从而提高最重要的智能体决策能力。常见的方法包括更为丰富的上下文数据、加强推理能力的 LLM 算法、人工反馈(HFRL)、实时反馈集成、领域微调模型。
Agent AI Paradigm
如标题所言,这里讨论的是 Agent 的研究范式(Paradigm),不包含具体实现细节,仅仅是对功能的概述。它需要实现以下目标:
- 利用现有的预训练模型和预训练策略,有效地为智能体提供对重要模态(如文本与视觉输入)的有效理解。
- 长期任务规划能力
- 记忆框架,允许学习到的知识被编码并在稍后检索
- 使用环境反馈来有效地训练智能体,使其学习应采取哪些行动
以下是对整个框架的概述:

Agent 与 Agent Transformer
我们可以使用 LLM 或 VLM 模型来引导 Agent 的组件。正如上图所示的结构,这种方式在无论是世界知识还是推理规划方面,都已被证明有较好的效果。
也可以使用一个单独的智能体 Transformer 模型,该模型将视觉标记和语言标记作为输入。除了视觉和语言之外,我们还添加了第三种通用类型的输入,将其表示为智能体标记。
智能体标记用于为模型的输入和输出空间中的特定子空间保留空间,专门服务于智能体行为。这种标记类似于 RL 中所使用的 Action 步,方便定制那些不好被语言描述的智能体行为,同时也方便智能体和环境进行交互。
我们可以使用基于 LLM 和 VLM 引导的全新 Agent 范式,并利用大型基础模型生成的数据来训练 Agent Transformer 模型,使其学习执行特定目标。在此过程中,Agent Transformer 模型被训练为针对特定任务和领域进行专业化和定制。这种方法使你能够利用预存在的基础模型的所学特性和知识。
为了训练 Agent Transformer,需要在每个特定环境的上下文中明确 Agent 的目标和动作空间。这包括确定代理需要执行的具体任务或动作,并分配唯一的标记。持续监控模型性能并收集反馈,针对性地进行改进。
Agent AI Learning
Strategy and Mechanism
Reinforcement Learning (RL) 利用强化学习(RL)训练具有智能行为的交互式智能体有着丰富的历史。但设计奖励函数和收集合适的数据都是很棘手的问题。RL 在长期决策中因为需要探索过多的空间,导致更加难以收敛。使用 LLM 来处理长流程决策,并使用 RL 策略来进行低级控制,是可能的解决方法。
Imitation Learning (IL) 试图利用专家数据来模仿经验丰富的 Agent 或专家的行为。行为克隆是模仿学习的主要框架,但并不主流。
Traditional RGB 利用图像输入学习智能体行为已经引起了多年的关注。使用 RGB 输入的固有挑战是维度灾难。目前已经有很多研究在讨论如何改变 AI 处理图像的方式,并且使其可以处理更多类型的数据,比如 3D 模型。
In-context Learning 上下文学习在大语言模型如 GPT-3 出现后,被证明是解决 NLP 任务的一种有效方法。通过在环境中采取特定行动时加入环境特定的反馈,上下文学习可以进一步改进智能体在环境中的表现。
Optimization in the Agent System 时间优化关注智能体如何随时间执行任务。REACT 就是其中一种方法,它通过交互式地结合环境因素来解决高效任务规划问题。
Agent Modules
参考前文图中介绍的 Modules。
Agentic Foundation Models
预训练基础模型的应用在多种用例中具有广泛适用性,提供了显著的优势。这些模型的集成使得能够为各种应用开发定制解决方案,从而避免了为每个特定任务需要大量标记数据集的需求。
利用 Foundation Models 的核心都在利用其已经训练的模态(一般是文本和视觉)。通过提示词工程利用 LLM 的能力,将其输出转化为需要执行的动作,并经由外部工具执行。
Agent AI Categorization
Generalist Agent Areas 基于计算机的行动和通用智能体(GAs)适用于许多任务。大型基础模型和交互式 AI 领域的最新进展为 GAs 带来了新的功能。然而要让 GA 真正对用户有价值,它必须易于交互,并能泛化到广泛的上下文和模态中。
Embodied Agents 具身人工智能的目标是创造能够学习创造性地解决需要与环境交互的挑战性任务的智能体,例如机器人。无论是游戏中的不具备实体的智能体,还是现实世界中的机器人,它们都属于 Embodied Agents。
Generative Agents 大型生成式 AI 模型的最新进展有可能大幅降低当前交互式内容所需的高成本和时间。这既有利于大型游戏工作室,也能使小型独立工作室与个人创造出超越其当前能力的优质体验。Generative Agents 不仅限于制作 3D 内容,还包括整个游戏制作领域全部流程的 Agent 化,即提供大型 AI 模型(包括 GPT 系列模型和扩散图像模型)与渲染引擎之间的高效接口。
Knowledge and Logical Inference Agents 推断和应用知识是人类认知的一个关键特征。对知识的推断确保了 AI 的响应和行动与已知事实和逻辑原则保持一致,这种连贯性是维持 AI 系统信任和可靠性的关键机制。直接利用 LLM 相当于直接利用模型中包含的知识,但 LLM 的幻觉表明这并不可靠,需要利用单独的智能体结构来保证这一点。
LLMs and VLMs Agent 直接利用 LLM 和 VLM 来实现智能体。前面的所有 AI Agent 基本都基于此。它是构建 AI Agent 的基础,之所以被单独列出是因为这类实现往往比较简单,一般直接利用 LLM 的能力来进行规划执行。
Agent AI Application Tasks
Agents for Gaming
NPC Behavior 在现代游戏系统中,非玩家角色(NPC)的行为主要由开发者编写的预定义脚本决定。这些脚本涵盖了基于各种触发器或玩家在游戏环境中的行为而产生的各种反应和互动。然而,这种脚本化的特性往往导致 NPC 行为可预测或重复,阻碍了动态游戏环境中预期的沉浸式体验。因此,利用 LLM 来赋予 NPC 行为自主性和适应性,使互动更加细致和引人入胜,正逐渐引起研究者的兴趣。
Human-NPC Interaction 人类玩家与 NPC 之间的交互是游戏体验的关键方面。传统的交互范式主要是单维度的,NPC 以预设方式对玩家输入做出反应。这种局限性限制了更有机、更丰富的交互潜力,类似于虚拟领域内人与人之间的交互。LLM 和 VLM 技术的出现为改变这一范式带来了希望。
Agent-based Analysis of Gaming 需要新的游戏 AI 系统,能够分析玩家行为并在必要时提供适当的支持。智能交互系统能够改变玩家与游戏系统互动的方式。NPC 与玩家的互动不再受限于游戏开发者设计的有限规则集。其核心在于利用 LLM 分析游戏内文本数据,利用 VLM 分析游戏过程中的图像和视频数据。
Scene Synthesis for Gaming 现代游戏通常具有广阔的开放世界环境。手动设计这些景观可能非常耗时且资源密集。自动化地形生成(通常利用程序化或 AI 驱动技术)可以用较少的人工努力生成复杂、逼真的景观、光照与大气效果。
Robotics
机器人是需要在环境中进行有效交互的代表性行为体,主要涉及以下技术。
Visual Motor Control 视觉运动控制是指将视觉感知与运动行动相结合,以在机器人系统中有效执行任务。这种结合至关重要,因为它使机器人能够解释来自环境的视觉数据,并相应地调整其运动行动以准确与环境交互。
Language Conditioned Manipulation 语言条件操控指的是机器人系统根据语言指令进行解释和执行任务的能力。这一方面对于创建直观且用户友好的机器人交互界面尤为重要。通过自然语言命令,用户可以像人与人之间交流一样向机器人指定目标和任务,从而降低操作机器人系统的门槛。
Skill Optimization 近期研究强调了 LLM 在机器人任务规划中的有效性。然而任务的优化执行,特别是涉及物理交互的任务(如抓取),需要超越简单解释人类指令的更深入的环境理解。捕捉场景中的这些细微间接线索并将其有效转化为机器人技能,仍然是一个重大挑战。
Healthcare
在医疗保健领域,LLM 和 VLM 可以作为诊断智能体、患者护理助手,甚至治疗辅助工具,但它们也带来了独特的挑战和责任。AI 智能体在改善患者护理和挽救生命方面具有巨大潜力,但也同样存在因误用或仓促部署而危及全球数百万人的危险可能性。
Diagnostic Agents 使用 LLM 作为医疗聊天机器人进行患者诊断备受关注。这得益于对医疗专家的高需求以及 LLM 在协助分诊和诊断方面的潜力。
Knowledge Retrieval Agents 在医疗领域,模型幻觉尤其危险,严重错误甚至可能导致患者受到严重伤害或死亡。将诊断 Agent 与医疗知识检索 Agent 结合使用,有可能显著减少幻觉,同时提高诊断对话代理的响应质量和准确性。
Telemedicine and Remote Monitoring 基于 Agent 的 AI 在远程医疗和远程监测领域也具有巨大潜力。它可以改善医疗保健的可及性、改善医疗服务提供者和患者之间的沟通,并提高频繁医患互动的效率,降低成本。
Image understanding and Video understanding 理解 X 光、CT、核磁共振等常见医学检查图像以及超声检查视频,对创建真正的医疗 Agent 非常重要。
Multimodal Agents
交互式多模态智能体包括四个主要支柱:交互、语音、视觉和语言。视觉与语言理解的融合对于开发复杂的多模态 AI 代理至关重要。这包括图像描述、视觉问答、视频语言生成和视频理解等任务。
Image-Language Understanding and Generation 图像-语言理解是一项涉及对给定图像中的视觉内容进行语言解释以及生成相关语言描述的任务。多模态智能体应该能够识别图像中的对象,理解它们的空间关系,生成关于场景的准确描述性句子,并利用推理能力来处理知识密集型的视觉推理。这不仅需要对象识别能力,还需要对空间关系、视觉语义的深刻理解,以及将这些视觉元素映射到语言结构的能力,并结合世界知识进行整合。
Video-language generation 视频语言生成(或称视频故事讲述)的任务是为视频帧流生成一系列连贯的句子。
Video Understanding 视频理解将图像理解的范畴扩展到动态视觉内容。这涉及到对视频中帧序列的解释和推理,通常与伴随的音频或文本信息相结合。
Knowledge-Intensive Agent 基于知识的视觉问答和视觉-语言检索任务在多模态机器学习中具有挑战性,这些任务需要超越图像内容的外部知识。KAT 是其中的代表作。
Agent for NLP
识别任务指令并采取行动一直是交互式人工智能和自然语言处理领域几十年来的一项基本挑战。我们确定了以下三个具体方向(以及其他方向)来改进基于语言的智能体:
Tool use and querying from knowledge bases 这一方向强调将外部知识库、网络搜索或其他有用工具集成到人工智能智能体的推理过程中的重要性。Function Calling、RAG、MCP 等技术都为其服务。
Improved agent reasoning and planning 增强智能体的推理和规划能力对于有效的人机协作至关重要。这涉及到开发能够理解复杂指令、推断用户意图以及预测潜在未来场景的模型。ReAct 以及各种代码智能体都属于此类。
Incorporating system and human feedback AI 智能体通常可以在两种主要环境中运行:提供明确行动效果信号的环境(系统反馈),以及与能够提供口头评论的人类合作的环境(人类反馈)。这一方向强调了自适应学习机制的需求,使代理能够完善其策略并纠正错误。这是目前很重要的方向。
除此为外,增强智能体的指令跟随能力也是非常受关注的一个领域。目前它更多地属于微调方向研究的内容,而不是智能体研究的核心。
- Title: Multimodal Agent AI Survey: Paradigms, Learning Mechanisms, and Applications
- Author: Hyacehila
- Created at : 2025-01-15 12:00:00
- Link: https://hyacehila.github.io//blog/2025/01/15/agent-ai-multimodal-survey/
- License: This work is licensed under CC BY-NC-SA 4.0.