打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym


打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym
AIxiv专栏是本站发布学术、技术内容的栏目。过去数年,本站AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

AI通用智能体的自我进化能力,并非遥不可及。

LLM-based Agent,已经不再需要人类监督者的帮助,开始实现「自我进化」!

这个智能体在学习了专家轨迹以后,获得了基础的通用能力,能够在更广泛、更真实的未知环境与任务上进行探索和学习,在外部的反馈下不断提升自己。

最近,复旦大学语言与视觉团队推出的 AgentGym 平台,打通了大语言模型智能体「数据采样、训练微调、自我进化、能力评测」全流程。基于该平台提出的 AgentEvol 算法,首次探索了通用智能体的自我进化能力,并在多项智能体任务上表现非凡,与 GPT-4、Claude 等 SOTA 模型比肩。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

打通智能体「自我进化」全流程!复旦推出通用智能体平台agentgym

  • 论文链接:https://arxiv.org/abs/2406.04151
  • AgentGym代码仓库:https://github.com/WooooDyy/AgentGym

研究背景

开发一个能够解决和适应复杂工作的多任务通用智能体,一直是人工智能社区长久以来的重要目标。

类似于人类的学习过程,通用智能体首先通过模仿,开始学习最基础的知识和技能。

随着基础能力的掌握,我们不仅期望智能体可以通过与不同环境的交互,持续学习和适应许多先前未见的任务,还能从自身经验以及外部反馈中汲取丰富的智慧,发展出一定程度的泛化能力(图1)。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

图1:基础通用智能体实现「自我进化」的示意图。该智能体首先在人类监督下进行行为克隆,随后在不同的外部环境和任务中进行探索和学习,以实现自我进化。

大语言模型凭借其卓越的通用能力,被视为构建此类智能体的重要基础之一。目前的研究领域正沿着两个主要方向进行探索,以推动智能体技术的进一步发展。

  • 依赖于人类监督的行为克隆(Beh*ior Cloning)方法,需要智能体逐步模仿专家提供的轨迹数据。这种方法虽然有效,但由于标注资源的限制,难以扩展对环境的探索也较为有限,容易遇到性能或泛化性的瓶颈。
  • 允许智能体根据环境反馈,不断提高能力的自我改进(Self Improving)方法,减少了对人类监督的依赖,同时丰富对环境的探索深度。然而,它们通常在特定任务的孤立环境中进行训练,得到一批无法有效泛化的专家智能体。

面对上述挑战,作者首次探讨了一个具备基础能力的通用智能体——在多种环境和任务中——自我进化的潜力。

为了实现这一研究目标,作者确定了推动智能体自我进化的「三大关键支柱」,这些支柱是研究的核心要素。

  • 多样化的环境和任务,允许智能体动态且全面地进行交互、训练,而不是被局限于某个孤立的环境。
  • 一个适当大小的轨迹数据集,帮助智能体配备基本的指令遵循能力和基础任务知识。
  • 一种有效且可扩展的进化算法,激发智能体在不同难度环境中的泛化能力。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

图2:AgentGym 平台示意图。平台共涵盖了 14 个跨越不同类别的环境,每个环境都作为 HTTP 服务部署。客户端为智能体提供封装好的统一接口,便于与环境互动。通过 AgentEvol 方法,作者探索了智能体在不同环境和任务中的自我进化。此外,平台提供了测试集 AgentEval 对智能体进行全面的能力评估。

围绕这三大支柱,作者的研究工作体现在以下几个方面:

  • 「AgentGym」,一个包含 14 种具体环境,89 种具体任务类型的交互平台(图2),为大语言模型智能体训练提供支持。该平台基于 HTTP 服务,为不同环境提供了一个统一的 API 接口,支持轨迹采样、多轮交互、在线评估和实时反馈。
  • 「AgentEval」,一个具有挑战性的智能体测试基准。「AgentTraj」和「AgentTraj-L」,通过指令增强和众包 / SOTA 模型标注构建的专家轨迹数据集。经过格式统一和数据过滤,帮助智能体学习基本的复杂任务解决能力。
  • 「AgentEvol」,一种激发智能体跨环境自我进化的全新算法。该算法的动机在于,期望智能体在面对先前未见的任务和指令时进行自主探索,从新的经验中进行学习与优化。

AgentGym 平台,是一个全新的,支持大语言模型智能体轨迹采样、自我进化、能力评测的框架,特点是提供多样、实时、并发和统一格式的反馈。旨在帮助人工智能社区更便利地探索具备通用能力的 LLM-based 智能体。

AgentGym——交互式训练与评测一体化的智能体平台

AgentGym 集成了多种环境、丰富的轨迹数据和全面的基准测试。它通过统一的环境操作接口,简化了环境配置过程。具体而言,AgentGym 拥有以下特点:

多样化的环境:

AgentGym 包含 14 种环境和 89 项任务,涵盖了网页导航、文字游戏、具身控制、工具使用和代码等类别。无论是致力于构建 Task-specific Agent,还是通用型的 Generally-capable Agent,AgentGym 框架均能提供对应的支持。

其中,每个环境独立部署,避免了不同环境间的依赖冲突,确保了平台的可扩展性。例如,WebShop 环境,一个用于网络购物任务的交互式平台,仅通过一行命令,即可轻松完成部署。

数据驱动:

AgentGym 的轨迹数据采用了统一的 ReAct 格式,该格式通过「Thought-Action」对将推理步骤和行动序列结合,图 2左上方提供了一个轨迹数据的示例。

平台通过广泛收集和增强指令,构建了具有 20509 条指令的集合,并从中挑选出 1160 条具有多样性的指令,构建了基准测试集 AgentEval,用于全面评估基于 LLM 的智能体。

同时,作者使用 GPT-4-Turbo 和众包标注收集轨迹数据,并基于奖励或正确性严格筛选,构建了 6130 条高质量轨迹的集合 AgentTraj。为了展现行为克隆方法的性能潜力,研究者进一步扩展,得到包含 14485 条轨迹的 AgentTraj-L。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                               图3:AgentGym 平台 14 种环境的统计数据(涵盖任务类型数量、指令集规模、评估集规模、轨迹集规模及平均交互轮数)。

模块化的架构与高效的 Pipeline:

AgentGym 平台采用模块化设计,开发者可以轻松添加或更改环境。环境被部署在不同的服务器(EnvServers)上,通过 HTTP 服务实现灵活、高效的交互。客户端(EnvClients)封装了与环境交互所需的函数,提供了相应的操作接口。

而核心组件 AgentController 作为智能体和环境的中间媒介,提供了优化智能体策略的训练器(Trainer),以及支持多环境的性能评估器(Evaluator)。统一的操作接口简化了智能体与环境的交互,使用户能够专注于算法优化和智能体训练。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                                 图4:AgentGym 平台架构概览。

独特优势:

与其他框架相比,AgentGym 的优势在于它不仅提供了广泛的环境集合,还通过交互平台为智能体提供实时的环境反馈,支持智能体的训练与评估。同时,AgentGym 支持在多个环境中实现智能体的「全面进化」,这极大地增强了智能体的泛化能力,使其在不同任务和环境中都能表现出色。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                               图5:AgentGym 与其他代理框架的比较。

AgentEvol——通用智能体进化算法 

基于 AgentGym 套件,研究者们可以容易地对智能体进行采样、训练与评测。而复旦语言与视觉团队为了探究具有通用智能体的在「自我进化」的潜力,提出了 AgentEvol 算法(图6),帮助智能体在多环境、多任务下实现了各项能力的提升。这一算法的核心思想是让智能体通过探索和学习来提升自己的性能,特别是在面对之前未见过的任务和指令时。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                                图6:AgentEvol 算法框架

AgentEvol 首先基于收集到的 AgentTraj 轨迹数据集,通过「行为克隆(beh*ioral cloning)」的形式训练一个「基础通用智能体(base generally-capable agent)」,使其具备基本的指令遵循能力和必要的先验知识。在这个过程中,智能体一步一步地模仿专家的轨迹,包括思考过程(thought)和行动(action)。

接着,这一基础通用智能体与不同的环境交互,完成自我进化。它面对来自不同环境的、更多样化的指令与查询(Instructions and queries),逐渐提升自己完成各项任务的能力。

这一过程受到机器学习中 RL as Inference 方法的启发,它将交互强化学习视为一个概率推断问题(具体推导与解释见原文)。这种方法与传统的强化学习方法不同,它不是直接寻找最大化期望回报的轨迹,而是首先定义一个关于轨迹的最优策略分布,然后通过迭代过程来优化这个分布。

具体而言,该过程包括两个交替进行的步骤:

  • 探索步骤(Exploration Step)」:在这一步骤中,智能体在当前策略下与环境进行交互,生成新的轨迹并评估其奖励,形成一个估计的最优策略分布。具体而言,智能体与多个环境进行交互,生成一系列的行为轨迹。每条轨迹都是智能体根据当前策略与环境互动的产物,包括智能体的思考,智能体的行为,以及环境的观测。然后,环境端会根据轨迹与任务目标的匹配程度,为每条轨迹给出奖励信号。
  • 学习步骤(Learning Step)」:在这一步骤中,智能体根据估计的最优策略分布更新参数,使其更加接近于最优策略。具体而言,智能体利用在探索步骤中收集到的轨迹与奖励数据,通过一个基于轨迹奖励加权的优化目标函数来优化自己。注意,在学习步骤中,为了减少过拟合,作者优化的总是「基础通用智能体」,而不是上一轮优化得到的智能体。

通过交替探索和学习步骤,AgentEvol 算法逐步优化智能体,显著提升其在多环境下的能力,实现「自我进化」的目标。

实验介绍

任务概述:

本研究通过 AgentGym 框架对智能体进行了一系列的跨环境探索和进化实验。实验旨在评估基础智能体在多样化环境中进行自我探索和进化的能力。为此,作者采用更广泛的指令集来扩展智能体的探索空间。

主要结果:

在 11 个不同环境中,使用 AgentTraj 数据集训练的智能体打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym展示了良好的基础交互能力。

进一步,通过在更大的AgentTraj-L 数据集上实施行为克隆,智能体 打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym 实现了显著的性能提升。

而本文提出的 AgentEvol 方法,尽管在初始阶段仅基于有限的专家数据,但通过交替的探索和学习步骤,智能体能够在未见过的探索集上做出正确决策,实现自我进化。在多个智能体任务上,AgentEvol 方法超越了 打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym和其他 SOTA 模型。

这一发现揭示了智能体具有适应和解决更复杂任务的潜力,为开发更高级的通用智能体提供了坚实的基础。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

酷源OA系统 2008奥运版 酷源OA系统 2008奥运版

........酷源科技旗下产品DoeipOA 2008奥运版,经过精心策划、周密准备和紧密的团队协作,于近日正式推出,功能齐全,操作更加人性化,是公司适应市场发展的需求,以用户为导向努力打造的新一代OA产品。采用了.net平台先进的开发技术,酷源OA办公自动化系统拥有信息交流、工作日志、日程安排、网络硬盘、在线QQ交流等超过三十大项基本功能及上百种子功能模块,包括体验版、标准版、企业版、集团版、

酷源OA系统 2008奥运版 0 查看详情 酷源OA系统 2008奥运版
                              图7:多任务环境下各种模型和智能体的性能对比

分析实验:

该团队还从四个角度展开了一系列的消融实验:(1) 数据合并策略;(2) 进化迭代次数;(3) 探索范围;(4) 采样次数。

实验发现,将智能体当前生成的轨迹与初始专家轨迹集合并,能带来更稳定的性能提升。相应地,利用前一迭代的探索轨迹,可能导致过拟合,出现性能的波动。

随着进化过程中迭代次数 M 增加,性能提升,但最终会趋于稳定和收敛。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                             图8:数据合并策略和迭代次数的消融实验

在 AgentEvol 探索过程中,通过对每个指令执行采样,生成多样化的轨迹促进了智能体的学习。

而将智能体的探索范围限制在已知的指令集内,也就是进行有限空间的探索,可能会限制 AgentEvol 的性能进一步提升。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                               图9:采样数目与探索范围的消融实验

此外,研究者还在不同的基座模型上进行实验。结果表明, AgentEvol 方法在不同规模的模型上均表现出色。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                                   图10:不同基座模型上的性能比较

文章还探讨了在通用智能体的进化过程中,成功与失败的经验轨迹是否都能发挥作用

实验采用直接偏好优化 DPO (Direct Preference Optimization) 方法,基于探索过程中的「成功-失败」轨迹进行训练。结果表明,智能体能够在多任务的场景下,从错误经验中学习,但其整体性能仍然不如 AgentEvol 方法。

打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym

                             图11:基于成功和失败轨迹的 DPO 训练

复旦大学自然语言处理实验室,是由复旦大学首席教授吴立德先生创建,是我国最早开展自然语言处理和信息检索研究的实验室之一。在国家自然科学基金、国家863/973/重点研发计划、省部委基金的支持下,发表了大量高水平国际期刊和会议论文。实验室在学术带头人黄萱菁教授的带领下,围绕大模型前沿方向,在语言大模型、多模态大模型、大模型对齐、智能体等方面开展系统深入的研究,产生了MOSS、眸思等一系列有较大学术影响的工作,并与国内外科技领军企业建立密切的合作关系。

复旦大学视觉与学习实验室由姜育刚教授创立,现有教师7人,在读硕博士研究生80余人,已毕业研究生30余人。实验室主要从事计算机视觉和多模态人工智能理论与应用的研究,旨在研发准确、快速、可扩展和值得信赖的 AI 算法,让机器具备像人一样的学习、感知和推理的能力。实验室承担了科技创新2030—“新一代人工智能”重大项目、国家自然科学基金重点基金、国家重点研发计划课题、上海市科技创新行动计划等国家和地方的重要科研项目,以及华为、腾讯、百度等企业的技术攻关需求。

以上就是打通智能体「自我进化」全流程!复旦推出通用智能体平台AgentGym的详细内容,更多请关注其它相关文章!


# 迭代  # 公众号推广小说网站  # 深泽第三方网站推广介绍  # 长沙IFS营销推广策略  # 甘肃网站建设这家不错  # 江阴网站推广哪里靠谱  # 衢州关键词排名优化难度  # 头条广告投放seo推广  # 深圳福田社群营销推广  # 网站营销推广溦訫hfqjwl  # 孝感网站建设与优化公司  # 丰田  # 使其  # 产业  # 奥运  # 最优  # 多个  # 过程中  # 复旦大学  # 这一  # 复旦  # type  # claude  # git  # agentgym  # ai通用智能体 


相关栏目: 【 Google疑问12 】 【 Facebook疑问10 】 【 优化推广96088 】 【 技术知识133117 】 【 IDC资讯59369 】 【 网络运营7196 】 【 IT资讯61894


相关推荐: 看懂AI,找到增长新势能 | 笔记侠AI峰会等你来  陈根:ChatGPT和人类合作开发机器人  人工智能改变网络安全和用户体验的三种方式  不到2S创作AI图像!Snap发布图像生成器SnapFusion  AI生成新闻网站数量激增,正在疯狂赚取广告收入  数据显示:人工智能相关专业热度上升最快 考古、美术、生物医学工程等小众专业火了  2025世界人工智能大会前沿科技共绘“未来”图景, 这家这家独角兽企业的通用大脑将在AI领域大放异彩  联想举办2025创新开放日,展出260余项算力及AI产品技术  第四范式“式说”大模型入选《2025年通用人工智能创新应用案例集》  谷歌AudioPaLM实现「文本+音频」双模态解决,说听两用大模型  农业产业升级:AI驱动的“崃·见田”开启农田未来展望  Transformer六周年:当年连NeurIPS Oral都没拿到,8位作者已创办数家AI独角兽  联想首发AI PC于今年秋季,英特尔CEO确认AI PC时代来临  CharacterAI - 也许会成为会话人工智能的未来  随时随地,追踪每个像素,连遮挡都不怕的「追踪一切」视频算法来了  一文读懂自动驾驶的激光雷达与视觉融合感知  行业首发「超级智绘」AI故事集,TCL实业推进AI技术应用  大模型新品出现井喷,AI产业迎来新时代  Moka AI产品后观察:HR SaaS迈进AGI时代  携程发布旅游行业垂直大模型 梁建章:AI策略是做可靠的内容 放心的推荐  大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升  无需标注数据,「3D理解」进入多模态预训练时代!ULIP系列全面开源,刷新SOTA  GPT-4 模型架构泄露:包含 1.8 万亿参数、采用混合专家模型  周鸿祎:用超级AI实现室温超导和核聚变,实现能源自由  DragGAN开源三天Star量23k,这又来一个DragDiffusion  12页线性代数笔记登GitHub热榜,还获得了Gilbert Strang大神亲笔题词  全场景智能车:智能无处不在|芯驰亮相世界人工智能大会  宇宙探索下一阶段,机器代替人类,AI会在太空探索中取代人类吗?  QQ音乐业内率先推出「AI一起听」功能,领取你的AI听歌助手  生成式人工智能来了,如何保护未成年人? | 社会科学报  百度文心一言App上架苹果商店,人工智能创作引发热议  当一切设备都受到人工智能的控制  WHEE功能介绍  外科医生的智能助手,“机器人手术”得到补充商业医保覆盖  Meta 开源 AI 语言模型 MusicGen,可将文本和旋律转化为完整乐曲  长宁这家企业在世界人工智能大会上荣获“蓝鼎奖”  AI绘画,还需要懂数学?  小米发布CyberDog2 - 他们的第二代仿生四足机器人展示  焊接协作机器人或将成为26届埃森展最大看点  美图影像节演讲实录:191次提及AI,发布7款影像生产力工具  Vision Pro头显重磅发布;苹果收购AR厂商Mira  650亿参数,8块GPU就能全参数微调:邱锡鹏团队把大模型门槛打下来了  石头扫拖机器人 G20 618 福利来袭:4999 元,超值配件领到手软  如何提高集群协作效率?中外团队合作研发基于均值偏移的机器人队形控制策略  LinkedIn 推出生成式 AI 辅助撰写帖文功能,将向所有用户开放  深企派遣无人机救援队赴京津冀开展防汛救灾任务  OpenAI限制网络爬虫访问以保护数据免被用于AI模型训练  谷歌推出 SAIF 框架,倡导安全环境下探索和发展人工智能  如何对员工进行再培训以充分利用供应链管理中的人工智能创新  AYANEO AIR 1S 掌机 7 月 9 日发布:R7 7840U + OLED 屏 

 2024-06-13

了解您产品搜索量及市场趋势,制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求,1小时内享受我们的专业解答。

运城市盐湖区信雨科技有限公司


运城市盐湖区信雨科技有限公司

运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。

 8156699

 13765294890

 8156699@qq.com

Notice

We and selected third parties use cookies or similar technologies for technical purposes and, with your consent, for other purposes as specified in the cookie policy.
You can consent to the use of such technologies by closing this notice, by interacting with any link or button outside of this notice or by continuing to browse otherwise.