最近,OpenAI 的视频生成模型 Sora 爆火,生成式 AI 模型在多模态方面的能力再次引起广泛关注。
现实世界本质上是多模态的,生物体通过不同的渠道感知和交换信息,包括视觉、语言、声音和触觉。开发多模态系统的一个有望方向是增强 LLM 的多模态感知能力,主要涉及多模态编码器与语言模型的集成,从而使其能够跨各种模态处理信息,并利用 LLM 的文本处理能力来产生连贯的响应。
然而,这一策略仅仅适用于文本生成,并不涵盖多模态输出。一些开拓性的研究在语言模型中实现了多模态理解和生成,取得了重大进展,但这些模型仅限于单一的非文本模态,比如图像或音频。
为了解决上述问题,复旦大学邱锡鹏团队联合 Multimodal Art Projection(MAP)、上海人工智能实验室的研究者提出了一种名为 AnyGPT 的多模态语言模型,该模型能够以任意的模态组合来理解和推理各种模态的内容。具体来说,AnyGPT 可以理解文本、语音、图像、音乐等多种模态交织的指令,并能熟练地选择合适的多模态组合进行响应。
例如给出一段语音 prompt,AnyGPT 能够生成语音、图像、音乐形式的综合响应:
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
给出文本 + 图像形式的 prompt,AnyGPT 能够按照 prompt 要求生成音乐:


AnyGPT 利用离散表征来统一处理各种模态,包括语音、文本、图像和音乐。
为了完成任意模态到任意模态的生成任务,该研究提出了一个可以统一训练的综合框架。如下图 1 所示,该框架由三个主要组件组成,包括:

其中,tokenizer 将连续的非文本模态转换为离散的 token,随后将其排列成多模态交错序列。然后,语言模型使用下一个 token 预测训练目标进行训练。在推理过程中,多模态 token 被相关的 de-tokenizer 解码回其原始表征。为了丰富生成的质量,可以部署多模态增强模块来对生成的结果进行后处理,包括语音克隆或图像超分辨率等应用。
AnyGPT 可以稳定地训练,无需对当前的大型语言模型(LLM)架构或训练范式进行任何改变。相反,它完全依赖于数据级预处理,使得新模态无缝集成到 LLM 中,类似于添加新语言。
这项研究的一个关键挑战是缺乏多模态交错指令跟踪数据。为了完成多模态对齐预训练,研究团队利用生成模型合成了第一个大规模「任意对任意」多模态指令数据集 ——AnyInstruct-108k。它由 108k 多轮对话样本组成,这些对话错综复杂地交织着各种模态,从而使模型能够处理多模
态输入和输出的任意组合。


这些数据通常需要大量比特才能准确表征,从而导致序列较长,这对语言模型的要求特别高,因为计算复杂度随着序列长度呈指数级增加。为了解决这个问题,该研究采用了两阶段的高保真生成框架,包括语义信息建模和感知信息建模。首先,语言模型的任务是生成在语义层面经过融合和对齐的内容。然后,非自回归模型在感知层面将多模态语义 token 转换为高保真多模态内容,在性能和效率之间取得平衡。


实验结果表明,AnyGPT 能够完成任意模态对任意模态的对话任务,同时在所有模态中实现与专用模型相当的性能,证明离散表征可以有效且方便地统一语言模型中的多种模态。
该研究评估了预训练基础 AnyGPT 的基本功能,涵盖所有模态的多模态理解和生成任务。该评估旨在测试预训练过程中不同模态之间的一致性,具体来说是测试了每种模态的 text-to-X 和 X-to-text 任务,其中 X 分别是图像、音乐和语音。
为了模拟真实场景,所有评估均以零样本模式进行。这意味着 AnyGPT 在评估过程中不会对下游训练样本进行微调或预训练。这种具有挑战性的评估设置要求模型泛化到未知的测试分布。
评估结果表明,AnyGPT 作为一种通用的多模态语言模型,在各种多模态理解和生成任务上取得了令人称赞的性能。
图像
该研究评估了 AnyGPT 在图像描述任务上的图像理解能力,结果如表 2 所示。

文本到图像生成任务的结果如表 3 所示。
语音
该研究通过计算 LibriSpeech 数据集的测试子集上的词错误率 (WER) 来评估 AnyGPT 在自动语音识别 (ASR) 任务上的性能,并使用 W*2vec 2.0 和 Whisper Large V2 作为基线,评估结果如表 5 所示。


音乐
该研究在 MusicCaps 基准上评估了 AnyGPT 在音乐理解和生成任务方面的表现,采用 CLAP_score 分数作为客观指标,衡量生成的音乐和文本描述之间的相似度,评估结果如表 6 所示。

感兴趣的读者可以阅读论文原文,了解更多研究内容。
以上就是复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持的详细内容,更多请关注其它相关文章!
# 提出了
# 杭州seo推广工具
# 小欢喜营销推广方案设计
# 搜索seo优化广告
# 请关键词优化网站
# 北京推广网站建设哪家好
# 网站优化天天软文专业
# 泉辰SEO
# 折扣店营销推广策略有哪些
# 福州规模大的seo
# 青岛网站建设客观题
# 转换为
# 评估结果
# 模型
# 丰田
# 上海
# 中国科学院
# 所示
# 多模
# 复旦
# 模态
# peech
# sora
# 排列
# 训练
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
西班牙小鲜肉*视频在网上疯传,本人发文澄清:是AI换脸的假视频!
华为余承东表示:鸿蒙可能拥有强大的人工智能大模型能力
两小时就能超过人类!DeepMind最新AI速通26款雅达利游戏
新闻传闻:迪士尼可能采用人工智能来控制电影制作成本
从谷歌到亚马逊,科技巨头们的AI痴迷
联想举办2025创新开放日,展出260余项算力及AI产品技术
华为联合合作伙伴 共同发布昇腾AI大模型训推一体化解决方案
微软Bing聊天机器人电脑端即将支持语音提问
AI生成新闻网站数量激增,正在疯狂赚取广告收入
外科医生的智能助手,“机器人手术”得到补充商业医保覆盖
大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用
华为大模型登Nature正刊!审稿人:让人们重新审视预报模型的未来
实现人工智能和物联网的协同运作
MiracleVision视觉大模型上线时间
人工智能加速走进百姓生活:从2025全球人工智能技术大会看行业新趋势
商业智能决策技术助力降本增效,世界人工智能大会举办商业AI高峰论坛
Meta发布音频AI模型,仅需2秒片段模拟真人语音
全球首款AI裸眼3D平板 国产的售价破万
CharacterAI - 也许会成为会话人工智能的未来
AI在教育中的角色:AI如何改变我们的学习方式
大模型新品出现井喷,AI产业迎来新时代
机器人 展才能
RoboNeo安装教程
AI数字人业务频频获点赞,谦寻积极引领示范作用
讯飞星火大模型实现升级 助力通用人工智能人才培养
「模仿学习」只会套话?解释微调+130亿参数Orca:推理能力打平ChatGPT
2025WRC世界机器人大赛锦标赛(烟台)收官!斯坦星球勇夺VEX赛项冠亚军!
网易云音乐内测上线“私人DJ” 打造AI推荐音乐助手
人工智能赋能无人驾驶:商业化进程再提速
张朝阳与陆川谈AI:ChatGPT是鹦鹉学舌思维,不可能取代人类 | 把脉AI大模型
AIGC 风潮刮到游戏产业,巨人网络与阿里云达成“游戏 +AI ”合作
盘古大模型3.0正式发布 AI开发正走向新“工业化开发模式”
腾讯自主研发机器狗 Max 升级,可“奔跑跳跃”完成避障动作
普林斯顿大学推出Infinigen AI模型 可生成真实自然环境 3D场景
软通动力多项AI创新产品及应用亮相2025世界人工智能大会
用人工智能技术,亚马逊为用户生成产品评论摘要,帮助他们轻松选购
美图第二届影像节发布七款AI影像创作工具
有 ARM 和 X86 两个版本,香橙派游戏掌机细节曝光
英国前首相:AI可能被用来制造“生物恐怖武器”
自动驾驶汽车避障、路径规划和控制技术详解
人工智能和你聊天 成本有多高
上海发布“元宇宙关键技术攻关行动方案”,加快 AIGC 等突破
AI大模型时代,数据存储新基座助推教科研数智化跃迁
VMS的应用:提升多品牌设备管理效能
AI和ML推动联网设备的增长
云深处与昇腾CANN携手合作:开设ROS四足机器狗开发训练营
九号公司主导制定短途交通和送物机器人领域首个国际标准,标志着零的突破发布
农业产业升级:AI驱动的“崃·见田”开启农田未来展望
OpenAI已向中国申请注册“GPT-5”商标,此前已在美国提交申请
联通发布鸿湖图文AI大模型1.0,可实现以文生图
2024-03-05
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。