字节复旦团队创新的「元提示」策略提升了扩散模型图像理解的性能,达到了前所未有的水平!


Text-to-image(T2I)扩散模型在生成高清晰度图像方面表现卓越,这要归功于其在大规模图像-文本对上的预训练。

这引发了一个自然的问题:扩散模型是否可以用于解决视觉感知任务? 

最近,字节跳动和复旦大学的团队提出了扩散模型来处理视觉任务。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

论文地址:https://arxiv.org/abs/2312.14733

开源项目:https://github.com/fudan-zvg/meta-prompts

SCISPACE SCISPACE

AI论文研究助手,探索和解释论文的平台

SCISPACE 65 查看详情 SCISPACE

团队的关键洞察是将可学习的元提示引入预训练的扩散模型中,以提取适用于特定感知任务的特征。

技术介绍 

团队将text-to-image扩散模型作为特征提取器应用于视觉感知任务中。

首先,输入图像经过VQVAE编码器压缩,分辨率降低为原大小的1/8,生成latent space特征表示。值得注意的是,VQVAE编码器参数固定,不参与后续训练。

下一步,将未添加噪声的数据送入UNet进行特征提取。为了更好地适应不同任务,UNet同时接收调制的时间步嵌入和多个元提示,以生成与形状一致的特征。

在整个过程中,为了增强特征表达,该方法进行了步的recurrent refinement。这使得UNet内不同层的特征能够更好地交互融合。在第次循环中,UNet的参数由特定的可学习的时间调制特征调节。 

最终,UNet生成的多尺度特征输入到专门为目标视觉任务设计的解码器中。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

可学习的元提示(meta prompts)设计 

Stable diffusion model采用UNet架构,通过交叉注意力将文本提示融入图像特征中,实现了文生图。这种整合确保了图像生成在语境和语义上的准确性。

然而,视觉感知任务的多样性超出了这一范畴,因为图像理解面临着不同的挑战,往往缺乏文本信息作为指导,使得以文本驱动的方法有时显得不切实际。 

为应对这一挑战,技术团队的方法采用了更为多样的策略——不依赖外部文本提示,而是设计了一种内部的可学习元提示,称为meta prompts,这些meta prompts被集成到扩散模型中,以适应感知任务。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

Meta prompts以矩阵 的形式表示,其中表示meta prompts的数量,表示维度。具备meta prompts的感知扩散模型避免了对外部文本提示的需求,如数据集类别标签或图像标题,也无需预训练的文本编码器来生成最终的文本提示。 

Meta prompts可以根据目标任务和数据集进行端到端的训练,从而为去噪UNet建立特别定制的适应条件。这些meta prompts包含丰富的、适应于特定任务的语义信息。比如:

- 在语义分割任务中,meta prompts有效地展示了对类别的识别能力,相同的meta prompts倾向于激活同一类别的特征。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

- 在深度估计任务中,meta prompts表现出对深度的感知能力,激活值随深度变化,使prompts能够集中关注一致距离的物体。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

- 在姿态估计中,meta prompts展现出一套不同的能力,特别是关键点的感知,这有助于人体姿态检测。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

这些定性结果共同突显了技术团队提出的meta prompts在各种任务中对任务相关激活能力的有效性。

作为文本提示的替代品,meta prompts很好地填补了了text-to-image扩散模型与视觉感知任务之间的沟壑。

基于元提示的特征重组 

扩散模型通过其固有的设计,在去噪UNet中生成多尺度特征,这些特征在接近输出层时聚焦于更细致、低级的细节信息。

虽然这种低级细节对于强调纹理和细粒度的任务来说足够,但视觉感知任务通常需要理解既包括低级细节的又包括高级语义解释的内容。

因此,不仅需要生成丰富的特征,确定这些多尺度特征的哪种组合方式可以为当前任务提供最佳表征也非常重要。 

这就是meta prompts的作用所在——

这些prompts在训练过程中保存了与所使用数据集特定相关的上下文知识。这种上下文知识使meta prompts能够充当特征重组的过滤器,引导特征选取过程,从UNet产生的众多特征中筛选出与任务最相关的特征。 

团队使用点积的方式将UNet的多尺度特征的丰富性与meta prompts的任务适应性结合起来。 

考虑多尺度特征,其中每个。和表示特征图的高度和宽度。Meta prompts 。每个尺度上重排的特征的计算为: 

最后,这些经过meta prompts过滤的特征随后输入到特定任务的解码器中。 

基于可学习的时间调制特征的recurrent refinement 

在扩散模型中,添加噪声然后多步去噪的迭代过程构成了图像生成的框架。

受此机制的启发,技术团队为视觉感知任务设计了一个简单的recurrent refinement过程——没有向输出特征中添加噪声,而是直接将UNet的输出特征循环输入到UNet中。

同时为了解决随着模型通过循环,输入特征的分布会发生变化但UNet的参数保持不变的不一致的问题,技术团队对于每个循环引入了可学习的独特的timestep embeddings,以调制UNet的参数。

这确保了网络对于不同步骤中输入特征的变化性保持适应性和响应性,优化了特征提取过程,并增强了模型在视觉识别任务中的性能。 

结果显示,该方法在多个感知任务数据集上都取得了最优。

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

扩散模型图像理解力刷新SOTA!字节复旦团队提出全新「元提示」策略

应用落地和展望 

该文章提出的方法和技术有广泛的应用前景,可以在多个领域内推动技术的发展和创新:

  1. 视觉感知任务的改进:该研究能够提升各种视觉感知任务的性能,如图像分割、深度估计和姿态估计。这些改进可应用于自动驾驶、医学影像分析、机器人视觉系统等领域。 
  2. 增强的计算机视觉模型:所提出的技术可以使计算机视觉模型在处理复杂场景时更加准确和高效,特别是在缺乏明确文本描述的情况下。这对于图像内容理解等应用尤为重要。 
  3. 跨领域应用:该研究的方法和发现可以激励跨领域的研究和应用,比如在艺术创作、虚拟现实、增强现实中,用于提高图像和视频的质量和互动性。 
  4. 长期展望:随着技术的进步,这些方法可能会进一步完善,带来更先进的图像生成和内容理解技术。 

团队介绍

智能创作团队是字节跳动AI&多媒体技术中台,覆盖了计算机视觉、音视频编辑、特效处理等技术领域,借助公司丰富的业务场景、基础设施资源和技术协作氛围,实现了前沿算法-工程系统-产品全链路的闭环,旨在以多种形式为公司内部各业务提供业界前沿的内容理解、内容创作、互动体验与消费的能力和行业解决方案。 

目前,智能创作团队已通过字节跳动旗下的云服务平台火山引擎向企业开放技术能力和服务。更多大模型算法相关岗位开放中,欢迎点击「阅读原文」查看。

以上就是字节复旦团队创新的「元提示」策略提升了扩散模型图像理解的性能,达到了前所未有的水平!的详细内容,更多请关注其它相关文章!


# 上海  # 昆山网站推广工作招聘  # 锐酷营销seo优化  # 湖北seo快速优化  # 外贸网站建设与推广方案模板下载  # 茶语网seo部门  # 我的网站建设管理文案  # 游戏直播推广资源网站  # 自己做网站建设  # 武汉学seo网站优化  # 开发区营销推广活动总结  # 中国  # 模型  # 应用于  # 达到了  # 开源  # 丰田  # 这一  # 中国科学院  # 多个  # 复旦  # stable diffusion  # 训练 


相关栏目: 【 Google疑问12 】 【 Facebook疑问10 】 【 优化推广96088 】 【 技术知识133117 】 【 IDC资讯59369 】 【 网络运营7196 】 【 IT资讯61894


相关推荐: AI 作画工具 Midjourney 推出“pan”功能,可平移扩展图片外场景  鸿蒙生态带来了哪些新的流量可能性,包括AI、服务分发和原生智能等方面?  讯飞星火大模型实现升级 助力通用人工智能人才培养  你大脑中的画面,现在可以高清还原了  中国最强AI研究院的大模型为何迟到了  上海发布“元宇宙关键技术攻关行动方案”,加快 AIGC 等突破  360发布认知型通用大模型“360智脑4.0” 全面接入360全家桶  云深处科技绝影 Lite3 与 X20 四足机器人亮相  机构:边缘AI或是当前预期差最大的AI方向  Goodnotes 6推出,带来多项全新AI功能,让电子笔记更智能  调查:过半数艺术家认为 AI 作图无法帮助他们的工作  pixivFANBOX 更新运营规则,禁止通过外链绕开 AI 生成禁令  数字彩排、虚拟建厂!这家顶级洗衣机工厂敲开“工业元宇宙”之门  全新“AI助手”!讯飞星火助手中心人机协作共创新生态  社区里,孩子们体验“机器人竞技”  6月14日《星空下的对话》 张朝阳陆川将畅聊人生、电影、心理学与AI  数据科学,解码智能未来——Altair首次提出“Frictionless AI”概念  马斯克嘲讽人工智能:机器学习本质就是统计学  华为云盘古大模型3.0发布 AI云服务同时上线:200亿亿次性能  金山办公宣布与英伟达团队合作,加速WPS AI服务  GPT-4使用混合大模型?研究证明MoE+指令调优确实让大模型性能超群  人工智能加速走进百姓生活:从2025全球人工智能技术大会看行业新趋势  Moka发布AI原生HR SaaS产品“Moka Eva”,布局AGI时代  成功孵化首个大型模型解决方案的重庆人工智能创新中心  华为余承东表示:鸿蒙可能拥有强大的人工智能大模型能力  零AI含量!纯随机数学无限生成逼真3D世界火了,普林斯顿华人一作  日本演员工会提出AI立法建议 要求建立“声音肖像权”  OpenOOD更新v1.5:全面、精确的分布外检测代码库及测试平台,支持在线排行榜、一键测试  陈丹琦ACL学术报告来了!详解大模型「*」数据库7大方向3大挑战,3小时干货满满  马斯克“揭秘”人工智能真面目  为AI而服务设计:构建以人为本的AI创新方法  学界业界大咖探讨:AI对数字艺术创新的推动力  微软向美国政府提供GPT大模型,如何保证安全性?  腾讯TRS之元学习与跨域推荐的工业实战  工业机器人及非标自动化设备集成服务提供商  AI赋能艺术 超现实达利奇幻之旅在沪开启  助力人工智能产业高质量发展 龙岗区算法训练基地正式启用  报道称亚马逊正在测试AI生成产品评价摘要  小米创始人雷军将揭示小米AI在年度演讲中的最新进展  纪录片 《寻找人工智能》全集1080P超清  本届人工智能大会上的这个“镇馆之宝”,来自长宁企业西井科技!  企业软件行业更将被AI全面重构!Moka李国兴:未来优秀组织和个人将一定是善于使用AI生产力的  微软商店 AI 摘要功能开启预览,帮助用户迅速了解应用评价  能走、能飞、能游泳,科学家打造全能 M4 机器人  陈根:AI冥想教练为用户提供个性化指导  元宇宙迈入2.0时代,它和生成式人工智能有何关联吗?  人工智能行业急缺人 AI人才年薪能达近42万元  全场景智能车:智能无处不在|芯驰亮相世界人工智能大会  读创正式上线“读创AI聊”功能  美图秀秀发布7款AI产品:支持用户创作、商业创作 

 2024-01-17

了解您产品搜索量及市场趋势,制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求,1小时内享受我们的专业解答。

运城市盐湖区信雨科技有限公司


运城市盐湖区信雨科技有限公司

运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。

 8156699

 13765294890

 8156699@qq.com

Notice

We and selected third parties use cookies or similar technologies for technical purposes and, with your consent, for other purposes as specified in the cookie policy.
You can consent to the use of such technologies by closing this notice, by interacting with any link or button outside of this notice or by continuing to browse otherwise.