AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述


AI 生成内容已经成为当前人工智能领域的最热门话题之一,也代表着该领域的前沿技术。近年来,随着 Stable Diffusion、DALL-E3、ControlNet 等新技术的发布,AI 图像生成和编辑领域实现了令人惊艳的视觉效果,并且在学术界和工业界都受到了广泛关注和探讨。这些方法大多基于扩散模型,而这正是它们能够实现强大可控生成、照片级生成以及多样性的关键所在。

然而,与简单的静态图像相比,视频具有更为丰富的语义信息和动态变化。视频能够展示实物的动态演变过程,因此在视频生成和编辑领域的需求和挑战更为复杂。尽管在这个领域,受限于标注数据和计算资源的限制,视频生成的研究一直面临困难,但是一些代表性的研究工作,比如 Make-A-Video、Imagen Video 和 Gen-2 等方法,已经开始逐渐占据主导地位。

这些研究工作引领着视频生成和编辑技术的发展方向。研究数据显示,自从 2025 年以来,关于扩散模型在视频任务上的研究工作呈现出爆炸式增长的态势。这种趋势不仅体现了视频扩散模型在学术界和工业界的受欢迎程度,同时也凸显了该领域的研究者们对于视频生成技术不断突破和创新的迫切需求。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述


近期,复旦大学视觉与学习实验室联合微软、华为等学术机构发布了首个关于扩散模型在视频任务工作的综述,系统梳理了扩散模型在视频生成、视频编辑以及视频理解等方向的学术前沿成果。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

  • 论文链接:https://arxiv.org/abs/2310.10647
  • 主页链接:https://github.com/ChenHsing/Awesome-Video-Diffusion-Models

视频生成

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

基于文本的视频生成:自然语言作为输入的视频生成是视频生成领域最为重要的任务之一。作者首先回顾了扩散模型提出之前该领域的研究成果,然后分别介绍了基于训练的和无需训练的文本 - 视频生成模型。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

Christmas tree holiday celebration winter snow animation.

基于其他条件的视频生成:细分领域的视频生成工作。作者将它们归类为基于以下的条件:姿势(pose-guided)、动作(motion-guided)、声音(sound-guided)、图像(image-guided)、深度图(depth-guided)等。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述


AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

无条件的视频生成:该任务指的是在特定领域中无需输入条件的视频生成,作者根据模型架构主要分为基于 U-Net 和基于 Transformer 的生成模型。

视频补全:主要包括视频增强和恢复、视频预测等任务。

数据集:视频生成任务所用到的数据集可分为以下两类:

1.Caption-level:每个视频都有与之对应的文本描述信息,最具代表性的就是 WebVid10M 数据集。

2.Category-level:视频只有分类标签而没有文本描述信息,UCF-101 是目前在视频生成、视频预测等任务上最常用的数据集。

评价指标与结果对比:视频生成的评价指标主要分为质量层面的评价指标和定量层面的评价指标,质量层面的评价指标主要是基于人工主观打分的方式,而定量层面的评价指标又可以分为:

1. 图像层面的评价指标:视频是由一系列的图像帧所组成的,因此图像层面的评估方式基本上参照 T2I 模型的评价指标。

2. 视频层面的评价指标:相比于图像层面的评价指标更偏向于逐帧的衡量,视频层面的评价指标能够衡量生成视频的时序连贯性等方面。

此外,作者还将前述提到的生成模型在基准数据集上的评价指标进行了横向比较。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

视频编辑

通过对许多研究的梳理,作者发现视频编辑任务的核心目标在于实现:

1. 保真度(fidelity):编辑后的视频的对应帧应当与原视频在内容上保持一致。

2. 对齐性(alignment):编辑后的视频需要和输入的条件保持对齐。

Voicepods Voicepods

Voicepods是一个在线文本转语音平台,允许用户在30秒内将任何书面文本转换为音频文件。

Voicepods 142 查看详情 Voicepods

3. 高质量(high quality):编辑后的视频应当是连贯且高质量的。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

基于文本的视频编辑:考虑到现有文本 - 视频数据规模有限,目前大多数基于文本的视频编辑任务都倾向于利用预训练的 T2I 模型,在此基础上解决视频帧的连贯性和语义不一致性等问题。作者进一步将此类任务细分为基于训练的(training-based)、无需训练的(training-free)和一次性调优的(one-shot tuned)方法,分别加以总结。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述


AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

基于其他条件的视频编辑:随着大模型时代的到来,除了最为直接的自然语言信息作为条件的视频编辑,由指令、声音、动作、多模态等作为条件的视频编辑正受到越来越多的关注,作者也对相应的工作进行了分类梳理。

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

特定细分领域的视频编辑:一些工作关注到在特定领域对视频编辑任务有特殊定制化的需求,例如视频着色、人像视频编辑等。

视频理解

AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述

扩散模型在视频领域的应用已远不止传统的视频生成和编辑任务,它在视频理解任务上也展现了出巨大的潜能。通过对前沿论文的追踪,作者归纳了视频时序分割、视频异常检测、视频物体分割、文本视频检索、动作识别等 10 个现有的应用场景。

未来与总结

该综述全面细致地总结了 AIGC 时代扩散模型在视频任务上的最新研究,根据研究对象和技术特点,将百余份前沿工作进行了分类和概述,在一些经典的基准(benchmark)上对这些模型进行比较。此外,扩散模型在视频任务领域也还有一些新的研究方向和挑战,如:

1. 大规模的文本 - 视频数据集收集:T2I 模型的成功离不开数以亿计高质量的文本 - 图像数据集,同样地,T2V 模型也需要大量无水印、高分辨率的文本 - 视频数据作为支撑。

2. 高效的训练和推理:视频数据相比于图像数据规模巨大,在训练和推理阶段所需要的算力也呈几何倍数增加,高效的训练和推理算法能极大地降低成本。

3. 可靠的基准和评价指标:现有视频领域的评价指标往往在于衡量生成视频与原视频在分布上的差异,而未能全面衡量生成视频的质量。同时,目前用户测试仍然是重要的评估方式之一,考虑到其需要大量人力且主观性强,因此迫切需要更为客观全面的评价指标。

以上就是AIGC时代的视频扩散模型,复旦等团队发布领域首篇综述的详细内容,更多请关注其它相关文章!


# 训练  # 伊犁优化网站  # 服务好的酒店网站建设  # 玉溪抖音seo公司费用  # 青岛大型网站建设  # 牛发网 seo547.cn  # 潍坊校园网站推广  # 网站设计建设方案怎么写  # 网站排名优化 在线宙d9斯真行  # 搜索关键词快速排名  # 上海  # 考虑到  # 进行了  # 自然语言  # 丰田  # 高质量  # 中国科学院  # 视频编辑  # 评价指标  # 复旦  # controlnet  # stable diffusion  # 模型  # 菏泽网站建设开户 


相关栏目: 【 Google疑问12 】 【 Facebook疑问10 】 【 优化推广96088 】 【 技术知识133117 】 【 IDC资讯59369 】 【 网络运营7196 】 【 IT资讯61894


相关推荐: 普林斯顿大学推出 Infinigen AI 模型,生成真实自然环境 3D 场景  2025WRC世界机器人大赛锦标赛(烟台)收官!斯坦星球勇夺VEX赛项冠亚军!  机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展  6月14日《星空下的对话》 张朝阳陆川将畅聊人生、电影、心理学与AI  探展WAIC | 第四范式“式说”聚焦toB大模型,布局生成式AI重构企业软件  提升工作效率的智能工具:Zapier 让工作变得更简单!  五个IntelliJ IDEA插件,高效编写代码  谷歌 Gmail“帮我写电子邮件”AI 功能开始向安卓和苹果设备推广  传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台  轻量级的深度学习框架Tinygrad  AI 助手 Copilot 上线,微软 Win11 Dev 预览版 Build 23493 发布  如何用AI重塑你的工作流(一)  阿里达摩院向公众免费开放100项AI专利许可  世界人工智能大会中西部县域数字就业中心组团亮相  抢占新赛道 加快机器人产业集聚发展  谷歌在人工智能领域没有“护城河”?  马斯克发推讽刺人工智能,机器学习本质是统计?  优化系统韧性:故障恢复与监控在RabbitMQ中的应用  走进首家“元宇宙”未来工厂,卡奥斯探知工业之旅出发!  引领AI变革,九章云极DataCanvas公司重磅发布AIFS+DataPilot  航拍无人机怎么选?大疆无人机盘点推荐  测试框架-安全和自动驾驶  Meta发布音频AI模型,仅需2秒片段模拟真人语音  MiracleVision视觉大模型  “思享荟”沙龙热议AIGC与元宇宙 复旦大学赵星畅谈深度数字化  郭帆:AI发展日新月异,或是弯道超车好莱坞的最好机会  利好来了,AI再起一波?  移远通信率先完成多场5G NTN技术外场验证,为卫星物联网应用落地提速  MIT开发“PhotoGuard”技术保护图像免遭恶意AI编辑  人工智能产业竞跑“未来赛道” 创新发展放大“赋能”效应  上新7款产品,美图继续“蹭”AI  软通动力多项AI创新产品及应用亮相2025世界人工智能大会  烟台大学学生首次在全国大学生无人机航拍竞赛中获奖  中国电信AI能力通过国家级金融领域权威认证并荣膺AI国际头部竞赛冠军  为什么很多人对纽约《人工智能招聘法》感到生气?  当人工智能开始写高考作文?作家陈崇正、朱山坡谈文学与未来  国内阅读行业首款对话式AI应用“阅爱聊”封闭内测  Meta 为打造元宇宙不惜下血本:VR 开发者年薪高达百万美元  央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天  编程版GPT狂飙30星,AutoGPT危险了!  华为云发布华为云盘古模型3.0和升腾AI云服务,亮点亮相2025华为开发者大会  人脸识别+全景双摄+AI算法 萤石推动智能锁行业革新  人工智能赋能无人驾驶:商业化进程再提速  全新升级的广州麦当劳:面积最大餐厅正式引入智慧机器人  杭州举办第19届亚运会,主题为「亚运元宇宙」的发布仪式举行  联想首发AI PC于今年秋季,英特尔CEO确认AI PC时代来临  IBM与NASA联手开源地理空间AI基础模型,促进气候科学领域进步  pixivFANBOX 更新运营规则,禁止通过外链绕开 AI 生成禁令  《共同的演化》展览启幕,重新思考人类与人工智能关系  OpenAI宣布在伦敦设立海外分部,要招揽“世界级人才” 

 2023-10-23

了解您产品搜索量及市场趋势,制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求,1小时内享受我们的专业解答。

运城市盐湖区信雨科技有限公司


运城市盐湖区信雨科技有限公司

运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。

 8156699

 13765294890

 8156699@qq.com

Notice

We and selected third parties use cookies or similar technologies for technical purposes and, with your consent, for other purposes as specified in the cookie policy.
You can consent to the use of such technologies by closing this notice, by interacting with any link or button outside of this notice or by continuing to browse otherwise.