Stable Diffusion 3 的论文终于来了!
这个模型于两周前发布,采用了与 Sora 相同的 DiT(Diffusion Transformer)架构,一经发布就引起了不小的轰动。
与之前版本相比,Stable Diffusion 3 生成的图质量有了显著提升,现在支持多主题提示,并且文字书写效果也得到了改善,不再出现乱码情况。
Stability AI 指出,Stable Diffusion 3 是一个系列模型,其参数量从800M到8B不等。这一参数范围意味着该模型可以在许多便携设备上直接运行,从而显著降低了使用AI大型模型的门槛。
在最新发布的论文中,Stability AI 表示,在基于人类偏好的评估中,Stable Diffusion 3 优于当前最先进的文本到图像生成系统,如 DALL・E 3、Midjourney v6 和 Ideogram v1。不久之后,他们将公开该研究的实验数据、代码和模型权重。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
在论文中,Stability AI 透露了关于 Stable Diffusion 3 的更多细节。

对于文本到图像的生成,Stable Diffusion 3 模型必须同时考虑文本和图像两种模式。因此,论文作者称这种新架构为 MMDiT,意指其处理多种模态的能力。与之前版本的 Stable Diffusion 一样,作者使用预训练模型来推导合适的文本和图像表征。具体来说,他们使用了三种不同的文本嵌入模型 —— 两种 CLIP 模型和 T5—— 来编码文本表征,并使用改进的自编码模型来编码图像 token。

Stable Diffusion 3 模型架构。

改进的多模态扩散 transformer:MMDiT 块。
SD3 架构基于 Sora 核心研发成员 William Peebles 和纽约大学计算机科学助理教授谢赛宁合作提出的 DiT。由于文本嵌入和图像嵌入在概念上有很大不同,因此 SD3 的作者对两种模态使用两套不同的权重。如上图所示,这相当于为每种模态设置了两个独立的 transformer,但将两种模态的序列结合起来进行注意力运算,从而使两种表征都能在各自的空间内工作,同时也将另一种表征考虑在内。

在训练过程中测量视觉保真度和文本对齐度时,作者提出的 mmdit 架构优于 uvit 和 dit 等成熟的文本到图像骨干。
通过这种方法,信息可以在图像和文本 token 之间流动,从而提高模型的整体理解能力,并改善所生成输出的文字排版。正如论文中所讨论的那样,这种架构也很容易扩展到视频等多种模式。

得益于 Stable Diffusion 3 改进的提示遵循能力,新模型有能力制作出聚焦于各种不同主题和质量的图像,同时还能高度灵活地处理图像本身的风格。

Stable Diffusion 3 采用 Rectified Flow(RF)公式,在训练过程中,数据和噪声以线性轨迹相连。这使得推理路径更加平直,从而减少了采样步骤。此外,作者还在训练过程中引入了一种新的轨迹采样
计划。他们假设,轨迹的中间部分会带来更具挑战性的预测任务,因此该计划给予轨迹中间部分更多权重。他们使用多种数据集、指标和采样器设置进行比较,并将自己提出的方法与 LDM、EDM 和 ADM 等 60 种其他扩散轨迹进行了测试。结果表明,虽然以前的 RF 公式在少步采样情况下性能有所提高,但随着步数的增加,其相对性能会下降。相比之下,作者提出的重新加权 RF 变体能持续提高性能。

作者利用重新加权的 Rectified Flow 公式和 MMDiT 骨干对文本到图像的合成进行了扩展(scaling)研究。他们训练的模型从带有 450M 个参数的 15 个块到带有 8B 个参数的 38 个块不等,并观察到验证损失随着模型大小和训练步骤的增加而平稳降低(上图的第一行)。为了检验这是否转化为对模型输出的有意义改进,作者还评估了自动图像对齐指标(GenEval)和人类偏好分数(ELO)(上图第二行)。结果表明,这些指标与验证损失之间存在很强的相关性,这表明后者可以很好地预测模型的整体性能。此外,scaling 趋势没有显示出饱和的迹象,这让作者对未来继续提高模型性能持乐观态度。
通过移除用于推理的内存密集型 4.7B 参数 T5 文本编码器,SD3 的内存需求可显著降低,而性能损失却很小。如图所示,移除该文本编码器不会影响视觉美感(不使用 T5 时的胜率为 50%),只会略微降低文本一致性(胜率为 46%)。不过,作者建议在生成书面文本时加入 T5,以充分发挥 SD3 的性能,因为他们观察到,如果不加入 T5,生成排版的性能下降幅度更大(胜率为 38%),如下图所示:

只有在呈现涉及许多细节或大量书面文本的非常复杂的提示时,移除 T5 进行推理才会导致性能显著下降。上图显示了每个示例的三个随机样本。
作者将 Stable Diffusion 3 的输出图像与其他各种开源模型(包括 SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α)以及闭源模型(如 DALL-E 3、Midjourney v6 和 Ideogram v1)进行了比较,以便根据人类反馈来评估性能。在这些测试中,人类评估员从每个模型中获得输出示例,并根据模型输出在多大程度上遵循所给提示的上下文(prompt following)、在多大程度上根据提示渲染文本(typography)以及哪幅图像具有更高的美学质量(visual aesthetics)来选择最佳结果。

以 SD3 为基准,这个图表概述了它在基于人类对视觉美学、提示遵循和文字排版的评估中的胜率。
Machine Translation
聚合多个来源的AI翻译
49
查看详情
从测试结果来看,作者发现 Stable Diffusion 3 在上述所有方面都与当前最先进的文本到图像生成系统相当,甚至更胜一筹。
在消费级硬件上进行的早期未优化推理测试中,最大的 8B 参数 SD3 模型适合 RTX 4090 的 24GB VRAM,使用 50 个采样步骤生成分辨率为 1024x1024 的图像需要 34 秒。

此外,在最初发布时,Stable Diffusion 3 将有多种变体,从 800m 到 8B 参数模型不等,以进一步消除硬件障碍。


更多细节请参考原论文。
参考链接:https://stability.ai/news/stable-diffusion-3-research-paper
以上就是Stable Diffusion 3论文终于发布,架构细节大揭秘,对复现Sora有帮助?的详细内容,更多请关注其它相关文章!
# 论文
# 进行了
# 移除
# 胜率
# 两种
# 开源
# 大揭秘
# pl
# midjourney
# stable diffusion
# sora
# follow
# 技术
# ai
# ideogram
# 信阳网站建设渠道有哪些
# 上海志愿军陵园网站建设
# 滨海新区推广网站
# seo网站怎么吸引客户
# 昌邑网站seo推广营销
# 成都小型网站建设
# 点点客微网站建设
# 中山网站seo推广方案
# 网站优化电话营销话术
# 上海全网营销推广哪里好
# 谁能
# 上图
# 模态
# 过程中
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
先进技术在防止全球数据丢失方面的作用
朱民:普通人炒股炒不过机器人是很正常的 AI已经能理解市场情绪
探展WAIC | 第四范式“式说”聚焦toB大模型,布局生成式AI重构企业软件
京东 AI 大模型官宣 7 月 13 日发布,还有重磅合作
微软新出热乎论文:Transformer扩展到10亿token
在心理治疗中用VR技术,治疗成效显著提高
微软AR/VR专利提出使用时间复用谐振驱动产生双极性电源
美图设计室2.0新增哪些功能
“踩油门,也要会踩刹车” 互联网企业高管谈人工智能发展
云鲸发布全新的扫拖机器人J4系列
智能技术提高现代商业运营的7七种方式
解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能
学而思推出AI第一课:基于自研大模型的AIGC课程
特斯拉 Optimus 人形机器人入驻北美门店,帮助提升汽车销量
AI新视野,增长新势能,伙伴云受邀出席笔记侠创业讲真话AI峰会
一文看懂被英伟达看中的九号机器人移动底盘
靠游戏更靠AI 英伟达成唯一首季度两位数增长的公司
Meta Connect 2025已确定时间为9月27-28,主题涵盖Quest 3与AI技术
中科院自研新一代 AI 大模型“紫东太初 2.0”问世
尼康尼克尔Z 180-600mm f/5.6-6.3 VR镜头发布:12499元 拍鸟神器
创作音乐/音频的Meta开源AI工具AudioCraft,让用户通过文本提示实现
抛媚眼给瞎子看?微软、谷歌的AI广告被广告主抵制
一句话搞定数据分析,浙大全新大模型数据助手,连搜集都省了
音乐制作元工具AudioCraft发布开源AI工具
曝光HarmonyOS 4的重要新能力:全面升级AI大模型,小艺实现全面进化
1000万张照片训练AI模型 科学家找到水下定位新方法
AI在教育中的角色:AI如何改变我们的学习方式
宇宙探索下一阶段,机器代替人类,AI会在太空探索中取代人类吗?
人工智能颠覆软件测试四大方式
阿里云全面支持Llama2训练部署,助力企业快速构建自有大型模型
Gartner发布中国企业人工智能趋势浪潮3.0
小艺主导智慧交互升级,借助AI大模型增强能力
2025 WAIC|美团无人机发布第四代新机型
美图影像节演讲实录:191次提及AI,发布7款影像生产力工具
国产工业机器人领域“暗潮涌动”,即将迎来新一轮复苏
为了避免人工智能可能带来的灾难,我们要向核安全学习
马斯克称未来机器人数量将多于人类,特斯拉愿共享自动驾驶技术
硅谷人工智能研究院创始人皮埃罗·斯加鲁菲:Transformer模型演讲
赋能选题探索:AI助手在经济学专业中的应用指南
Meta发布语音AI模型 Voicebox 助虚拟助手与NPC对话
当人工智能开始写高考作文?作家陈崇正、朱山坡谈文学与未来
DeepMind用AI重写排序算法;将33B大模型塞进单个消费级GPU
BLIP-2、InstructBLIP稳居前三!十二大模型,十六份榜单,全面测评「多模态大语言模型」
OPPO三方联合发布AI可持续发展白皮书,坚持发展健康AI生态
机器人 展才能
PS AI修图免费平替来了!Stability AI又放大招,核弹级更新一键扩图
引领AI变革,九章云极DataCanvas公司重磅发布AIFS+DataPilot
英国前首相:AI可能被用来制造“生物恐怖武器”
探展WAIC |万向区块链杜宇:不存在单一技术的iPhone时刻,Web3.0核心将基于AI+区块链+物联网
售价14.99万起!小米汽车部分信息疑遭AI曝光,内部人士回应:网传图片明显经过处理,不可轻信
2024-03-06
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。