在 AIGC 的神奇世界里,我们可以在图像上通过「拖曳」的方式,改变并合成自己想要的图像。比如让一头狮子转头并张嘴:

实现这一效果的研究出自华人一作领衔的「Drag Your GAN」论文,于上个月放出并已被 SIGGRAPH 2025 会议接收。
一个多月过去了,该研究团队于近日放出了官方代码。短短三天时间,Star 量便已突破了 23k,足可见其火爆程度。
图片
github 地址:https://github.com/xingangpan/draggan
无独有偶,今日又一项类似的研究 —— DragDiffusion 进入了人们的视线。此前的 DragGAN 实现了基于点的交互式图像编辑,并取得像素级精度的编辑效果。但是也有不足,DragGAN 是基于生成对抗网络(GAN),通用性会受到预训练 GAN 模型容量的限制。
在新研究中,新加坡国立大学和字节跳动的几位研究者将这类编辑框架扩展到了扩散模型,提出了 DragDiffusion。他们利用大规模预训练扩散模型,极大提升了基于点的交互式编辑在现实世界场景中的适用性。
虽然现在大多数基于扩散的图像编辑方法都适用于文本嵌入,但 DragDiffusion 优化了扩散潜在表示,实现了精确的空间控制。
图片
研究者表示,扩散模型以迭代方式生成图像,而「一步」优化扩散潜在表示足以生成连贯结果,使 DragDiffusion 高效完成了高质量编辑。
他们在各种具有挑战性的场景(如多对象、不同对象类别)下进行了广泛实验,验证了 DragDiffusion 的可塑性和通用性。相关代码也将很快放出、
下面我们看看 DragDiffusion 效果如何。
首先,我们想让下图中的小猫咪的头再抬高一点,用户只需将红色的点拖拽至蓝色的点就可以了:

接下来,我们想让山峰变得再高一点,也没有问题,拖拽红色关键点就可以了:
图片
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
还想让雕塑的头像转个头,拖拽一下就能办到:
图片
让岸边的花,开的范围更广一点:
ChatGPT Writer
免费 Chrome 扩展程序,使用 ChatGPT AI 生成电子邮件和消息。
106
查看详情

本文提出的 DRAGDIFFUSION 旨在优化特定的扩散潜变量,以实现可交互的、基于点的图像编辑。
为了实现这一目标,该研究首先在扩散模型的基础上微调 LoRA,以重建用户输入图像。这样做可以保证输入、输出图像的风格保持一致。
接下来,研究者对输入图像采用 DDIM inversion(这是一种探索扩散模型的逆变换和潜在空间操作的方法),以获得特定步骤的扩散潜变量。
在编辑过程中,研究者反复运用动作监督和点跟踪,以优化先前获得的第 t 步扩散潜变量,从而将处理点的内容「拖拽(drag)」到目标位置。编辑过程还应用了正则化项,以确保图像的未掩码区域保持不变。
最后,通过 DDIM 对优化后的第 t 步潜变量进行去噪,得到编辑后的结果。总体概览图如下所示:
图片
给定一张输入图像,DRAGDIFFUSION 将关键点(红色)的内容「拖拽」到相应的目标点(蓝色)。例如在图(1)中,将小狗的头转过来,图(7)将老虎的嘴巴合上等等。
图片
下面是更多示例演示。如图(4)将山峰变高,图(7)将笔头变大等等。
图片

以上就是DragGAN开源三天Star量23k,这又来一个DragDiffusion的详细内容,更多请关注其它相关文章!
# 环比
# seo专员和网站编辑
# 日照seo优化排名招商
# 增城seo霸屏推广
# 云南百度网站关键词排名
# seo技术厂商
# seo原创文章代写
# 贵阳市百度网站优化推广
# 津南区网站优化推广
# 桓台网站推广招聘信息
# 福建谷歌关键词排名
# 图片
# 合上
# 上半年
# 就可以
# 营收
# 中国
# 想让
# 拖拽
# 这又
# 开源
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
美图秀秀“AI 扩图”功能上线,可根据图像生成更大画幅
一文读懂自动驾驶的激光雷达与视觉融合感知
华为即将推出HarmonyOS 4,再度领先行业的AI技术
杀入生成式AI的亚马逊云科技,能否再次生成未来?
人工智能“Aria”现身 Opera浏览器100版本更新:新功能“标签岛”
6月14日《星空下的对话》 张朝阳陆川将畅聊人生、电影、心理学与AI
央视报道!星纪魅族集团车载人机交互技术成世界移动通信大会焦点
改动一行代码,PyTorch训练三倍提速,这些「高级技术」是关键
基于信息论的校准技术,CML让多模态机器学习更可靠
机器人技能大比拼
大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用
酒店业将如何受益于人工智能的改变?
纪录片 《寻找人工智能》全集1080P超清
V社谈AI制作游戏被ban:为确保开发者有素材所有权
建立元宇宙产业联盟:移动、咪咕、华为、小米等加入
“黑科技”亮相大湾区轨交论坛 智慧交通迈向“强AI”
生成式AI与云结合,机遇与挑战并存
AI成政客博弈工具,美国大选真假难辨,律师们的生意来了
小米创始人雷军将揭示小米AI在年度演讲中的最新进展
苹果头显降临,AI虚拟人的救星还是流星?
AI立法迫在眉睫,如何看对行业影响?
统信深度deepin成立 AI SIG 社区,共同提升 Linux 下 AI 体验
微幼科技晨检机器人:幼儿园健康保障的新伙伴
Databricks 发布大数据分析平台 Spark 用 AI 模型 SDK:一键生成 SQL 及 FySpark 语言图表代码
AI框架生态峰会本周开幕 华为昇腾“朋友圈”再聚首 全球首个全模态大模型将登场
国产医疗企业的人工智能
Meta发布语音AI模型 Voicebox 助虚拟助手与NPC对话
WHEE安装教程
鸿蒙智能座舱的AI大模型革新,引领智能座舱领域的变革吗?
灯塔AI大模型票房预测上线:开源算法不断提升精准度
最大助力35公斤 外骨骼机器人或在养老、医疗领域“大展身手”
视觉中国宣布推出AI灵感绘图、画面扩展功能
人工智能如何用于家庭安全
传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台
华为HarmonyOS 4:享流畅提升20%,AI大模型更智能一览无余
亲身体验鸿蒙4:AI大模型带来的便利,告别单纯的旁观者状态
看懂AI,找到增长新势能 | 笔记侠AI峰会等你来
七大主流AI企业包括OpenAI、谷歌等联合承诺:引入水印技术,并允许第三方审核AI内容
人工智能自己玩自己
马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了
对话式论文阅读工具PaperMate上线,综述细节AI告诉你
DeepMind推惊世排序算法,C++库忙更新!
换流站无线物联网络为新型电力系统铺设“数字之路”
在心理治疗中用VR技术,治疗成效显著提高
以计算机视觉技术为基础的库存管理如何改革零售行业
改变城市交通:智慧城市中的智能交通
尼康尼克尔 Z 180-600mm f/5.6-6.3 VR 镜头发布,12499 元
中科院自研新一代 AI 大模型“紫东太初 2.0”问世
美图发布国内首个“懂美学的”AI视觉大模型MiracleVision
即时 AI再次升级 30秒生成自带动效的网页 生成速度提升100%
2023-06-28
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。