在gpt等大模型出现后,语言模型这种transformer+自回归建模的方式,也就是预测next token的预训练任务,取得了非常大的成功。那么,这种自回归建模方式能不能在视觉模型上取得比较好的效果呢?今天介绍的这篇文章,就是apple近期发表的基于transformer+自回归预训练的方式训练视觉模型的文章,下面给大家展开介绍一下这篇工作。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片
论文标题:Scalable Pre-training of Large Autoregressive Image Models
下载地址:https://arxiv.org/pdf/2401.08541v1.pdf
开源代码:https://github.com/apple/ml-aim
模型结构基于Transformer,并采用语言模型中的next token prediction作为优化目标。主要修改有三个方面。首先,与ViT不同,本文采用GPT的单向attention,即每个位置的元素只与前面的元素计算attention。其次,我们引入了更多的上下文信息,以提高模型的语言理解能力。最后,我们优化了模型的参数设置,以进一步提升性能。通过这些改进,我们的模型在语言任务上取得了显著的性能提升。
图片
在Transformer模型中,引入了一个新的机制,即在输入序列前面加入了多个prefix token。这些token采用了双向attention机制。这一变化的主要目的是为了增强预训练和下游应用之间的一致性。在下游任务中,类似于ViT的双向attention方法被广泛使用。通过在预训练过程中引入prefix双向attention,模型可以更好地适应各种下游任务的需求。这样的改进可以提高模型的性能和泛化能力。
图片
在模型最终输出MLP层的优化方面,原先的预训练方法通常会丢弃掉MLP层,并在下游任务中使用一个全新的MLP。这是为了避免预训练的MLP过于偏向预训练任务,导致下游任务的效果下降。然而,在本文中,作者提出了一种新的方法。他们对每个patch都使用一个独立的MLP,同时也采用了各个patch的表征与attention融合的方式来代替传统的pooling操作。这样一来,预训练的MLP head在下游任务中的可用性得到了提升。通过这种方法,作者能够更好地保留图像整体的信息,并且避免了过度依赖预训练任务的问题。这对于提高模型的泛化能力和适应性非常有帮助。
在优化目标上,文中尝试了两种方法,第一种是直接拟合patch像素,用MSE进行预测。第二种是提前对图像patch进行tokenize,转换成分类任务,用交叉熵损失。不过在文中后续的消融实验中发现,第二种方法虽然也可以让模型正常训练,但是效果并不如基于像素粒度MSE的效果更好。
Machine Translation
聚合多个来源的AI翻译
49
查看详情
文中的实验部分详细分析了这种基于自回归的图像模型的效果,以及各个部分对于效果的影响。
首先,随着训练的进行,下游的图像分类任务效果越来越好了,说明这种预训练方式确实能学到良好的图像表征信息。
图片
在训练数据上,使用小数据集的训练会导致overfitting,而使用DFN-2B虽然最开始验证集loss较大,但是没有
明显的过拟合问题。
图片
对于模型各个模块的设计方式,文中也进行了详细的消融实验分析。
图片
在最终的效果对比上,AIM取得了非常不错的效果,这也验证了这种自回归的预训练方式在图像上也是可用的,可能会成为后续图像大模型预训练的一种主要方式。
图片
以上就是苹果公司采用自回归语言模型进行图像模型的预训练的详细内容,更多请关注其它相关文章!
# 中国
# 陇南网站建设
# 十堰网站优化推广找哪家
# 女生做seo好不好
# 网站和优化哪个好做
# 迅雷游戏网站建设方案
# 企尚网络网站建设
# 湖北网站推广电商招聘
# 直播营销推广优势有哪些
# 微营销怎么推广
# 丽江网站推广费用多少钱
# 这是
# 模型
# 上海
# 采用了
# 取得了
# 多个
# 开源
# 丰田
# 中国科学院
# 苹果公司
# 预训练
# 图像
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
五个IntelliJ IDEA插件,高效编写代码
360发布AI数字人广场,可同孙悟空、爱因斯坦等古今中外角色对话
世界人工智能大会|“AI领航,共筑未来”高端保险论坛成功举办
人工智能如何帮助制造业?
美图秀秀发布7款AI产品:支持用户创作、商业创作
腾讯企点客服接待与营销分析能力升级!企业操作更高效、人机交互更智能
解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能
面向AI大模型,腾讯云首次完整披露自研星脉高性能计算网络
好莱坞面临全面停摆 好莱坞大罢工抵制“AI入侵”
布局智能物联新时代,中国移动“5G+物联网”亮相2025 MWC
“无人驾驶船”将首次亮相世界人工智能大会,下半年或开进上海迪士尼
AI浪潮席卷,时空壶为何能成为AI翻译时代的破局者
Adobe旗下Illustrator引入生成式AI工具Firefly
实现MySQL数据锁定策略:解决并发冲突的J*a解决方案
AI和ML推动联网设备的增长
2025世界人工智能大会(上海)开幕式纪要
提升工作效率的智能工具:Zapier 让工作变得更简单!
智能机器人正在彻底改变客户服务
原小米 9 号员工李明打造全球首款 AI 安卓桌面机器人
美图设计室2.0使用教程
亚马逊确认今年不举办re:MARS人工智能大会
OPPO三方联合发布AI可持续发展白皮书,坚持发展健康AI生态
IBM和NASA合作发布可追踪碳排放的开源AI基础模型
绿联发布笑脸屏幕显示充电状态的30W/65W Q湃机器人充电器
「电子果蝇」惊动马斯克!背后是13万神经元全脑图谱,可在电脑上运行
阿里云全面支持Llama2训练部署,助力企业快速构建自有大型模型
刊·见 | 捕捉人工智能领域最新动态?收藏Applied Artificial Intelligence
小岛秀夫不反对使用AI 但认为人类应该凌驾于AI
懒人必备的家居清洁好物,石头自清洁扫拖机器人G20
基于预训练模型的金融事件分析及应用
传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台
ChatGPT 可以设计机器人吗?
谷歌推出 SAIF 框架,倡导安全环境下探索和发展人工智能
微软更新服务协议,以防止通过AI服务进行逆向工程和数据抓取
AI智能室内效果图设计软件效果,确实惊到我了!
V社谈AI制作游戏被ban:为确保开发者有素材所有权
《上古卷轴5》AI高清材质包优化游戏中所有怪物
【趋势周报】全球人工智能产业发展趋势:OpenAI向美国专利局提交“GPT-5”商标申请
AI+音乐如何“生成”动听旋律?一起揭秘世界人工智能大会开场曲
北交大推出国内首个开源交通大模型TransGPT,可免费商用
直击上影节 | 光线传媒董事长王长田谈新技术:未来VR放映效果可能媲美影院
鉴智机器人发布基于地平线征程5的标准视觉感知产品
0代码微调大模型火了,只需5步,成本低至150块
百度举办AIGC创作沙龙,现场传授AI绘画“咒语”技巧
让AI助手带您轻松愉快地享受写作之旅
人形机器人概念集体爆发,能买吗?
7/8上海 | 2025世界人工智能大会分论坛:科技与人文-共筑无障碍智能社会
OpenAI CEO 阿尔特曼到访日本,对全球 AI 协调合作表示乐观
麦肯锡:到 2045 年左右,将有 50% 工作被 AI 接管
微软在 Bing 和 Edge 浏览器中拓展网购服务,帮用户选购心仪产品
2024-01-29
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。