清华姚班校友陈丹琦,在acl 2025上做了场最新演讲!
话题还是近期非常热门的研究方向——
像GPT-3、PaLM这样的(大)语言模型,究竟是否需要依靠检索来弥补自身缺陷,从而更好地应用落地。
在这场演讲中,她和其他3位主讲人一起,共同介绍了这个主题的几大研究方向,包括训练方法、应用和挑战等。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片
演讲期间听众的反响也很热烈,不少网友认真地提出了自己的问题,几位演讲者尽力答疑解惑。
图片
至于这次演讲具体效果如何?有网友直接一句“推荐”给到评论区。
图片
所以,在这场长达3个小时的演讲中,他们具体讲了些什么?又有哪些值得一听的地方?
这场演讲的核心主题是“基于检索的语言模型”,包含检索和语言模型两个要素。
从定义上来看,它指的是给语言模型“*”一个数据检索库,并在进行推理(等操作)时对这个数据库进行检索,最后基于检索结果进行输出。
这类*数据存储库,也被称之为半参数模型或非参数模型。
图片
之所以要研究这个方向,是因为如GPT-3和PaLM这类(大)语言模型,在表现出不错的效果同时,也出现了一些让人头疼的“bug”,主要有三个问题:
1、参数量过大,如果基于新数据重训练,计算成本过高;
2、记忆力不行(面对长文本,记了下文忘了上文),时间一长会产生幻觉,且容易泄露数据;
3、目前的参数量,不可能记住所有知识。
在这种情况下,外部检索语料库被提出,即给大语言模型“*”一个数据库,让它随时能通过查找资料来回答问题,而且由于这种数据库随时能更新,也不用担心重训的成本问题。
介绍完定义和背景之后,就是这个研究方向具体的架构、训练、多模态、应用和挑战了。
在架构上,主要介绍了基于检索的语言模型检索的内容、检索的方式和检索的“时机”。
具体而言,这类模型主要会检索token、文本块和实体词语(entity mentions),使用检索的方式和时机也很多样性,是一类很灵活的模型架构。
图片
在训练方式上,则着重介绍了独立训练(independent training,语言模型和检索模型分开训练)、连续学习(sequential training)、多任务学习(joint training)等方法。
图片
至于应用方面,这类模型涉及的也就比较多了,不仅可以用在代码生成、分类、知识密集型NLP等任务上,而且通过微调、强化学习、基于检索的提示词等方法就能使用。
应用场景也很灵活,包括长尾场景、需要知识更新的场景以及涉及隐私安全的场景等,都有这类模型的用武之地。
当然,不止是文本上。这类模型也存在多模态扩展的潜力,可以将它用于文本以外的任务上。
图片
听起来这类模型优点很多,不过基于检索的语言模型,当下也存在一些挑战。
陈丹琦在最后“收尾”的演讲中,着重提到了几点这个研究方向需要解决的几大难题。
其一,小语言模型+(不断扩张的)大数据库,本质上是否意味着语言模型的参数量依旧很大?如何解决这一问题?
例如,虽然这类模型的参数量可以做到很小,只有70亿参数量,但*的数据库却能达到2T……
图片
其二,相似性搜索的效率。如何设计算法使得搜索效率最大化,是目前非常活跃的一个研究方向。
图片
其三,完成复杂语言任务。包括开放式文本生成任务,以及复杂的文本推理任务在内,如何用基于检索的语言模型完成这些任务,也是需要持续探索的方向。
图片
当然,陈丹琦也提到,这些话题是挑战的同时,也是研究机遇。还在寻找论文课题的小伙伴们,可以考虑是否把它们加进研究列表了~
值得一提的是,这次演讲也不是“凭空”找出的话题,4位演讲者贴心地在官网放出了演讲参考的论文链接。
从模型架构、训练方法、应用、多模态到挑战,如果对这些话题中的任何一部分感兴趣,都可以去官网找找对应的经典论文来看:
图片
这么干货满满的演讲,四位主讲人也不是没有来头,在演讲中他们还耐心地对听众提出的问题进行了解答。
网易人工智能
网易数帆多媒体智能生产力平台
233
查看详情
我们先来康康主讲人都是谁。
首先是主导这次演讲的普林斯顿大学计算机科学助理教授陈丹琦。
图片
她是计算机科学领域近来最受关注的华人青年学者之一,也是08级清华姚班校友。
在信息学竞赛圈,她颇具传奇色彩——CDQ分治算法就是以她的名字命名。2008年,她代表中国队斩获一枚IOI金牌。
而她的那篇长达 156 页的博士毕业论文《Neural Reading Comprehension and Beyond》,更是一度火爆出圈,不光获得当年斯坦福最佳博士论文奖,还成为了斯坦福大学近十年来最热门毕业论文之一。
现在,陈丹琦除了是普林斯顿大学计算机科学助理教授,也是该校从头搭建NLP小组的联合负责人、AIML小组成员。
她的研究方向主要聚焦于自然语言处理和机器学习,并且对在实际问题中具有可行性、可扩展性和可泛化性的简单而又可靠的方法饶有兴趣。
同样来自普林斯顿大学的,还有陈丹琦的徒弟钟泽轩(Zexuan Zhong)。
图片
钟泽轩是普林斯顿大学的四年级博士生。硕士毕业于伊利诺伊大学香槟分校,导师是谢涛;本科毕业于北京大学计算机系,曾在微软亚研院实习,导师是聂再清。
他的最新研究主要聚焦于从非结构化文本中提取结构化信息、从预训练语言模型中提取事实性信息、分析稠密检索模型的泛化能力,以及开发适用于基于检索的语言模型的训练技术。
此外,主讲人还有来自华盛顿大学的Akari Asai、Sewon Min。
图片
Akari Asai是华盛顿大学主攻自然语言处理的四年级博士生,本科毕业于日本东京大学。
她主要热衷于开发可靠且适应性强的自然语言处理系统,提高信息获取的能力。
最近,她的研究主要集中在通用知识检索系统、高效自适应的NLP模型等领域。
图片
Sewon Min是华盛顿大学自然语言处理小组的博士候选人,读博士期间,曾在Meta AI兼职担任研究员长达四年,本科毕业于首尔国立大学。
最近她主要关注语言建模、检索以及二者的交叉领域。
在演讲期间,听众也很热情地提出了众多问题,例如为啥要用perplexity(困惑度)来作为演讲的主要指标。
图片
主讲人给出了细心解答:
在比较参数化的语言模型时,困惑度(PPL)经常被用到。但困惑度的改善能否转化为下游应用仍然是一个研究问题。
现已有研究表明,困惑度与下游任务(尤其是生成任务)有很好的相关性,并且困惑度通常可提供非常稳定的结果,它可以在大规模评估数据上进行评估(相对于下游任务来说,评估数据是没有标签的,而下游任务可能会受到提示的敏感性和缺乏大规模标记数据的影响,从而导致结果不稳定)。
图片
还有网友提出了这样的疑问:
关于“语言模型的训练成本高昂,而引入检索可能会解决这个问题”的说法,你只是将时间复杂度替换为空间复杂度(数据存储)了吗?

主讲人给出的解答是酱婶的:
我们讨论的重点是如何将语言模型缩减到更小,从而减少时间和空间的需求。然而,数据存储实际上也增加了额外的开销,这需要仔细权衡和研究,我们认为这是当前的挑战。
与训练一个拥有一百亿以上参数的语言模型相比,我认为目前最重要的是降低训练成本。
图片
想找这次演讲PPT,或是蹲具体回放的,可以去官网看看~
官方网址:https://acl2025-retrieval-lm.github.io/
以上就是陈丹琦ACL学术报告来了!详解
大模型「*」数据库7大方向3大挑战,3小时干货满满的详细内容,更多请关注其它相关文章!
# 自然语言
# 聊城网站建设内容介绍
# 宁波定制网站优化多少钱
# 莆田网站seo外包
# 新乡正规网站建设价格
# 湖南营销推广选择专业
# 沈阳网站百度快照优化
# 盘县网站优化报价
# 碑林seo网站优化公司
# seo免费学习
# 孝南抖音seo推广
# 提出了
# 模型
# 华盛顿
# 也很
# 主讲人
# 研究方向
# 网易
# 普林斯顿
# 这类
# 来了
# perplexity
# 数据库
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
遵义市首次引入手术机器人,成功实施全膝关节置换术
上影节直击 | AI技术降低了短片拍摄门槛?金爵奖评委不赞同
软银、淡马锡、沙特阿美突击入股,“协作机器人第一股”节卡股份:强敌环伺,持续失血是常态
阿里达摩院发布免费开放100项AI专利许可的动机是什么?
掌阅科技申请阅爱聊商标 掌阅科技申请AI相关商标
苹果AI战略与微软谷歌大相径庭,到底是领先还是落后?
两架海燕号无人机交付中国气象局 助力建设国家级机动气象观测业务
智能公司为何纷纷投身机器人领域?
人工智能框架生态峰会即将召开,聚焦AI大模型技术与科学智能探索!
AI成政客博弈工具,美国大选真假难辨,律师们的生意来了
无需标注数据,「3D理解」进入多模态预训练时代!ULIP系列全面开源,刷新SOTA
网友自制 AI 版《流浪地球 3》预告片,登上 CCTV6
测试框架-安全和自动驾驶
WPS AI 官网上线:可申请体验官资格,支持 Windows、安卓端下载
干货满满,2025昆山元宇宙国际装备展等你来打卡!
这款在《自然通讯》发表的机器人,为变形金刚来到现实创造可能性
百亿量化私募:量化投资进入“精耕细作”时代 AI带来行业新变革
360发布数字安全和人工智能的强大结合:360安全大模型
马斯克反讽人工智能AI炒作:“机器学习”本质就是统计
拓普龙7188ML:轻便壁挂式工控机箱,为人工智能应用场景提供有力保障
AI和ML推动联网设备的增长
从GOXR到PartyOn,XRSPACE致力打造多元共赢的元宇宙世界
如何利用AI工具写好本科论文:科技助你一臂之力
高通发布长期产品计划,为工业和企业物联网产品提供全新组合方案
联通发布鸿湖图文AI大模型1.0,可实现以文生图
Snap宣布研发出新技术 可大幅提升AI生成图像速度
靠游戏更靠AI 英伟达成唯一首季度两位数增长的公司
Moka AI产品后观察:HR SaaS迈进AGI时代
泗洪:畅通城市“血管” ,管下机器人来帮忙
Valve Index VR 头显销量下滑,上市四年的长青树渐失光彩
国宝级文物“铜兽驮跪坐人顶尊铜像”完成模拟拼接,腾讯AI立功
微幼科技晨检机器人:幼儿园健康保障的新伙伴
国产工业机器人领域“暗潮涌动”,即将迎来新一轮复苏
AI浪潮席卷,时空壶为何能成为AI翻译时代的破局者
斑马推出全新升级版思维机:以人工智能为核心的交互式学习体验
OpenAI首席执行官表态支持欧盟AI监管
明略科技发布免费开源TensorBoard.cpp,促进大型模型的预训练工作
直击上影节 | 光线传媒董事长王长田谈新技术:未来VR放映效果可能媲美影院
2025世界人工智能大会前沿科技共绘“未来”图景, 这家这家独角兽企业的通用大脑将在AI领域大放异彩
第 66 届格莱美奖规定,AI 作品将无法获得评奖资格
美图公司:Wink国内首发AI画面拓展功能
黄仁勋:5年前,我们对AI抱有巨大期望
IBM和NASA合作发布可追踪碳排放的开源AI基础模型
上海发布“元宇宙关键技术攻关行动方案”,加快 AIGC 等突破
科学家称,面对人工智能,人类未来或只有灭亡与虚拟永生两个选择
ChatGPT设计出的第一个机器人来了!【附人工智能行业预测】
城市在采用人工智能方面进展如何?
建立元宇宙产业联盟:移动、咪咕、华为、小米等加入
热点 | 人工智能黄金时代开启
大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用
2023-07-23
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。