首页 > 营销学院 > IT资讯

逆向思维：MetaMath新数学推理语言模型训练大型模型

复杂数学推理是评价大语言模型推理能力的重要指标，目前常用的数学推理数据集样本量有限且问题多样性不足，导致大语言模型存在 [逆转诅咒] 的现象，即一个训练于「A 是 B」的语言模型无法推广到「B 是 A」[1]。此现象在数学推理任务中的具体形式是：即给定一个数学问题，语言模型擅于用正向推理解答问题但缺乏逆向推理解决问题的能力。逆向推理在数学问题中十分常见，如下 2 个例子。

1. 经典问题 - 鸡兔同笼

正向推理：笼子里有 23 只鸡和 12 只兔，问笼子里有多少个头和多少只脚？
逆向推理：有若干只鸡兔同在一个笼子里，从上面数，有 35 个头，从下面数，有 94 只脚。问笼中各有多少只鸡和兔？

2. GSM8K 问题

正向推理: James buys 5 packs of beef that are 4 pounds each. The price of beef is $5.50 per pound. How much did he pay?
逆向推理: James buys x packs of beef that are 4 pounds each. The price of beef is $5.50 per pound. How much did he pay? If we know the answer to the above question is 110, what is the value of unknown variable x?

为了提升模型的正向和逆向推理能力，剑桥、港科大、华为的研究者基于两个常用的数学数据集（GSM8K 和 MATH）提出了 MetaMathQA 数据集：一个覆盖面广、质量高的数学推理数据集。MetaMathQA 由 395K 个大语言模型生成的正向逆向数学问答对组成。他们在 MetaMathQA 数据集上基于 LLaMA-2 微调得到专注于数学推理 (正向和逆向) 的大语言模型 MetaMath，在数学推理数据集上达到了 SOTA。MetaMathQA 数据集和不同规模的 MetaMath 模型已开源供研究人员使用。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

项目地址：https://meta-math.github.io/
论文地址：https://arxiv.org/abs/2309.12284
数据地址：https://huggingface.co/datasets/meta-math/MetaMathQA
模型地址：https://huggingface.co/meta-math
代码地址：https://github.com/meta-math/MetaMath

在GSM8K-Backward数据集中，我们构建了一个逆向推理的实验。实验结果显示，与SFT、RFT和WizardMath等方法相比，目前的方法在逆向推理问题上表现较差。与之相反，MetaMath模型在正向和反向推理方面都取得了出色的性能

逆向思维：MetaMath新数学推理语言模型训练大型模型

方法

逆向思维：MetaMath新数学推理语言模型训练大型模型

MetaMathQA 包含了四种数据增强的方法：

1. Answer Augmentation (答案增强)：给定问题，通过大语言模型生成能得到正确结果的思维链作为数据增广。

Question: James buys 5 packs of beef that are 4 pounds each. The price of beef is $5.50 per pound. How much did he pay?
Answer: James buys 5 packs of beef that are 4 pounds each, so he buys a total of 5 * 4 = 20 pounds of beef. The price of beef is $5.50 per pound, so he pays 20 * $5.50 = $110. The answer is: 110.

2. Rephrasing Question (问题改写增强)：给定元问题，通过大语言模型重写问题并生成得到正确结果的思维链作为数据增广。

Question: What is the total amount that James paid when he purchased 5 packs of beef, each weighing 4 pounds, at a price of $5.50 per pound?
Answer: Each pack of beef weighs 4 pounds, so 5 packs weigh 4 * 5 = 20 pounds in total. The price per pound of beef is $5.50, so the total cost for 20 pounds is 20 * $5.50 = $110. Therefore, James paid a total of $110. The answer is: 110.

3. FOBAR Question (FOBAR 逆向问题增强)：给定元问题，通过掩码条件中的数字为 x，给定原有答案并反推 x 来产生逆向问题，并基于该逆向问题生成正确的思维链过程来进行数据增广（反推样例：“If we know the answer to the above question is 110, what is the value of unknown variable x?”）。

Question: James buys x packs of beef that are 4 pounds each. The price of beef is $5.50 per pound. How much did he pay? If we know the answer to the above question is 110, what is the value of unknown variable x?
Answer: James buys x packs of beef that are 4 pounds each, so he buys a total of 4x pounds of beef. The price of beef is $5.50 per pound, so the total cost of the beef is 5.50 * 4x = 22x. We are given that the total cost is $110, so we can write: 22x = 110. Dividing both sides by 22, we get: x = 5. The value of x is 5.

4. Self-Verification Question (Self-Verification 逆向问题增强)：在 FOBAR 的基础上，通过大语言模型改写逆向问题部分为陈述的语句来进行数据增广（改写样例：“How much did he pay?” (with the answer 110) 被改写成 “He paid 110”）。

Question: James buys x packs of beef that are 4 pounds each. The price of beef is $5.50 per pound. He paid 110. What is the value of unknown variable x?
Answer: To solve this problem, we need to determine the value of x, which represents the number of packs of beef that James bought. Each pack of beef weighs 4 pounds and costs $5.50 per pound. The total amount James paid is $110. We can set up the equation as follows: Number of packs of beef * Weight per pack * Price per pound = Total amount paid; x * 4 * $5.50 = $110; Let's simplify and solve for x: 4x * $5.50 = $110; 22x = $110; To isolate x, we divide both sides of the equation by 22: 22x / 22 = $110 / 22; x = $5; The value of x is 5.

实验结果

逆向思维：MetaMath新数学推理语言模型训练大型模型

在两个常见的数学推理数据集（GSM8K和MATH）的实验结果表明，MetaMath在性能上显著优于已有的开源LLM模型，而且不需要借助外部工具（例如代码解释器）。其中，我们的MetaMath-7B模型在GSM8K上达到了66.5%的准确率，在MATH上达到了19.8%的准确率，分别比相同规模的最先进模型高出11.6%和9.1%。特别值得一提的是，MetaMath-70B在GSM8K上达到了82.3%的准确率，超过了GPT-3.5-Turbo

根据《表面对齐假设》[2]，大型语言模型的能力来自于预训练，而来自下游任务的数据则会激活预训练期间所学习到的语言模型的内在能力。因此，这引发了两个重要问题：（一）哪种类型的数据可以最有效地激活潜在知识，以及（二）为什么一个数据集在这种激活中比另一个数据集更好？

为什么 MetaMathQA 有用？提高了思维链数据的质量 (Perplexity)

逆向思维：MetaMath新数学推理语言模型训练大型模型

根据上图所示，研究人员计算了 LLaMA-2-7B 模型在仅答案数据、GSM8K CoT 和 MetaMathQA 数据集的各个部分上的困惑度。MetaMathQA 数据集的困惑度明显低于其他两个数据集，这表明它具有较高的易学性，可能更有助于揭示模型的潜在知识

为什么 MetaMathQA 有用？增加了思维链数据的多样性 (Diversity)

逆向思维：MetaMath新数学推理语言模型训练大型模型

通过比较数据的多样性增益和模型的准确率增益，研究人员发现，重新表述、FOBAR和SV的引入相同数量的增广数据都带来了明显的多样性增益，并显著提高了模型的准确率。相比之下，仅仅使用答案增强会导致准确率明显饱和。在准确率达到饱和后，增加AnsAug数据只会带来有限的性能提升

以上就是逆向思维：MetaMath新数学推理语言模型训练大型模型的详细内容，更多请关注其它相关文章！

# 上海 # 铁岭电商网站优化推广 # 成都网站建设方案项目书 # 帝国cms seo基础 # 网站营销推广蔚訫hfqjwl作词 # 盐城网站建设运营公司 # 枣庄网络seo公司排名 # 鲜花营销推广 # 正定做网站优化 # seo时间节点 # 洗衣液淘宝营销推广方案 # 的是 # 中国 # 模型 # 解决问题 # 笼子里 # 只鸡 # 丰田 # 过大 # 中国科学院 # 开源 # follow # perplexity # llama # ai

相关栏目：【 Google疑问12 】【 Facebook疑问10 】【优化推广96088 】【技术知识133117 】【 IDC资讯59369 】【网络运营7196 】【 IT资讯61894 】

2023-10-11

Notion AI怎么写笔记 Notion AI辅助写作及自动摘要生成技巧【教学】 AI一键生成高质量论文大纲 Claude帮你改写和润色文章 Claude写作风格优化技巧怎么用ai创作绘本 AI儿童故事与插画自动生成【秘籍】去哪旅行ai抢票助手怎么查看抢票历史_去哪旅行ai抢票助手历史记录查询与筛选【教程】如何用AI一键去除图片背景？AI自动抠图去底最强工具【实测】 DeepSeek数学建模应用指南 DeepSeek解决复杂问题技巧如何用AI一键扩图补全背景？Photoshop AI生成填充使用技巧【教程】 DeepSeek辅助撰写技术文档方法 DeepSeek开发者必备技巧文心一言官方网站在线入口文心一言在线版使用地址 Kimi国内访问入口_Kimi智能助手网页版链接直达如何用AI生成室内设计效果图？AI装修设计灵感生成指南【教程】 AI一键生成社交媒体自动回复蚂蚁阿福官网网页版入口_电脑端使用医保与健康服务如何用AI一键去视频水印 AI视频无痕去水印软件使用方法【教程】 Claude帮你解读晦涩的学术理论 Claude知识学习助手 Jasper AI怎么写社交媒体帖子 Jasper AI社媒内容创作【攻略】 DeepSeek长代码项目理解与分析 DeepSeek代码库学习方法 DeepSeek进行科学计算教程 DeepSeek物理建模与* AI一键生成短视频分镜头脚本

了解您产品搜索量及市场趋势，制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求，1小时内享受我们的专业解答。

运城市盐湖区信雨科技有限公司

运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商，作为谷歌推广与Facebook广告全球合作伙伴，聚焦外贸企业出海痛点，以数字化营销为核心，提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持，打破传统外贸获客壁垒，助力企业高效开拓全球市场，成为中小企业出海的可靠合作伙伴。