当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

2个月前 (05-01)Deepseek应用场景201

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

超200亿“弹药”来了!问了DeepSeek,如何更好配置科创板

超200亿“弹药”来了!问了DeepSeek,如何更好配置科创板

近年来,指数投资已经成为最常用的投资配置工具。科创板更是A股指数化投资比例最高的板块。根据上交所数据显示,科创板相关指数产品合计规模超2400亿元,占科创板整体自由流通市值比例为8.3%。开年以来,科...

“内置DeepSeek”,日媒:AI成中国汽车新卖点

“内置DeepSeek”,日媒:AI成中国汽车新卖点

东风日产的N7电动汽车将搭载DeepSeek凤凰网科技讯 北京时间3月24日,据《日经亚洲》报道,中国汽车公司正在将DeepSeek的AI功能添加到旗下车型中,以便在中国这个全球最大汽车市场中脱颖而出...

猿辅导集团推出“小猿AI”,基于猿力大模型和DeepSeek发布智能教学解决方案

猿辅导集团推出“小猿AI”,基于猿力大模型和DeepSeek发布智能教学解决方案

钛媒体App 4月15日消息,小猿AI暨智能硬件战略发布会上,猿辅导集团正式推出“小猿AI”,并发布覆盖家校两端的智能教学解决方案,涵盖小猿AI App、小猿AI学习机及飞象星球人工智能通识课。据了解...

DeepSeek R2来了?全新推理时Scaling论文联手清华震撼发布!

DeepSeek R2来了?全新推理时Scaling论文联手清华震撼发布!

新智元报道编辑:Aeneas 犀牛【新智元导读】DeepSeek新论文来了!在清华研究者共同发布的研究中,他们发现了奖励模型推理时Scaling的全新方法。DeepSeek R2,果然近了。最近,De...

阿里千问与DeepSeek入选全球AI开源贡献榜前十

阿里千问与DeepSeek入选全球AI开源贡献榜前十

【阿里千问与DeepSeek入选全球AI开源贡献榜前十】财联社6月12日电,全球最大的AI开源社区Hugging Face发布了最新的AI开源贡献榜,中国团队表现亮眼,阿里通义千问跻身全球第五、中国第...

deepseek怎么写百万字的小说

deepseek怎么写百万字的小说

利用DeepSeek(或类似的人工智能写作助手)来写一部百万字的小说是一个庞大而复杂的任务,需要周密的计划和策略。以下是一些建议,帮助你利用AI助手完成这一壮举:1. 明确小说主题与大纲确定...