当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

12个月前 (05-01)Deepseek应用场景601

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

日照港:已部署Deepseek,应用于港口设备管理应用决策

日照港:已部署Deepseek,应用于港口设备管理应用决策

金融界3月11日消息,有投资者在互动平台向日照港提问:董秘您好!请问贵公司是否已经部署了DeepSeek?如果已经部署了,请问主要应用于哪些具体的业务?公司接入DeepSeek有哪些成本、收益方面的考...

DeepSeek带动对冲基金快速涌入中国股市

DeepSeek带动对冲基金快速涌入中国股市

据彭博社16日报道,中国人工智能公司DeepSeek的技术突破,正促使股票资金从印度回流到中国。彭博社称,随着DeepSeek推动中国科技行业形势看涨,以及中国将出台更多利好经济措施的预期,全球对冲基...

部署智慧新赛道!DeepSeek落地吴江!

部署智慧新赛道!DeepSeek落地吴江!

在DeepSeek爆火出圈的同时,各地的本地化部署已然争相展开。日前,江苏吴江区数据局正式引入并本地化部署DeepSeek智能平台,标志着吴江在数字城市建设与人工智能技术应用领域迈出关键一步。目前,吴...

利用DeepSeek做私域的4大引流秘籍+5个躺着赚钱的副业

利用DeepSeek做私域的4大引流秘籍+5个躺着赚钱的副业

最近一段时间,DeepSeek突然火了,说实话,咱们做互联网的人都知道这个是干嘛的,但大多数普通人根本就不知道DeepSeek这玩意究竟有什么用,更不知道如何运用这个神奇的工具去变现,去做私域。今天一...

德州市公路巡查中心举行DeepSeek培训交流会

德州市公路巡查中心举行DeepSeek培训交流会

为紧跟科技发展最新趋势,提升干部职工对人工智能技术的理解与应用能力,助力工作提效能,3月3日,德州市公路巡查中心特邀中国电信人工智能领域专家团队,举办“DeepSeek应用与赋能业务”专题讲座。授课专...

中国电信中山分公司携手DeepSeek打造智能化政务与行业服务新

中国电信中山分公司携手DeepSeek打造智能化政务与行业服务新

近日,中国电信中山分公司成功借助天翼云算力及政务云资源,助力中山市政数局完成了DeepSeek大模型的本地化部署,并在中山12345热线中率先实现了融合创新应用。此次合作通过赋能智能坐席助手,显著提升...