当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

2个月前 (05-01)Deepseek应用场景147

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

“DeepSeek医生”也能上岗“诊疗”了!人工智能自动生成处方靠谱吗?

“DeepSeek医生”也能上岗“诊疗”了!人工智能自动生成处方靠谱吗?

据中央广播电视总台中国之声《新闻纵横》报道,最近,人工智能的春风席卷各大领域,医疗行业也在经历着一场深刻的变革。各地多家医院纷纷引入国产AI大模型DeepSeek,并通过本地化部署将其应用于临床、科研...

积极拥抱AI技术,广东博众接入DeepSeek大模型

积极拥抱AI技术,广东博众接入DeepSeek大模型

近年来,人工智能已成为推动各行业变革的核心力量。从金融领域的智能投顾到医疗行业的疾病诊断,从教育行业的个性化学习到交通领域的自动驾驶,AI技术正以前所未有的速度重塑着我们的生活和工作方式。在这场技术革...

青海移动完成基于国产化算力的DeepSeek模型部署

青海移动完成基于国产化算力的DeepSeek模型部署

中国移动通信集团青海有限公司基于寒武纪MLU 590国产化算力资源池,已全面部署上线DeepSeek国产化大模型服务,实现了全版本覆盖、全尺寸适配、全功能畅用,全方位加入DeepSeek生态圈。【新华...

OPPO Find X8 Ultra深度融合DeepSeek

OPPO Find X8 Ultra深度融合DeepSeek

新京报贝壳财经讯(记者 张晗)4月10日,OPPO发布其年度影像旗舰产品Find X8 Ultra,起售价为6499元。据OPPO介绍,Find X8 Ultra首创全链路原彩ProXDR,支持首个原...

DeepSeek全球时刻,全球南方有望破“智能鸿沟”

DeepSeek全球时刻,全球南方有望破“智能鸿沟”

【导读】4月26日,全球南方系列十讲的第二讲“数字技术在全球南方的开源与共享”,在华东师范大学普陀校区举办。华东师范大学政治与国际关系学院教授余南平做主讲,并在圆桌环节与华东师范大学上海人工智能金融学...

上线上线!“高新造”算力“AI”上DeepSeek!

上线上线!“高新造”算力“AI”上DeepSeek!

              DeepSeek自发布以来以高性能、低成本及开源等显著优势迅速吸引全球关注14日获悉无锡高新区智算中心...