当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek V3.2爆火,Agentic性能暴涨40%解密

9个月前 (12-04)Deepseek最新资讯191

  当你试图用当今最先进的大模型帮你完成一个复杂的长假规划,比如「带全家老小去云南玩七天」时,往往很可能会遭遇一个令人崩溃的时刻:

  但随着对话进行到第十轮,你们为了选酒店修改了五次方案,又为了某顿晚餐争论了半天后,它突然「失智」了。

  在最新的行程表里,它竟然兴致勃勃地建议:「第四天清晨:全家早起徒步攀登玉龙雪山,欣赏日照金山,全程耗时4小时……」

  MiniMax等部分厂商也将其称作Interleaved Thinking(交错思维链),从示意图即可看出,二者本质上是等价的。这是一个更贴近技术的称呼。

  如图所示,交错思维链即模型在推理(thinking)和工具调用(action)之间来回交替,并持续保留和复用每一轮的推理状态,从而实现稳定、可累积的长程规划。

  要理解交错思维链为什么是「神技」,我们得先看看它的前任——早期的ReAct(Reasoning+Acting)范式是如何遇到瓶颈的。

  在很长一段时间里,我们构建AI Agent的逻辑非常线性:观察->思考->行动。

  这看起来很符合直觉,但在实际的工程实现(如OpenAI的Function Calling(函数调用))中,这个过程往往被简化成了「模型直接输出工具调用指令」。

  但当工具执行完毕,返回了数千行的代码或网页内容后,模型进入下一轮生成时,它面临着巨大的环境扰动。

  想象一下,你是一个程序员,每写一行代码,就有人把你打晕,清除你的短期记忆,然后把刚才的运行日志扔给你,让你继续写。

  模型的思考过程隐藏在权重里,一旦被打断(Turn-based interaction),这些思维火花就烟消云散了。

  在每一次调用工具之前,模型必须先输出一段被包裹在reasoning_details(或类似的tag)中的自然语言。

  在常规的SWE-Bench Verified(软件工程)榜单上,开启交错思维链带来了3.3%的提升(从67.2升至69.4)。这个提升虽然不错,但还算温和。

  然而deepseek,在BrowseComp(网页浏览任务)上,提升幅度达到了惊人的40%(从31.4飙升至44.0);在Tau²这种复杂推理任务上,提升了36%。

  模型通过显式的思考,在接收到庞杂的网页信息后,先进行一轮「信息清洗」和「逻辑校准」:「我刚才搜索了X,结果里有很多无关信息,只有第三段是我需要的,接下来我应该根据这个线索去查Y。」

  早期业界普遍认为,只要让模型学会使用更多的工具(Scaling Tools),Agent就泛化了。

  一个模型可能在Claude Code这种脚手架里表现完美,但换到Cline或者命令行里就一塌糊涂。

  即使换了一个陌生的IDE环境,只要「思考-行动」的闭环还在,模型就能通过显式的逻辑推理来适应新环境,而不是依赖死记硬背的提示词模板。

  这也是为什么MiniMax M2能够在xBench、GAIA等多个异构榜单上全面开花的技术根源。

  虽然Anthropic最早提出了Extended Thinking的概念,但由于其闭源特性,社区并未形成统一标准。

  这就导致了一个灾难性的后果:用户在使用M2时,习惯性地把API返回的reasoning_details字段当成垃圾信息丢掉了。

  在过去的一段时间里,MiniMax的工程师们化身开源社区的「包工头」,向全球主流的Agent开发工具和平台发起了密集的PR(Pull Request,合并请求)攻势。

  最近引发轰动的DeepSeek V3.2,其核心特性之一「Thinking in Tool-Use」(使用工具中思考),在本质上与MiniMax倡导的交错思维链是完全一致的。

  DeepSeek的技术文档中明确指出:模型在调用工具时,会保持思维链的连续性,直到收到新的用户消息才会重置。

  虽然两家在具体的API字段命名上可能略有不同(MiniMax使用reasoning_details,DeepSeek使用reasoning_content,Anthropic使用thinking_blocks等),但在系统设计哲学上,大家已经达成了一致:显式的、交错的、持久化的思考,是智能体进化的必经之路。

  它正在从那个只会根据提示词模板机械执行命令的「复读机」(Copilot),进化为能够在复杂的真实世界中,面对无数未知的扰动和噪音,依然能够停下来思考、自我修正、并坚定地执行长链路任务的「思想者」(Autopilot)。原文出处:DeepSeek V3.2爆火,Agentic性能暴涨40%解密,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek V3.2爆火,Agentic性能暴涨40%解密” 的相关文章

DeepSeek预测:比利亚雷亚尔VS曼城!哈兰德能否延续恐怖火力?预测3-1曼

DeepSeek预测:比利亚雷亚尔VS曼城!哈兰德能否延续恐怖火力?预测3-1曼

  在欧冠36强联赛阶段第3轮,西甲劲旅比利亚雷亚尔将在陶瓷球场迎战英超豪门曼城deepseek。目前比利亚雷亚尔以1平1负积1分排名第26,而曼城则以1胜1平积4分排名第8。这场比赛对双...

1月8日DeepSeek预测:爵士vs雷霆,西部霸主能否延续碾压?亚历山大或再轰

1月8日DeepSeek预测:爵士vs雷霆,西部霸主能否延续碾压?亚历山大或再轰

  西部垫底的爵士将客场挑战联盟第一的雷霆,这场看似悬殊的对决却暗藏玄机。爵士近期虽仅1胜4负,但场均119.6分的进攻火力高居联盟第五;而雷霆则以121.2分的场均得分领跑西部,但最近两...

DeepSeek预测:拜仁慕尼黑vs弗赖堡!凯恩13球领跑德甲,南大王主场碾压?

DeepSeek预测:拜仁慕尼黑vs弗赖堡!凯恩13球领跑德甲,南大王主场碾压?

  德甲第11轮即将迎来一场焦点战,拜仁慕尼黑将在主场迎战弗赖堡。作为德甲霸主,拜仁本赛季依旧展现出了强大的统治力,而弗赖堡则是一支中游球队,本场比赛能否给拜仁制造麻烦?让我们通过数据来一...

Deepseek推荐全国旅游百强区第51名:湖南长沙市开福区

Deepseek推荐全国旅游百强区第51名:湖南长沙市开福区

  日前,全国县镇发展研究课题组、天和经济研究所县镇发展研究院联合发布了2024《全国县镇发展报告》,报告评价篇对全国县市以及包含乡村人口的市辖区旅游发展水平进行了综合评价,并发布了天和2...

突发!DeepSeek 一口气连发 2 个新模型

突发!DeepSeek 一口气连发 2 个新模型

  DeepSeek官微推文中写道,“DeepSeek-V3.2模型在Agent评测中达到了当前开源模型的最高水平”。   在指令跟随、数学证明、逻辑验证方面,DeepS...

2025年世界互联网大会乌镇峰会|史蒂夫·霍夫曼:共迎数智时代,倡导全球协作

2025年世界互联网大会乌镇峰会|史蒂夫·霍夫曼:共迎数智时代,倡导全球协作

  2025 年 11 月 6 日至 9 日,以“共筑开放合作、安全普惠的数智未来——携手构建网络空间命运共同体”为主题的世界互联网大会乌镇峰会在浙江乌镇举行,全球互联网进入“乌镇时间”,...