当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

3个月前 (03-26)DeepSeek技术交流239

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

昇腾新动力DeepSeek新纪元!贸易摩擦强化国产AI算力替代进程?

昇腾新动力DeepSeek新纪元!贸易摩擦强化国产AI算力替代进程?

4月8日,“昇腾新动力DeepSeek新纪元”主题沙龙活动举办。上海超级计算中心表示,当下,算力在基础科学研究和生成式人工智能处理大数据这两个关键方向发挥着重要作用,深刻改变着各行业的发展轨迹,要以算...

斯坦福2025 AI Index报告来了:DeepSeek在全文中被提到45次

斯坦福2025 AI Index报告来了:DeepSeek在全文中被提到45次

斯坦福《2025 AI指数》揭示:美国以40个顶尖模型领跑,中国性能差距缩至1.7%;训练成本飙升近2亿美元,但推理费用骤降99%。DeepSeek以600万美元低成本突围,质疑与希望并存;AI碳足迹...

亚信科技与清华AIR联合发布《DeepSeek赋能自智网络高阶演进评测报告

亚信科技与清华AIR联合发布《DeepSeek赋能自智网络高阶演进评测报告

2025年2月28日,亚信科技与清华大学智能产业研究院(AIR)联合发布《DeepSeek赋能自智网络高阶演进评测报告》中英文版。该报告为通信行业首份系统性评估DeepSeek等基础大模型对自智网络应...

国家超算互联网平台宣布AI生态伙伴加速计划DeepSeek API接口免费使用

国家超算互联网平台宣布AI生态伙伴加速计划DeepSeek API接口免费使用

近日国家超算互联网平台宣布推出“AI生态伙伴加速计划”计划的核心内容包括提供3个月DeepSeek API接口免费使用“超算”+AI推动产业化进程2023年中国科技部启动国家超算互联网部署工作促进超算...

牵手Deepseek!通用技术集团积极拥抱下一个“通用技术”

牵手Deepseek!通用技术集团积极拥抱下一个“通用技术”

通用技术在人类社会发展进程中扮演着至关重要的角色从蒸汽机到电力每一次通用技术的变革都重塑着全球经济与社会格局如今,人工智能(AI)浪潮扑面而来被广泛认为是下一个具有巨大影响力的通用技术国产AI大模型D...

政务系统拥抱DeepSeek,会带来哪些改变?

政务系统拥抱DeepSeek,会带来哪些改变?

最近,DeepSeek的“朋友圈”极速扩容。本周起,广东深圳市基于政务云环境面向全市各区各部门,正式提供DeepSeek模型应用服务;在深圳市福田区,70名政务AI“数智员工”已正式上岗。不仅是深圳,...