当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

5个月前 (03-26)DeepSeek技术交流317

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

DeepSeek问世,加快联想全栈AI战略落地

DeepSeek问世,加快联想全栈AI战略落地

3月4日,在2025年世界移动通信大会期间,世界互联网大会国际组织在西班牙巴塞罗那举办以“打造融合、普惠、绿色的AI算力新生态”为主题的“AI算力发展”专题论坛。联想集团执行副总裁刘军表示,联想已经形...

DeepSeek价格下调,API调用错峰时段降幅最高达75%

DeepSeek价格下调,API调用错峰时段降幅最高达75%

经快讯,2月26日,DeepSeek API开放平台宣布,即日起,北京时间每日00:30至08:30的夜间空闲时段,DeepSeek开放平台推出错峰优惠活动。在此期间,API调用价格大幅下调:Deep...

2025年DeepSeek一体机:热潮下的机遇与挑战

2025年DeepSeek一体机:热潮下的机遇与挑战

2025年DeepSeek一体机:热潮下的机遇与挑战2025年伊始,DeepSeek大模型引领的一体机热潮如狂风般席卷中国AI市场。这款一体机凭借“开箱即用”的便捷特性以及超低的准入门槛,迅速吸引了众...

DeepSeek如何重塑中国大模型产业生态|海斌访谈

DeepSeek如何重塑中国大模型产业生态|海斌访谈

中国互联网大厂在为DeepSeek作出巨大改变。2月14日,百度宣布将于6月30开源文心大模型。2月15日,部分微信用户发现已经可以在搜索功能中调用DeepSeek模型了。百度和腾讯有自己的大模型产品...

DeepSeek什么都好,但真的不建议这样用……

DeepSeek什么都好,但真的不建议这样用……

进入三月,DeepSeek的热度有增无减,从最初面市到现在一个多月,首批用户体验后的反馈期终于来了。我身边的朋友都用疯了!有用来算命的,家里祖孙三代算到再无可算,DeepSeek娃说命里缺金,家长也管...

百家医院接入DeepSeek,是助手还是对手?

百家医院接入DeepSeek,是助手还是对手?

记者 张铃 凌晨3点,北京清华长庚医院(下称“长庚医院”)一间手术室的灯光刚熄灭,一位外科医生没有休息,而是掏出手机用起了DeepSeek,还把一则又有医院接入DeepSeek的消息转发给了...