当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

1年前 (2025-03-26)DeepSeek技术交流605

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

清华团队推出“安全增强版DeepSeek”大语言模型RealSafe-R1

清华团队推出“安全增强版DeepSeek”大语言模型RealSafe-R1

人民网北京2月24日电 (记者赵竹青)2月23日,清华大学计算机系相关研究团队宣布推出大语言模型RealSafe-R1。该模型基于DeepSeek R1进行深度优化与后训练,在确保性能稳定的基础上,显...

鸿合科技:自研AI平台已接入DeepSeek开源大模型应用于教育场景

鸿合科技:自研AI平台已接入DeepSeek开源大模型应用于教育场景

金融界4月9日消息,有投资者在互动平台向鸿合科技提问:公司有没有对deepseek适配和接入?公司回答表示:公司自主研发AI应用开放平台,并积极推动AI技术在教育场景的应用。目前平台已接入DeepSe...

DeepSeek助攻年轻人的口腔护理,一刷一含一漱健康从“齿”开始

DeepSeek助攻年轻人的口腔护理,一刷一含一漱健康从“齿”开始

你是不是也有这样的困扰:早上刷牙时牙龈出血,喝冰咖啡时牙齿敏感,吃完火锅后口腔异味挥之不去……别急,这些问题,DeepSeek用大数据告诉你:90%的年轻人都中招了!但好消息是,解决这些问题其实很简单...

DeepSeek你不要太爱普洱了

DeepSeek你不要太爱普洱了

今年春节中国AI公司深度求索开发的大模型DeepSeek火爆“出圈”今天让我们以“旅居”角度对话DeepSeek去看看它眼中旅居普洱是什么样的吧DeepSeek笔下的普洱对话DeepSeek解锁旅居普...

全国首创!重庆“产业大脑”深度融合DeepSeek大模型

全国首创!重庆“产业大脑”深度融合DeepSeek大模型

在人工智能技术加速与实体经济深度融合的背景下,重庆市创新打造的“产业大脑”近日取得突破性进展。2月23日,上游新闻记者从市经济信息委获悉,“产业大脑”通过深度集成国产大模型DeepSeek,正逐渐构建...

昇腾+DeepSeek大模型助力职业院校低成本打造AI实训标杆

昇腾+DeepSeek大模型助力职业院校低成本打造AI实训标杆

随着移动互联技术、云计算和人工智能等新兴技术的快速发展及其在各行业的广泛应用,各职业高校教育正面临新的机遇与挑战,职业院校作为培养应用型和技术型人才的重要阵地,亟需探索高效、高质量的实训课程新模式。在...