当前位置:首页 > Deepseek最新资讯 > 正文内容

刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apac

9个月前 (12-03)Deepseek最新资讯220

  Mistral 表示:「所有模型均采用 Apache 2.0 许可证发布。以多种压缩格式开源我们的模型,能够赋能开发者社区,并通过分布式智能将 AI 交到人们手中。」

  该公司也声称:「Ministral 模型代表了同类产品中最佳的性价比。与此同时,Mistral Large 3 也跻身于前沿指令微调开源模型的行列。」

  Mistral Large 3 是 Mistral 自开创性的 Mixtral 系列以来的首个混合专家模型,代表了 Mistral 在预训练方面迈出的重要一步deepseek。经过后训练,该模型在通用提示词上达到了与市场上最好的指令微调开放权重模型同等的水平,同时展现了图像理解能力,并在多语言对话(即非英语 / 中文环境)中表现出一流的性能。

  值得注意的是,Mistral 在这里并没有对比刚发布几天的 DeepSeek-V3.2 正式版,可能是因为 DeepSeek 没有发布在普通语言任务上的基准测试结果,仅给出了推理和智能体任务的基准结果。

  Mistral Large 3 在 LMArena 排行榜的 OSS(开源软件)非推理模型类别中首次亮相即排名第 2(在所有开放模型中排名第 6),是性能最好的开放模型之一。

  另外,他们还强调与英伟达的合作:「交付先进的开源 AI 模型需要广泛的优化,这通过与 NVIDIA 的合作得以实现。我们所有的新 Mistral 3 模型,从 Large 3 到 Ministral 3,都在 NVIDIA Hopper GPU 上进行了训练,以利用高带宽 HBM3e 内存来处理前沿规模的工作负载。NVIDIA 的极致协同设计(co-design)方法将硬件、软件和模型融为一体。NVIDIA 工程师为整个 Mistral 3 系列实现了对 TensorRT-LLM 和 SGLang 的高效推理支持,从而实现高效的低精度执行。

  针对 Large 3 的稀疏 MoE 架构,英伟达集成了最先进的 Blackwell 注意力和 MoE 内核,增加了对预填充 / 解码分离服务的支持,并与 Mistral 在推测性解码(方面进行合作,使开发者能够在 GB200 NVL72 及更高版本的硬件上高效地服务长上下文、高吞吐量的工作负载。在边缘端,NVIDIA 为 DGX Spark、RTX PC 和笔记本电脑以及 Jetson 设备提供了 Ministral 模型的优化部署方案,为开发者提供了一条从数据中心到机器人运行这些开放模型的一致且高性能的路径。」

  此外,对于每种尺寸,他们都向社区发布了基础版(base)、指令版(instruct)和推理版(reasoning)变体,每种都具备图像理解能力,且全部采用 Apache 2.0 许可证。

  Mistral 重点强调:「Ministral 3 实现了所有开源模型中最佳的性价比。在实际用例中,生成的 token 数量和模型大小同等重要。Ministral 指令模型与其同类模型的性能相当或更好,同时生成的 token 数量通常要少一个数量级。」

  另外,Ministral 推理变体可以进行更长时间的思考,以在其权重级别中产生最先进的准确性 —— 例如,其 14B 变体在 AIME ‘25 上达到了 85% 的准确率。

  对于寻求量身定制 AI 解决方案的组织,Mistral AI 也提供了定制模型训练服务,以微调或完全适配模型来满足自己的特定需求。

  该公司表示:「无论是针对特定领域任务进行优化、提高在专有数据集上的性能,还是在独特环境中部署模型,我们的团队都会与您合作构建符合您目标的 AI 系统。对于企业级部署,定制训练可确保您的 AI 解决方案安全、高效且大规模地交付最大影响力。」

  Mistral 早期的模型采用 Apache 2.0 开源许可,属于真正开放权重;但随着公司推出更大型、更高性能的旗舰模型(如 Mistral Large),逐步转向闭源与商业授权。可以说,Mistral 此次全线回归 Apache 2.0 协议,某种程度上是被 DeepSeek「逼」出来的战略调整。

  在过去的一段时间里,DeepSeek 以极致的推理成本和激进的开源策略迅速抢占了全球开发者社区的心智,一度让坚持「开放权重但限制商用」的中间派厂商陷入被动。

  Mistral 3 的发布,可以看作是这家法国独角兽对 DeepSeek 发起的正面追赶:不仅在 MoE(混合专家)架构上继续深耕,更试图通过端侧模型(Ministral)的差异化优势,在被中美巨头挤压的缝隙中杀出一条血路。原文出处:刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apache 2.0,感谢原作者,侵权必删!

标签: deepseek

“刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apac” 的相关文章

1月11日DeepSeek预测:黄蜂vs爵士,马尔卡宁缺阵爵士主场难敌黄蜂

1月11日DeepSeek预测:黄蜂vs爵士,马尔卡宁缺阵爵士主场难敌黄蜂

  北京时间1月11日10:30,NBA常规赛将迎来一场东西部中游球队的较量,爵士将在主场迎战黄蜂。目前爵士以13胜24负排名西部第13deepseek,黄蜂则以13胜25负排名东部第12...

DeepSeek发布关于AI生成合成内容标识的公告

DeepSeek发布关于AI生成合成内容标识的公告

  人民财讯9月1日电,DeepSeek发布关于AI生成合成内容标识的公告,DeepSeek已在平台内对AI生成合成内容添加标识,并明确提醒用户相关内容由AI生成。用户不得恶意删除、篡改、...

从MiniMax到DeepSeek:为何头部大模型都在押注「交错思维」?

从MiniMax到DeepSeek:为何头部大模型都在押注「交错思维」?

  昨日,有位推特博主晒出了国内几大开源模型在轻量级软件工程 Agent 基准测试 mini-SWE-agent 上的成绩。该基准主要测试大模型在真实软件开发任务中的多步推理、环境交互和工...

Meta年会带火AI眼镜,DeepSeek登上国际期刊封面!寒武纪成交活跃,科创

Meta年会带火AI眼镜,DeepSeek登上国际期刊封面!寒武纪成交活跃,科创

  今日(9月18日)重点布局国产AI产业链的科创人工智能ETF(589520)场内涨幅盘中上探1.59%,现涨1.27%,拉长时间来看,近7个交易日中,6个交易日均上涨,或呈现小碎步上涨...

DeepSeek-OCR:大模型技术,正站在一个新的十字路口

DeepSeek-OCR:大模型技术,正站在一个新的十字路口

  想象一下,在这个AI技术如潮水般涌来的时代,我们忽然发现,一张简单的图像,竟然能以惊人的效率承载海量文字信息。这已不是想象,而是刚刚发生的现实。   本周,DeepS...

DeepSeek预测:巴列卡诺vs巴塞罗那!巴萨火力全开,亚马尔能否延续神勇?

DeepSeek预测:巴列卡诺vs巴塞罗那!巴萨火力全开,亚马尔能否延续神勇?

  2025-26赛季西甲联赛第3轮,巴列卡诺将在主场迎战巴塞罗那。目前,巴塞罗那以2战全胜积6分的战绩排名联赛第2,而巴列卡诺则以1胜1负积3分排名第8。这场比赛对于双方来说都至关重要,...