当前位置:首页 > Deepseek最新资讯 > 正文内容

全球首个混合线性架构万亿参数思考模型开源

6个月前 (02-15)Deepseek最新资讯84

  中国日报2月13日电(记者 程钰)2月13日,蚂蚁集团开源发布全球首个基于混合线性架构的万亿参数思考模型 Ring-2.5-1T,在长文本生成、数学推理与智能体任务执行上达到开源领先水平,为智能体(Agent)时代的复杂任务处理提供高性能基础支撑。

  在生成效率上,Ring-2.5-1T在32K以上长文本生成场景中,对比上代模型访存规模降低10倍以上,生成吞吐提升3倍以上。在深度思考能力方面,该模型在国际数学奥林匹克竞赛(IMO 2025)和中国数学奥林匹克(CMO 2025)自测均达到金牌水平(IMO 35分、CMO 105分)。同时,可轻松适配Claude Code等智能体框架与OpenClaw个人AI助理deepseek,支持多步规划与工具调用。

  Ring-2.5-1T基于Ling 2.5架构,通过优化注意力机制,显著提升长文本推理的效率与稳定性。模型激活参数规模从前代的 51B 提升至 63B,但在混合线性注意力架构的支持下,推理效率相比上一代大幅提升。与仅具备 32B 激活参数的KIMI K2架构相比,在1T总参数量下,Ling 2.5架构在长序列推理任务中的吞吐表现依然优势显著,且随着生成长度增加,效率优势持续扩大。

  随着AI大模型应用从短对话向长文档处理、跨文件代码理解、复杂任务规划等场景扩展,Ring-2.5-1T有效缓解了长输出场景下计算开销高、推理速度慢的问题。该模型的开源也体现了蚂蚁百灵团队在大规模训练基础设施、算法优化和工程落地方面的综合能力,为行业提供了高性能、高效率的智能体时代基础模型新选择。

  目前,Ring-2.5-1T 的模型权重与推理代码已在Hugging Face、ModelScope等主流开源平台发布。官方平台Chat体验页和API服务将在近期上线。原文出处:全球首个混合线性架构万亿参数思考模型开源,感谢原作者,侵权必删!

标签: deepseek

“全球首个混合线性架构万亿参数思考模型开源” 的相关文章

DeepSeek联合清北发布DualPath推理框架:吞吐量提升近2倍

DeepSeek联合清北发布DualPath推理框架:吞吐量提升近2倍

  2月27日消息,依旧没等到DeepSeek V4,今天DeepSeek与北京大学、清华大学在ArXiv联合发布了一篇关于全新智能体推理框架DualPath的论文。据了解,该框架旨在解决...

TCL实业CES 2026:SQD-Mini LED显示技术定义“视”界新高度,

TCL实业CES 2026:SQD-Mini LED显示技术定义“视”界新高度,

  拉斯维加斯2026年1月7日/美通社/ -- 2026年1月6日,全球新产品、新技术、新趋势的风向标——国际消费类电子产品展览会(CES 2026)盛大启幕。作为本届CES参展面积最大...

决赛在即:第十届华为ICT大赛中国挑战赛决赛训练营顺利开展

决赛在即:第十届华为ICT大赛中国挑战赛决赛训练营顺利开展

  【中国,杭州,2026年1月27日】2026年1月26日至27日,第十届华为ICT大赛中国挑战赛决赛训练营在华为全球培训中心(杭州)顺利举行。本次训练营共有来自北京航空航天大学、北京邮...

国内创新:红壹科技“AI智能体工厂”,7大部门AI助手全域协同

国内创新:红壹科技“AI智能体工厂”,7大部门AI助手全域协同

  在“加快高水平科技自立自强,引领发展新质生产力”,并全面实施“人工智能+”行动的时代新机遇下,红壹科技正式发布国内创新引领的“AI智能体工厂”,为销售、采购、生产、财务、仓储、人事、综...

刚刚,DeepSeek重要突破!大模型上下文紧箍咒打破

刚刚,DeepSeek重要突破!大模型上下文紧箍咒打破

  当把等量的文本token转化为视觉token(图像)后,DeepSeek-OCR能用更少的token数表达相近的文本内容,   在生产环境中,DeepSeek-OCR...

讲个鬼故事:霍伊伦加盟曼联就进过1粒头球,而塞斯科同期进了8粒!

讲个鬼故事:霍伊伦加盟曼联就进过1粒头球,而塞斯科同期进了8粒!

  除了几个很抽象的单刀 我觉得抢点还可以 射门有时候超神有时候抽象 他有练好头球的条件 但是意愿强不强不知道   除了几个很抽象的单刀 我觉得抢点还可以 射门有时候超神...