当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

2年前 (2025-02-24)Deepseek最新资讯622

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。


据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。


贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。


上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

DeepSeek新数学模型刷爆记录!7B小模型发现671B模型不会的新技能

DeepSeek新数学模型刷爆记录!7B小模型发现671B模型不会的新技能

梦晨 西风 发自 凹非寺量子位 | 公众号 QbitAIDeepSeek放大招!新模型专注数学定理证明,大幅刷新多项高难基准测试。在普特南测试上,新模型DeepSeek-Prover-V2直接把记录刷...

科蓝软件:已成功将DeepSeek-R1模型整合至公司魔聚平台

科蓝软件:已成功将DeepSeek-R1模型整合至公司魔聚平台

人民财讯3月5日电,科蓝软件(300663)3月5日在互动平台表示,公司已成功将DeepSeek-R1模型整合至公司的人工智能应用平台——魔聚平台。具体来说,魔聚平台成功部署并全面投入使用了DeepS...

青岛市医保局实现DeepSeek本地化部署

青岛市医保局实现DeepSeek本地化部署

为响应国家“人工智能+”战略部署,青岛市医保局积极探索人工智能技术与医保管理的深度融合,使用青岛市大数据局部署的DeepSeek大模型和青岛市医保局本地部署的Deepseek大模型,成功上线“医保政策...

DeepSeek-R1“思维学”;苹果:原生多模态模型的Scaling Laws|今日热门论文

DeepSeek-R1“思维学”;苹果:原生多模态模型的Scaling Laws|今日热门论文

速览热门论文1.DeepSeek-R1“思维学”2.苹果:原生多模态模型的 Scaling Laws3.7B 模型超越 o1!视觉推理新突破:所需样本少,还能自提升4.MIT 团队提出“自我引导”LM...

优刻得与百事通战略合作 合力推进DeepSeek一体机司法领域应用

优刻得与百事通战略合作 合力推进DeepSeek一体机司法领域应用

人民财讯4月9日电,记者从优刻得获悉,优刻得与上海百事通信息技术股份有限公司达成战略合作。双方将携手推出DeepSeek一体机司法解决方案,实现“高安全国产算力+垂直领域数据资源”的技术融合,为司法行...

中信证券:看好DeepSeek新一代模型带动云端推理需求爆发

中信证券:看好DeepSeek新一代模型带动云端推理需求爆发

中信证券发布研报指出,DeepSeek通过工程化能力创新,实现了大模型训练和推理算力成本的极致优化,也为端侧部署高性能模型提供新的方向。中信证券看好DeepSeek新一代模型带动云端推理需求爆发,加速...