当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布最新技术论文,梁文锋是共创之一

1年前 (2025-02-18)Deepseek最新资讯591

2月18日,DeepSeek官方在海外社交平台X上发布了一篇纯技术论文报告,论文主要内容是关于NSA(Natively Sparse Attention,原生稀疏注意力),官方介绍这是一种用于超快速长文本训练与推理的、硬件对齐且可原生训练的稀疏注意力机制。

具体来说,NSA针对现代硬件进行了优化设计,能够加速推理过程,同时降低预训练成本,且不牺牲性能。它在通用基准测试、长文本任务和基于指令的推理中均能达到或超越全注意力模型的表现。稀疏注意力为提高效率同时保持模型能力提供了一个有前景的方向。

记者注意到,在这篇名为《原生稀疏注意力:硬件对齐且可原生训练的稀疏注意力机制》(Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention)的论文署名中,DeepSeek创始人梁文锋也作为共创在列。

在论文中,DeepSeek团队表示,业界越来越认识到长上下文建模对于下一代大型语言模型的重要性,推动这一需求的应用包括深度推理、仓库级代码生成和多轮自主代理系统。然而,随着序列长度的增加,标准注意力机制的高复杂度成为了关键的延迟瓶颈。

论文提到,理论估计表明,在使用softmax架构(一种用于多分类问题的神经网络架构)时,注意力计算占解码64k长度上下文总延迟的70%-80%,这凸显了对更高效注意力机制的迫切需求。

记者将这一论文提供给DeepSeek,并让其评价对业界的影响与意义,DeepSeek称,这一技术的核心价值在于平衡效率与性能,既降低计算成本,又保持甚至提升模型能力。对行业而言,NSA为处理长上下文任务提供了一种高效的解决方案,有助于推动更强大、更经济的语言模型的发展,尤其是在需要处理长文本的应用场景中。

NSA通过高效的长序列处理能力,使模型能够直接处理整本书籍、代码仓库或多轮对话(如千轮客服场景),扩展了大语言模型在文档分析、代码生成、复杂推理等领域的应用边界。例如,Gemini 1.5 Pro已展示长上下文潜力,NSA可进一步降低此类模型的训练与推理成本。

此外,DeepSeek提到,NSA能够降低算力门槛与部署成本。端到端稀疏训练可以减少预训练所需的计算资源(如减少A100 GPU小时数),降低企业开发大模型的资金与技术门槛。同时,可以加速推理,使长文本生成(如代码补全、故事续写)的实时性更高,适用于边缘设备或低延迟场景。

一位X用户在DeepSeek帖子下表示,“NSA 机制改变了游戏规则。超快速长上下文训练对于扩大教育领域 AI 至关重要,这与个性化学习愿景完美契合。”还有网友对此调侃“RIP Nvidia”。

自1月20日发布DeepSeek-R1并搅动AI圈以来,DeepSeek方面一直较为低调,这是这么多天以来DeepSeek唯一发布的技术动态。

“DeepSeek team is cooking! ”(DeepSeek 团队正在积极工作!)有X网友表示。

(本文来自第一财经)


“DeepSeek发布最新技术论文,梁文锋是共创之一” 的相关文章

深入探索!DeepSeek软件的强大功能与使用技巧

深入探索!DeepSeek软件的强大功能与使用技巧

标题:深入探索!DeepSeek软件的强大功能与使用技巧关键词:DeepSeek,软件使用,数据分析,搜索技巧,智能工具描述:DeepSeek软件以其卓越的数据分析和精准的搜索能力在市场上赢得了广泛关...

超200亿“弹药”来了!问了DeepSeek,如何更好配置科创板

超200亿“弹药”来了!问了DeepSeek,如何更好配置科创板

近年来,指数投资已经成为最常用的投资配置工具。科创板更是A股指数化投资比例最高的板块。根据上交所数据显示,科创板相关指数产品合计规模超2400亿元,占科创板整体自由流通市值比例为8.3%。开年以来,科...

DeepSeek算力需求暴降,为什么全球算力竞赛反而更疯狂了?

DeepSeek算力需求暴降,为什么全球算力竞赛反而更疯狂了?

春节期间,国产大模型DeepSeek-R1的横空出世,一度让人们看到了“降本增效”的曙光。DeepSeek-R1以更低的成本和算力需求,实现了世界一流的模型性能,打破了大模型领域“烧钱买芯片”的传统路...

卓繁信息发布循道 DeepSeek 大模型一体机 打造基垂融合智能体新标杆

卓繁信息发布循道 DeepSeek 大模型一体机 打造基垂融合智能体新标杆

近日,卓繁信息正式推出循道DeepSeek大模型一体机政企双版本,标志着人工智能软硬一体化解决方案在政企领域迈出重要一步。技术创新——双模型驱动构建行业智能中枢循道DeepSeek大模型一体机的核心优...

DeepSeek有望助力全球南方国家跨越数字鸿沟

DeepSeek有望助力全球南方国家跨越数字鸿沟

“我认为DeepSeek有潜力帮助全球南方国家缩小数字鸿沟并加速现代化。”日前在南非举行的数字化转型峰会上,南非人工智能企业Matogen首席执行官雅各布斯·艾蒂安说。随着全球数字化进程加速,人工智能...

从炸圈到质疑,一夜之间Manus经历了什么?

从炸圈到质疑,一夜之间Manus经历了什么?

文 | 明晰野望从开年凭一举之力打破英伟达上涨神话的DeepSeek,到近期阿里、腾讯等大模型加速进化开源,2025是中国科技大年,也是信心修复之年。无论是资本市场还是普罗大众,人们都期待更多王炸出现...