当前位置:首页 > Deepseek最新资讯 > 正文内容

后R1时代:DeepSeek发展的三大阶段

8个月前 (10-16)Deepseek最新资讯306

  ,还是以基础模型 DeepSeek V3-Base 为基座,通过后训练实现了模型能力的提升,弥补了和头部模型之间的差距。

  8月21日,Deep在发布V3.1的同时,也宣布了在国产芯片适配方面的新进展。V3.1采用UE8M0 FP8缩放格式训练,为对即将发布的下一代国产芯片设计。

  此前,国内芯片企业仅有较少支持了FP8数据格式,多数芯片仅能支持FP16格式。FP8虽然可以提升计算速度和降低存储需求deepseek,但是由于计算精度不高,容易损失数据信息,所以V3以前的大模型训练中多会选用BF16或FP32/TF32精度进行数据计算和存储。DeepSeek是首个在开源超大规模大模型中成功落地FP8混合精度训练的公司,推动了FP8技术的规模化应用,也极大地提升了市场对H20等支持FP8格式芯片的需求。

  UE8M0 FP8是对FP8格式的深度优化。该格式仅表示非负数(U代表Unisigned,无符号),尾数位为0(M0,尾数位为0),8个比特全部用来表示指数(E8,指数位占8位),Scale通过对数据进行分块缩放,保持其能够在FP8表示的范围内。UE8M0 FP8作为FP8格式的变体,通过减少数据存储和传输的损耗,能最大限度利用硬件计算能力,弥补国产芯片在HBM等高速内存带宽方面的不足,从而实现国产大模型和国产芯片协同设计的优化,对于国产化芯片的应用起到积极的推动作用。

  9 月发布的 V3.2-Exp,基于 V3.1-Terminus 构建,引入了新的注意力机制 DSA,在保持模型性能的稳定的同时,在训练推理效率方面有了较大的提升,带来了模型较大幅度的降价。

  考虑到当前大模型之间能力差距在缩小,成本的下降意味着模型具有更好的性价比和可推广性,也将促进应用端实现更多功能的落地。

  在国产适配方面进度明显加快。在V3.2-Exp发布的当天,国产芯片华为昇腾和寒武纪同步宣布完成对V3.2-Exp的零日适配。这是继V3.1采用UE8M0 FP8实现国产大模型和芯片协同设计的优化以后,国产AI产业从“单点突破”迈向“系统协同”的又一个标志性事件。

  同时值得注意的是DeepSeek还同时开源TileLang和CUDA两个版本的算子。TileLang是一种采用类Python语法的领域专用语言(DSL),于2025年1月由北大计算机学院杨智团队开源,旨在实现硬件调度与开发者算法逻辑的解耦,从而降低GPU编程的技术门槛,同时通过分层设计来实现不同技术背景开发者,从简单上手到深度优化的不同需求。由于TileLang可以实现对不同硬件平台的支撑,极大地改善了国产卡目前所面对的CUDA带来的生态壁垒问题。

  DeepSeek选用TileLang这个新兴AI编程语言,再次体现了其强大的创新精神,同时为国产大模型软硬件生态建立起到了极大的推动作用。原文出处:后R1时代:DeepSeek发展的三大阶段,感谢原作者,侵权必删!

标签: deepseek

“后R1时代:DeepSeek发展的三大阶段” 的相关文章

《时代》公布2025最佳发明,有DeepSeek、宇树等

《时代》公布2025最佳发明,有DeepSeek、宇树等

  近日,美国《时代周刊》杂志公布了2025年最佳发明榜单,选出了300项年度最具影响力的创新发明,涵盖、人工智能、航空航天、可穿戴技术、农业、教育、娱乐和游戏、饮食、绿色能源、制造与材料...

深度|生物药资产爆发后,中国创新医疗器械何时迎来DeepSeek一刻

深度|生物药资产爆发后,中国创新医疗器械何时迎来DeepSeek一刻

  今年中国创新生物药对外授权引发全球关注。相关数据显示,上半年创新药对外授权金额近660亿美元,让全世界见证了中国生物医药的DeepSeek一刻。   不过在医疗器械领...

如何利用DeepSeek赋能审计工作?

如何利用DeepSeek赋能审计工作?

  随着AI技术的不断发展和应用推广,审计行业正面临着前所未有的变革机遇deepseek。DeepSeek作为国内领先的AI大模型,在审计领域展现出了强大的应用潜力和价值。审计行业作为保障...

新京报2025智慧生活年度案例揭晓,海信空调好空气管家斩获“年度家电智能体创新案

新京报2025智慧生活年度案例揭晓,海信空调好空气管家斩获“年度家电智能体创新案

  1月29日,新京报“2025智慧生活年度榜单颁奖盛典”在北京举行,由海信好空气管家、AI美食管家、AI洗护管家共同组成的海信AI生活管家凭借三大智能体创新与主动服务场景创新,斩获“年度...

外国专家点赞成都魅力 建言打造全球人才向往之城

外国专家点赞成都魅力 建言打造全球人才向往之城

  11月28日,2025高端外国专家座谈会在成都市民营经济发展促进中心举行。现场deepseek,来自俄罗斯、印度、埃及、美国、巴基斯坦、德国、加拿大的8位专家结合自身研究领域,围绕科技...

2月21日DeepSeek预测:掘金vs开拓者,约基奇率队客场复仇

2月21日DeepSeek预测:掘金vs开拓者,约基奇率队客场复仇

  西部第四的丹佛掘金(35胜21负)将客场挑战排名第十的波特兰开拓者(27胜29负),这是两队本赛季第三次交锋。前两次交手开拓者均以微弱优势取胜,其中最近一次是2025年11月1日开拓者...