当前位置:首页 > Deepseek最新资讯 > 正文内容

Deepseek-R1 等 AI 模型测试:英伟达 GB200 NVL72 性能

9个月前 (12-04)Deepseek最新资讯162

  IT之家 12 月 4 日消息,科技媒体 Wccftech 昨日(12 月 3 日)发布博文,报道称在“混合专家”模型上,

  IT之家注:混合专家模型(MoE)是一种高效的 AI 大模型架构。它不像传统模型那样在处理每个任务时都动用全部“脑力”(参数),而是像一个专家团队,根据任务类型只激活一小部分最相关的“专家”(参数子集)来解决问题。这样做能显著降低计算成本,提高处理速度。

  就像人脑使用特定区域执行不同任务一样,混合专家模型使用路由器来选择最相关的专家来生成每个 token。

  英伟达为了解决 MoE 模型扩展时遇到的性能瓶颈,采用了“协同设计”(co-design)的策略,该方法整合了 GB200 的 72 芯片配置deepseek、高达 30TB 的快速共享内存、第二代 Transformer 引擎以及第五代 NVLink 高速互联技术。

  通过这些技术的协同工作,系统能够高效地将 Token 批次拆分并分配到各个 GPU,同时以非线性速率提升通信量,从而将专家并行计算(expert parallelism)提升至全新水平,最终实现了性能的巨大飞跃。

  除了硬件层面的协同设计,英伟达还实施了多项全栈优化措施来提升 MoE 模型的推理性能。例如,NVIDIA Dynamo 框架通过将预填充(prefill)和解码(decode)任务分配给不同的 GPU,实现了任务的解耦服务,允许解码阶段以大规模专家并行方式运行。

  同时,系统还采用了 NVFP4 格式,这种数据格式在保持计算精度的同时,进一步提高了性能和效率,确保了整个 AI 计算流程的高效稳定。

  该媒体指出,此次 GB200 NVL72 取得的性能突破,对英伟达及其合作伙伴具有重要意义。这一进展成功克服了 MoE 模型在扩展时面临的计算瓶颈,从而能够满足日益增长的 AI 算力需求,并巩固了英伟达在 AI 服务器市场的领先地位。原文出处:Deepseek-R1 等 AI 模型测试:英伟达 GB200 NVL72 性能较 HGX 200 提升 10 倍,感谢原作者,侵权必删!

标签: deepseek

“Deepseek-R1 等 AI 模型测试:英伟达 GB200 NVL72 性能” 的相关文章

今起实施!AI生成内容必须带“身份证”,腾讯、抖音、快手、B站、DeepSeek

今起实施!AI生成内容必须带“身份证”,腾讯、抖音、快手、B站、DeepSeek

  带货视频中的明星配音、短视频里突然出现的名人,可能并非本人,而是AI生成——从9月1日起,它们必须亮明身份。   9月1日,由国家互联网信息办公室、工业和信息化部等部...

雷军挖来前DeepSeek核心罗福莉 专家:算法就是人才!罗福莉只是开始|宅男财

雷军挖来前DeepSeek核心罗福莉 专家:算法就是人才!罗福莉只是开始|宅男财

  罗福莉在朋友圈发文说:“我正在Xiaomi MiMo(小米首个推理大模型),和一群富有创造力、才华横溢且真诚热爱的研究员,致力于构建这样的未来,全力奔赴我们心目中的AGI。”...

1月30日DeepSeek预测:雷霆vs森林狼,西部榜首大战,亚历山大率队复仇

1月30日DeepSeek预测:雷霆vs森林狼,西部榜首大战,亚历山大率队复仇

  西部榜首雷霆将客场挑战季后赛席位竞争者森林狼,这场西北分区内战因两队近期截然不同的走势而充满看点。森林狼作为联盟传统劲旅,本赛季在爱德华兹和戈贝尔带领下稳居西部第六,而青年军雷霆则以7...

DeepSeek 这么评价占豪,你觉得对吗?

DeepSeek 这么评价占豪,你觉得对吗?

  昨天问了DeepSeek一个问题,让它详细介绍一下“占豪”。下面的文字占豪是一个字都没改的转发过来了。通过这一份AI收集、学习信息后的介绍我们可以看到,网络信息量是能否对一个人、一个事...

锤炼新时代“笔杆子” 长乐区总工会举办公文写作规范与实战能力提升培训

锤炼新时代“笔杆子” 长乐区总工会举办公文写作规范与实战能力提升培训

  公文是党政机关传递政策、沟通信息、推动工作的重要载体,其质量直接关系党的意志和方针政策的传达贯彻成效。   为全面提升全区干部职工公文写作规范化水平,切实增强服务决策...

移动云2025年度回顾:智向远大

移动云2025年度回顾:智向远大

  作为云计算“国家队”,移动云抓住新一轮科技革命和产业变革的历史机遇,以“由云向智”为核心战略,成为支撑中国“人工智能+”行动与数字中国建设的重要力量。   算力网络是...