当前位置:首页 > DeepSeek技术交流 > 正文内容

DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?

4个月前 (02-26)DeepSeek技术交流269

一开始,我还以为 DeepSeek 会走传统路线,比如大厂常见的蒸馏技术,搞个小参数的 Flash 模型。毕竟这种方法能有效降低计算需求,但缺点也很明显,就是小模型再怎么优化,和大模型比起来,性能还是会有损失 结果 DeepSeek 完全没按套路出牌,它不是去压缩模型,而是换了个角度,直接假设未来算力足够,然后想办法更高效地用好现有显卡架构。换句话说,不是缩小参数规模,而是在同等规模下优化计算方式,让计算更具性价比 这种思路比纯工程优化要“硬核”得多。一般来说,搞小模型是比较务实的工程方案,但 DeepGEMM 这种技术驱动的做法更有延展性。它不仅和小模型方法兼容,而且即使以后显卡更强、模型规模更大,这套技术依然能继续用,不会过时

“DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?” 的相关文章

一周两场,场场火爆!Deepseek+数字人营销训练营吸引百余位青岛企业家参加:必须学会新武器

一周两场,场场火爆!Deepseek+数字人营销训练营吸引百余位青岛企业家参加:必须学会新武器

面对人力成本攀升、爆款内容稀缺、矩阵账号管理低效等难题,AI已成为企业降本增效的“救命稻草”。4月17日-18日,由半岛都市报风口财经联合青岛市女企业家协会、青岛市时装设计师协会、小冰华北运营中心举办...

南网储能:公司已私有化部署DeepSeek-R1模型

南网储能:公司已私有化部署DeepSeek-R1模型

每经AI快讯,有投资者在投资者互动平台提问:董秘您好,公司官微发布‘储能LCDP’助推南网储能多业务领域数字化转型,未来是否会考虑与deepseek合作,进一步完善数字化转型?南网储能(600995....

美国将禁用中国企业深度求索DeepSeek?中方回应

美国将禁用中国企业深度求索DeepSeek?中方回应

路透社当地时间3月7日引述知情人士称,出于所谓“国家安全”考虑,美国特朗普政府正在考虑禁止中国企业深度求索(DeepSeek)的人工智能(AI)工具在美国政府设备上使用。在3月10日举行的中国外交部例...

国脉文化:目前公司部分产品已接入DeepSeek等多种主流开源大模型

国脉文化:目前公司部分产品已接入DeepSeek等多种主流开源大模型

每经AI快讯,有投资者在投资者互动平台提问:董秘您好!请问贵公司是否已经部署了DeepSeek?如果已经部署了,请问主要应用于哪些具体的业务?公司接入DeepSeek有哪些成本、收益方面的考量?如果公...

陕西多所高校正式接入DeepSeek 为师生提供智能化个性化服务

陕西多所高校正式接入DeepSeek 为师生提供智能化个性化服务

近期,陕西多所高校纷纷将人工智能平台与DeepSeek对接,为师生提供从科研助手到智能辅助教学,从跨学科资源整合到校园生活助手等一系列智能化、个性化服务。西安交大“交小智”可让师生创建专属AI应用20...

盛视科技:已完成DeepSeek大模型的接入

盛视科技:已完成DeepSeek大模型的接入

金融界4月10日消息,有投资者在互动平台向盛视科技提问:请问公司是否考虑接入deepseek系统或者与其公司进行合作?公司回答表示:公司已完成 DeepSeek 大模型的接入。公司接入DeepSeek...