当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek后又一神作!清华校友出手,终结ResNet十年统治?

8个月前 (01-02)Deepseek最新资讯107

  【新智元导读】2026年架构革命的枪声已经打响!ResNet用十年证明了「加法捷径」能救训练,但也暴露了「只加不减」的天花板。DeepSeek新年王炸之后,普林斯顿和UCLA新作DDL让网络学会忘记、重写和反转deepseek

  斯坦福著名教授Christopher Manning读完后直言,「2026年,将成为改进残差连接之年」。

  一个是mHC流形约束超连接,一个是DDL深度增量学习,几乎在同一时间,传递出一个强烈的信号:

  2015年,ResNet(残差网络)横空出世后,「加法捷径(shortcut)」几乎成为了深度网络的默认配置。

  ResNet通过残差学习,解决了深度神经网络训练中的核心难题——层数加深,AI性能不升反降。

  如今,无论是CNN、ViT,还是各种混合架构,那条「直接把输入加回去」的残差连接,成为了标配。

  这意味着,对应的线性算子所有特征方向的特征值都是+1,网络只能「平移」状态,而不能反转、选择性遗忘。

  换句话说,旧特征很难被彻底清除,中间表示几乎不会被「反转」,深度网络在表达复杂动态时,显得有些笨重。

  这个设计,让网络状态具备了「记忆矩阵」的含义,也为后续的Delta Rule的对齐埋下了伏笔。

  这是一个rank-1 的对称线性算子,其谱结构异常简单。即d−1个特征值恒为1,只有一个特征值是1−β。

  某些特征会被直接「翻转符号」,深度网络第一次具备了「反向表达」的能力,这对建模振荡、对立关系非常关键。

  DDL明确引入了忘记、重写、反转,让网络可以主动清理无用特征,重构中间表示,让建模成为非单调动态过程。

  DDL不会推翻ResNet,当门控(gate)关闭时,它就是普通残差网络,当它完全打开时,便进入了全新的表达空间。

  这就像是一个「时代切换」的信号,过去模型变强=更大+更深+更多参数,现在「模型变强=更合理的结构约束」。

  此前,他获得了清华大学交叉信息研究院计算机科学硕士学位并成为博士候选人;本科毕业于北京大学元培学院,获数学与计算机科学理学学士学位。

  Yifeng Liu是加州大学洛杉矶分校的计算机博士,本科毕业于清华信息科学与技术学院,姚班出身。

  个人研究方向包括机器学习、强化学习、生成式AI、AI for science以及智能系统应用。

  他曾获得伊利诺伊大学厄巴纳-香槟分校计算机科学博士学位,分别于2007年和2010年获得了清华大学学士和硕士学位。

  个人研究方向是人工智能与机器学习,重点包括非凸优化、深度学习、强化学习、LLM以及深度生成模型。原文出处:DeepSeek后又一神作!清华校友出手,终结ResNet十年统治?,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek后又一神作!清华校友出手,终结ResNet十年统治?” 的相关文章

DeepSeek等获选2025年度“十大科技新闻事件”

DeepSeek等获选2025年度“十大科技新闻事件”

  人民网北京1月29日电 (记者赵竹青)1月29日,中国科技新闻学会发布2025年度“十大科技新闻事件”。它们是:   2025年年初,DeepSeek AI智能助手在...

刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了

刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了

  :目前大语言模型主要通过混合专家(MoE)来实现稀疏化,这被称为「条件计算」。但是,现有的 Transformer 缺少原生的知识查找机制,只能被迫通过计算过程低效地模拟检索行为。...

10月26日DeepSeek预测:雷霆vs老鹰,亚历山大率队客场擒鹰

10月26日DeepSeek预测:雷霆vs老鹰,亚历山大率队客场擒鹰

  亚特兰大老鹰将在州立农业球馆迎战来访的俄克拉荷马雷霆,这是两队新赛季首次交锋。作为东部传统劲旅,老鹰目前1胜1负暂列东部第12,而西部新贵雷霆则以2胜0负的完美开局高居西部第二。...

2025年度十大科技突破:DeepSeek带来“Aha Moment”,脑机芯片

2025年度十大科技突破:DeepSeek带来“Aha Moment”,脑机芯片

  2025年,是联合国教科文组织定义的“国际量子科学与技术年”,也是我国“十五五”规划承前启后的时段。   在这一年,计算范式更迭。“DeepSeek时刻”带来的“Ah...

摩根大通:DeepSeek V3.2为中国AI市场带来第二波冲击 利好多数相关方

摩根大通:DeepSeek V3.2为中国AI市场带来第二波冲击 利好多数相关方

  称,DeepSeek V3.2发布标志中国AI市场迎第二波“DeepSeek冲击”,意味着以中国国内适中的价格即可获得接近前沿模型的开源推理能力,利好中国AI生态的大多数利益相关者,即...

首届AI交易大赛,6个AI炒币2周:Qwen、DeepSeek赚钱,GPT-5血

首届AI交易大赛,6个AI炒币2周:Qwen、DeepSeek赚钱,GPT-5血

  这是第一个专为衡量 AI 投资能力而设计的基准测试,被誉为「币圈版的图灵测试」,由美国人工智能研究实验室 Nof1.ai 于 2025 年 10 月 17 日正式启动,一直持续至 11...