当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

7个月前 (01-27)Deepseek最新资讯97

  【新智元导读】DeepSeek开源DeepSeek-OCR2,引入了全新的DeepEncoder V2视觉编码器deepseek。该架构打破了传统模型按固定顺序(从左上到右下)扫描图像的限制,转而模仿人类视觉的「因果流(Causal Flow)」逻辑。

  这一次,DeepSeek更进一步,对视觉编码器下手了,提出了一种全新的DeepEncoder V2架构,实现了视觉编码从「固定扫描」向「语义推理」的范式转变!

  DeepSeek-OCR2不仅能像人类一样按逻辑顺序阅读复杂文档,还在多项基准测试中刷新了SOTA。

  这就像是给机器装上了「人类的阅读逻辑」,让AI不再只是死板地从左上到右下扫描图像,而是能根据内容语义灵活调整阅读顺序。

  DeepSeek在论文中指出,传统的视觉语言模型(VLM)通常采用光栅扫描(Raster-Scan)顺序处理图像,即固定地从左到右、从上到下。

  人类在看图或阅读文档时,目光是随着逻辑流动的:先看标题,再看正文,遇到表格会按列或按行扫视,遇到分栏会自动跳跃。

  它最大的特点是用一个轻量级的大语言模型(Qwen2-0.5B)替换了原本的CLIP编码器,并设计了一种独特的「因果流查询」(Causal Flow Query)机制。

  它不仅处理视觉Token,还引入了一组可学习的「查询Token」(Query Tokens)。

  编码器通过可学习的查询对视觉Token进行语义重排,随后的LLM解码器则在这个有序序列上进行自回归推理。

  这意味着,DeepSeek-OCR2在编码阶段就已经把图像里的信息「理顺」了,而不是一股脑地扔给解码器。

  DeepSeek披露,在处理在线用户日志图像时,OCR结果的重复率从6.25%降到了4.17%;在PDF数据生产场景中,重复率从3.69%降到了2.88%。

  这不仅是一个OCR模型的升级,更是迈向原生多模态(Native Multimodality)的重要一步。

  未来,同一个编码器只要配备不同的模态查询嵌入(Query Embeddings),就能处理文本、图片、音频等多种模态的数据,真正实现万物皆可Token,万物皆可因果推理。

  DeepSeek表示,虽然目前光学文本识别(OCR)是LLM时代最实用的视觉任务之一,但这只是视觉理解宏大图景的一小部分。原文出处:DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini” 的相关文章

从开源最强到挑战全球最强:DeepSeek新模型给出了解法

从开源最强到挑战全球最强:DeepSeek新模型给出了解法

  Speciale版本是DeepSeek-V3.2的长思考增强版,同时结合了DeepSeek-Math-V2的定理证明能力。目标是将开源模型的推理能力推向极致,探索模型能力的边界。目前仅...

DeepSeek预测:弗赖堡vs多特蒙德!黄蜂军团客场碾压?格里弗PK吉拉西引爆

DeepSeek预测:弗赖堡vs多特蒙德!黄蜂军团客场碾压?格里弗PK吉拉西引爆

  德甲第14轮即将上演黑森林与黄蜂的攻防对决!弗赖堡主场迎战多特蒙德,两支风格迥异的球队将在欧洲公园球场展开较量。主队目前主场4连胜气势如虹,而客队则带着客场2连胜的余威来袭。让我们通过...

银龄学子返校!四川老年大学春季学期开学,无人机摄影、DeepSeek进课堂

银龄学子返校!四川老年大学春季学期开学,无人机摄影、DeepSeek进课堂

  3月9日,四川老年大学2026春季学期开学,校本部与城南教学点同步开学,银发学子们满怀热忱重返课堂,以学习赴新约,用热爱绘芳华,开启新学期的求知之旅。   开学当天,...

两会声音丨全国人大代表何小鹏:期待开启属于智驾领域的“DeepSeek时刻”

两会声音丨全国人大代表何小鹏:期待开启属于智驾领域的“DeepSeek时刻”

  “全自动驾驶会加速落地,并实现从L2到L4的跨越,我们期待开启属于智驾领域的‘DeepSeek时刻’。”何小鹏介绍,小鹏汽车从有图到无图,从规则驱动到端到端量产,再到第二代VLA新范式...

DeepSeek V4读秒:Kimi 游向浅滩,智谱借壳暖春

DeepSeek V4读秒:Kimi 游向浅滩,智谱借壳暖春

  在 DeepSeek-R1 发布一周年之际,《新立场》注意到,DeepSeek 在 GitHub 上更新了大量FlashMLA代码。在114个文件中,一个标有MODEL1的未知大型模型...

用户称近期主要使用豆包而非DeepSeek

用户称近期主要使用豆包而非DeepSeek

  豆包和DeepSeek你们哪个用的多?为啥我感觉我现在主要用豆包,好久没用DeepSeek了原文出处:用户称近期主要使用豆包而非DeepSeek,感谢原作者,侵权必删!...