DeepSeek开放识图模式 AI装上了“赛博手指”

科技日报
105次浏览

近日,DeepSeek开始灰度测试识图模式,并大范围开放给用户体验。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在具体的实测体验中,开启该模式后,用户可以直接上传图片让DeepSeek“看”世界,其能力边界远超简单的文字提取。比如,网友上传在博物馆拍摄的不明文物并开启“深度思考”后,模型不仅详细描述该文物纹理材质,还准确推断出其年代风格;面对时下流行的表情包或梗图,它也能准确理解。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

DeepSeek“开眼”,与其他主流大模型有何能力差异?有哪些优势和不足?科技日报记者就此采访了有关专家。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第一问:DeepSeek识图模式与豆包等其他大模型有何区别?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“与其他大模型相比,DeepSeek识图模式的核心区别集中在技术路径、算力消耗和交互逻辑上。”赛迪顾问人工智能与大数据研究中心分析师白润轩说。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

他解释道,DeepSeek识图模式以“视觉原语思考”为核心。这一核心框架主打精准空间推理和复杂场景解析,而非单纯的文字OCR(光学字符识别)或基础识别。而豆包等模型更侧重结合联网搜索提升识别时效性,多依赖传统图像编码后进行文本理解,空间推理精度稍弱。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

同时,这一框架在实际运行中“算力友好”。白润轩介绍,DeepSeek处理800×800分辨率图片仅消耗约90个tokens(词元),远低于GPT等主流模型,响应速度更快。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

此外,DeepSeek识图模式为独立入口,专注纯视觉理解,不额外启用联网功能,而豆包等大模型会自动联动搜索。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第二问:“视觉原语思考”的核心创新点在哪?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

伴随识图模式的上线,DeepSeek还公开了其背后的多模态模型技术细节,并公布了“视觉原语思考”核心框架。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“这一框架的核心创新点在于跳出主流模型‘堆分辨率’的思路,聚焦解决传统多模态模型的‘指代鸿沟’困境。”白润轩解释。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

传统多模态大模型在面对密集场景时存在一种名为“指代鸿沟”的困境,模型虽然能看见图片,但在推理过程中用“左边那个大的”等模糊的自然语言构建逻辑链时,很容易因描述不准导致注意力漂移。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

而“视觉原语思考”框架将点、边界框等空间视觉元素作为“思维”基本单元,融入模型推理全过程,这就像给模型装上了一根“赛博手指”,让AI在推理时能在“脑海”中精确指出目标物,边想边指,大幅提升复杂空间布局、密集计数等场景的推理精度。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第三问:目前存在的不足及改进方向是什么?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在白润轩看来,DeepSeek识图模式目前主要存在三项不足。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

一是知识库更新偏滞后。其模型训练数据截至2025年,识别2025年底后发布的新型产品易出现型号误判。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

二是高难度场景表现还不稳定。面对视错觉图片、复杂物体计数等反直觉任务时,模型给出的答案稳定性不足,偶发逻辑崩溃。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

三是功能边界较窄。目前仅支持纯视觉理解,暂不具备图像生成、视频理解及跨模态创作能力,且高并发时段偶有解析失败、响应延迟的情况。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“建议后续加快知识库迭代、优化反直觉场景算法;同时拓展多模态功能,进一步提升系统稳定性以适配更多用户的需求。”白润轩说。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

近日,DeepSeek开始灰度测试识图模式,并大范围开放给用户体验。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在具体的实测体验中,开启该模式后,用户可以直接上传图片让DeepSeek“看”世界,其能力边界远超简单的文字提取。比如,网友上传在博物馆拍摄的不明文物并开启“深度思考”后,模型不仅详细描述该文物纹理材质,还准确推断出其年代风格;面对时下流行的表情包或梗图,它也能准确理解。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

DeepSeek“开眼”,与其他主流大模型有何能力差异?有哪些优势和不足?科技日报记者就此采访了有关专家。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第一问:DeepSeek识图模式与豆包等其他大模型有何区别?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“与其他大模型相比,DeepSeek识图模式的核心区别集中在技术路径、算力消耗和交互逻辑上。”赛迪顾问人工智能与大数据研究中心分析师白润轩说。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

他解释道,DeepSeek识图模式以“视觉原语思考”为核心。这一核心框架主打精准空间推理和复杂场景解析,而非单纯的文字OCR(光学字符识别)或基础识别。而豆包等模型更侧重结合联网搜索提升识别时效性,多依赖传统图像编码后进行文本理解,空间推理精度稍弱。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

同时,这一框架在实际运行中“算力友好”。白润轩介绍,DeepSeek处理800×800分辨率图片仅消耗约90个tokens(词元),远低于GPT等主流模型,响应速度更快。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

此外,DeepSeek识图模式为独立入口,专注纯视觉理解,不额外启用联网功能,而豆包等大模型会自动联动搜索。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第二问:“视觉原语思考”的核心创新点在哪?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

伴随识图模式的上线,DeepSeek还公开了其背后的多模态模型技术细节,并公布了“视觉原语思考”核心框架。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“这一框架的核心创新点在于跳出主流模型‘堆分辨率’的思路,聚焦解决传统多模态模型的‘指代鸿沟’困境。”白润轩解释。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

传统多模态大模型在面对密集场景时存在一种名为“指代鸿沟”的困境,模型虽然能看见图片,但在推理过程中用“左边那个大的”等模糊的自然语言构建逻辑链时,很容易因描述不准导致注意力漂移。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

而“视觉原语思考”框架将点、边界框等空间视觉元素作为“思维”基本单元,融入模型推理全过程,这就像给模型装上了一根“赛博手指”,让AI在推理时能在“脑海”中精确指出目标物,边想边指,大幅提升复杂空间布局、密集计数等场景的推理精度。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

第三问:目前存在的不足及改进方向是什么?SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在白润轩看来,DeepSeek识图模式目前主要存在三项不足。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

一是知识库更新偏滞后。其模型训练数据截至2025年,识别2025年底后发布的新型产品易出现型号误判。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

二是高难度场景表现还不稳定。面对视错觉图片、复杂物体计数等反直觉任务时,模型给出的答案稳定性不足,偶发逻辑崩溃。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

三是功能边界较窄。目前仅支持纯视觉理解,暂不具备图像生成、视频理解及跨模态创作能力,且高并发时段偶有解析失败、响应延迟的情况。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“建议后续加快知识库迭代、优化反直觉场景算法;同时拓展多模态功能,进一步提升系统稳定性以适配更多用户的需求。”白润轩说。SJF速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

本文链接:http://m.sushuapos.com/show-2-16253-0.htmlDeepSeek开放识图模式 AI装上了“赛博手指”

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

热门文章

延伸阅读

相关阅读

国内优惠,日本涨价:比亚迪 ATTO 3 改款车型调价 2% 至 450 万日元
3 月 5 日消息,比亚迪近日在日本推出了 ATTO 3(元 PLUS)的改款车型。相比于旧款车,新车的售价提高了 2% 至 450 万日元(备注:当前约 21.6 万元人民币)。该车在价格调整的同时,也对车内配置进行了调整,例如将触摸屏尺寸
五大经济部委齐发声:降准有空间,特别国债投向5大领域,股市失灵将果断出手
21世纪经济报道记者杨志锦 北京报道 “今年将5%左右作为中国经济增长预期目标,是党中央、国务院在综合平衡基础上兼顾当前和长远、需要和可能提出的,是经过科学论证的。这一目标符合
专访全国人大代表、中国地质大学(武汉)校长王焰新:建立多层次立体化“双碳”复合型创新型人才培养体系
21世纪经济报道记者吴文汐 北京报道 3月5日,十四届全国人大二次会议在人民大会堂开幕,国务院总理李强作政府工作报告。“加强生态文明建设,推进绿色低碳发展”被作为2024年的重要任务
张翔:新势力车企2月销量为何显著下滑?
  中新经纬3月7日电 题:新势力车企2月销量为何显著下滑?  作者 张翔 北方工业大学汽车产业创新研究中心研究员  1-2月新势力车企销量/交付量情况  近期,新势力车企陆续公布了2月份的销量或交付量成绩单。从数据
广汽飞行汽车 GOVE 首次在城市公众复杂低空环境完成飞行验证
3 月 10 日消息,据广汽集团官方公众号昨日晚间推文,3 月 8 日,广汽飞行汽车 GOVE 在广州 CBD 上空进行飞行展示,首次完成在城市公众复杂低空环境进行飞行验证,为广汽城市空中交通示范运行探索迈出了重要一步。据介
采用纯视觉智驾 极越获L3自动驾驶测试牌照
近日,极越获颁中国光谷首张L3自动驾驶测试牌照,可在指定区域开展有条件的自动驾驶道路测试。极越将持续提升智能驾驶研发的创新力和硬实力,同时也将助力武汉市在智能驾驶领域的发展和示范应用的落地。  2023年1月,

热点精选

最新推荐

您可能感兴趣