首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

DeepSeek 多模态模型来了 已公布技术报告|新论文|deepseek

4月30日,《每日经济新闻》记者注意到,DeepSeek在Github上正式发布了多模态模型,公布了背后的技术报告。


图片来源:Github网站

DeepSeek在技术报告中提到,尽管多模态大语言模型(MLLMs)取得了显著进展,但主流的思维链(CoT)范式仍主要局限于语言学领域。虽然近期研究重点通过高分辨率裁剪技术(例如基于图像的思考)来弥合感知鸿沟,却忽视了一个更根本的瓶颈:参照鸿沟。自然语言固有的模糊性往往无法为复杂的空间布局提供精确、明确的指引,导致需要严谨参照的任务出现逻辑崩溃。

而DeepSeek多模态技术报告提出基于视觉原语的思考——这一创新推理框架将点、边界框等空间标记提升为“思维的基本单元”。通过将这些视觉原语直接融入思考过程,DeepSeek的模型在“推理”时能够“指代”,从而将其认知轨迹有效锚定在图像的物理坐标中。

值得注意的是,DeepSeek技术报告提到,其框架基于高度优化的架构,具备极高的视觉标记效率。尽管模型规模紧凑且图像标记预算显著较低,DeepSeek的多模态模型在具有挑战性的计数和空间推理基准测试上,能够与 GPT-5.4、Claude-Sonnet-4.6 和 Gemini-3-Flash 等前沿模型匹配。这为开发更高效、更具可扩展性的System-2类多模态智能指明了方向。

📚 相关阅读

• 直击科创板智能制造公司业绩会:全球化进程提速 具身智能等领域业务进展受投资者关注
• ARR季度大涨300% 迅策“场景Token”定价10-100美元/百万Token|调用|arr|token
• 中欧联合研制的“微笑”卫星成功发射,为空间天气预报提供科学支撑;SpaceX即将成为马斯克旗下第二家上市公司,特斯拉可能遭边缘化——《投资早参》|知名企业|埃隆_马斯克|spacex|埃隆·马斯克|特斯拉(公司)|飞船部署模拟卫星
• 马斯克大战OpenAI 索赔1500亿美元|埃隆_马斯克|openai|埃隆·马斯克
• 一次读完《三体》?DeepSeek-V4预览版上线,标配百万上下文能力|调用|命令提示符|三体(电影)|deepseek
• 助力商家“拎包出海”,苏宁易购推出一站式出海平台|电商|运营|知名企业