首页
学习
活动
专区
圈层
工具
发布

DeepSeek 能看图了!实验性视觉模型今日上线

摘要: 8 月 22 日,DeepSeek 官宣实验性视觉理解模型 V4-Flash-Vision-Exp 上线 API 平台。V4 系列首次补齐"眼睛",多模态 Agent 基准逼近 Claude Opus-4.8,并同步推出免费 Files API。这是中国 AI 多模态能力的一次关键补位。

8月22日,DeepSeek官方宣布,实验性视觉理解模型DeepSeek-V4-Flash-Vision-Exp已在API平台上线。这是V4系列首次补齐视觉能力,文本能力与原版持平,图像理解类Agent基准大幅跃升。

据环球网等媒体报道,新模型在视觉理解类Agent基准测试中表现接近Claude Opus-4.8水平,补齐了V4全系此前无视觉能力的短板。对开发者而言,多模态Agent终于从“读字”迈向“看世界”。

同步推出的还有免费的Files API与DeepSeek Harness 0.1.1。开发者可用它处理图文混合任务,图片最多折算384个token,价格沿用V4-Flash档位。低成本多模态,正中工程落地痛点。

为什么这件事值得严肃看待?视觉理解是AI走进物理世界的关键一步。能“看懂”图纸、屏幕、仪表、货架,Agent才能从聊天框走向工厂巡检、医疗影像、零售盘点等真实场景。

背景上看,今年7月DeepSeek V4 Flash凭借极致性价比登顶OpenRouter周度全球调用量榜;此前上线的“识图模式”本质上只是OCR读字,这一次才是真正的多模态视觉语言模型。

国产AI正从“拼文本”转向“拼多模态、拼成本”。在算力受限的大背景下,DeepSeek以架构优化与工程创新,把高端能力做成可负担的API——这正是中国AI的务实突围路径。

当然要冷静:实验性模型仍有边界,复杂视觉推理、长图理解、幻觉控制仍需迭代。但一条清晰信号已经发出——国产开源模型,正在把“能看、能用、便宜”三者同时交付。

关注本号,第一时间看懂中国 AI 进展。你觉得多模态 AI 最先会在哪个行业上岗?评论区聊聊,也欢迎把这篇转给同样关注科技的朋友。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OH2qeapJ7JwVuLYulIZ_OlpQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券