首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >DeepSeek终于能看图了:视觉模型上线,Agent能力接近Opus 4.8

DeepSeek终于能看图了:视觉模型上线,Agent能力接近Opus 4.8

作者头像
兮动人
发布2026-09-04 10:50:19
发布2026-09-04 10:50:19
780
举报
概述
用过 DeepSeek API 做开发的人,大概率撞过同一堵墙:模型文本推理再强,你把一张截图、一张报表丢过去,它只能回你一句"暂不支持图片输入"。想在 Agent 里让它看屏幕、读图表、照着设计稿写代码,就得自己在外面接一个第三方的视觉模型,拼一个"混合视觉"出来。
文章被收录于专栏:兮动人的博客兮动人的博客

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 先说结论:这是补短板,不是下一代
  • 眼睛长上之后,实际能干什么
  • API 怎么调:三种格式,三种传图方式
    • 方式一:Base64 内联
    • 方式二:外部 URL
    • 方式三:Files API 的 file_id
  • 计费规则:图片先换算成 token
  • 为什么偏偏是现在
  • 回到开头
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档