兮动人
DeepSeek终于能看图了:视觉模型上线,Agent能力接近Opus 4.8
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
兮动人
社区首页
>
专栏
>
DeepSeek终于能看图了:视觉模型上线,Agent能力接近Opus 4.8
DeepSeek终于能看图了:视觉模型上线,Agent能力接近Opus 4.8
兮动人
关注
发布于 2026-09-04 10:50:19
发布于 2026-09-04 10:50:19
78
0
举报
概述
用过 DeepSeek API 做开发的人,大概率撞过同一堵墙:模型文本推理再强,你把一张截图、一张报表丢过去,它只能回你一句"暂不支持图片输入"。想在 Agent 里让它看屏幕、读图表、照着设计稿写代码,就得自己在外面接一个第三方的视觉模型,拼一个"混合视觉"出来。
文章被收录于专栏:
兮动人的博客
兮动人的博客
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
DeepSeek
#DeepSeek
目录
先说结论:这是补短板,不是下一代
眼睛长上之后,实际能干什么
API 怎么调:三种格式,三种传图方式
方式一:Base64 内联
方式二:外部 URL
方式三:Files API 的 file_id
计费规则:图片先换算成 token
为什么偏偏是现在
回到开头
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档