首页
学习
活动
专区
圈层
工具
发布

DeepSeekV4视觉模型上线,多模态Agent能力已接近Opus-4.8

【太平洋科技快讯】据第一财经报道,8 月 21 日下午,DeepSeek 官方 API 文档的模型详情页面上线新模型 DeepSeek-V4-Flash-Vision-Exp。

据悉,这是 V4 系列当中首款原生支持图片输入的视觉模型。该模型具备 100 万上下文窗口,最大输出长度 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 兼容以及对话前缀续写,图片将依据尺寸折算为 Token,和文本 Token 合并计费。

在纯文本能力方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

在定价层面,DeepSeek-V4-Flash-Vision-Exp 现阶段 API 资费与普通 V4-Flash 保持一致。缓存命中场景下,空闲时段 0.05 元 / 百万 Token,高峰时段 0.10 元 / 百万 Token;缓存未命中空闲时段 1.5 元 / 百万 Token、高峰时段 3 元 / 百万 Token;输出 Token 空闲 4.5 元 / 百万 Token,高峰 9 元 / 百万 Token。

距离 DeepSeek 开源 Agent Harness 框架刚过去一周,视觉能力便完成接入。以往相互独立的模型、图片、文件、工具、Agent 执行链路得以打通,DeepSeek 补齐了 Agent 体系重要的感知输入环节。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OL4gNOIUEwocHJCwZV42Kd8Q0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券