首页
学习
活动
专区
圈层
工具
发布

DeepSeek开源多模态模型V4-Flash-Vision

IT时代网8月31日消息,DeepSeek V4系列首个多模态模型DeepSeek-V4-Flash-Vision-Exp已在Hugging Face上线,采用MIT License开源,公开内容包含模型文件、Tokenizer、Prompt Encoding参考实现,以及覆盖视觉编码器、Aligner、DFlash Attention、MoE等核心模块的最小化PyTorch推理实现。

这是DeepSeek V4系列首款原生支持图片输入的视觉模型,官方标注为"Exp"实验版本,于2026年8月21日上线DeepSeek API平台。模型除文本外可接收图片输入,能够描述画面、识别截图中的文字、分析图表,支持JPEG、PNG、GIF、WebP等格式。

深度求索方面表示,该模型在各类Agent框架内展现出较好的多模态适配能力。在Agent、推理、世界知识等纯文本任务上,它与V4-Flash正式版持平;在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OEcRKQVosIIcXxjQubNdAC2g0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券