IT时代网8月31日消息,DeepSeek V4系列首个多模态模型DeepSeek-V4-Flash-Vision-Exp已在Hugging Face上线,采用MIT License开源,公开内容包含模型文件、Tokenizer、Prompt Encoding参考实现,以及覆盖视觉编码器、Aligner、DFlash Attention、MoE等核心模块的最小化PyTorch推理实现。
这是DeepSeek V4系列首款原生支持图片输入的视觉模型,官方标注为"Exp"实验版本,于2026年8月21日上线DeepSeek API平台。模型除文本外可接收图片输入,能够描述画面、识别截图中的文字、分析图表,支持JPEG、PNG、GIF、WebP等格式。
深度求索方面表示,该模型在各类Agent框架内展现出较好的多模态适配能力。在Agent、推理、世界知识等纯文本任务上,它与V4-Flash正式版持平;在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。
注:本文综合自IT之家等,文中包含AI辅助创作的内容。