科技早安 · 一分钟
2026 年 9 月 1 日 · 星期二
DeepSeek 开源首个多模态模型,开发者又多一块免费拼图
早安。新的一周从周二开场,先用一条值得记住的科技信号醒醒脑。
今日信号
DeepSeek 昨天在 Hugging Face 开源了它的第一个多模态模型 —— DeepSeek-V4-Flash-Vision-Exp。能看图、能理解画面,官方定位其 Agent 能力接近 Claude Opus 4.8 那一档。
最关键的一点:采用 MIT 协议,模型文件、分词器、Prompt 编码参考实现和最小化 PyTorch 推理代码全部公开,商用基本零门槛。
为什么值得你关注:多模态(能"看图说话")过去一直是闭源大厂压箱底的能力,现在开源阵营又补上了关键一块。对做应用的开发者来说,意味着以后接一个"看得懂图"的本地或自建模型,成本和门槛又低了一截。
今日冷知识
"多模态"听着玄,其实就是让模型同时吃多种输入——文字、图片、甚至声音,再统一输出。以前的模型大多只能读字,多模态模型能"看见"你发的截图再回答,这正是它和纯文本模型最大的区别。
新工具层出不穷,别焦虑,挑一个真正用得上的就够了。周二愉快,开工大吉。
每日资讯 · 科技早安 | 内容由 AI 辅助生成,经人工核校