DeepSeek V4 Pro 才发布了多久啊,新东西又来了……刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态 但有个问题,明明 DeepSeek V4.1 Flash 模型是原生多模态的,却在 DeepSeek Harness 中显示「不支持图片」:没关系,咱们换个其他的 AI 工具试试,我这里随便用个国产的 -0910,并且输入类型一定要把「图片」勾选上:保存之后,就能愉快使用 DeepSeek V4.1 Flash 了,能够正常识图! 简单测试下来,我发现 DeepSeek V4.1 Flash 的速度真心非常快,大概是新模型还没多少人知道的原因吧,也算是带大家吃一波螃蟹了。 目前 DeepSeek V4.1 Flash 的计费和 DeepSeek V4 Flash 完全相同,不过看官方的意思,估计 V4.1 Flash 发布后会降价?我不知道,我猜的,我希望如此。
——DeepSeek官方公告,2026年9月10日[^1]翻译一下:Flash长大了,轮到Pro退休。 北京时间9月14日12:00之后,所有打给deepseek-v4-pro的请求会被静默路由到V4.1Flash,按Flash的单价计费,直到V4.1Pro上线为止[^2]。 deepseek-v4-flash和deepseek-v4-flash-vision-exp已下线,旧名暂时路由到V4.1Flash,别指望长期有效。9月14日12:00是硬deadline。 在那之后deepseek-v4-pro静默切走,按Flash计费。没有公开的opt-out机制。 内测版模型名deepseek-v4.1-flash-expires-on-0910已失效,正式版是deepseek-flash。C端三模式合并了。
9月8日DeepSeek官方交流群里突然甩出一条内测通知:DeepSeekV4.1Flash内测的中间版本开放试用,新架构、原生多模态、更快更强,而且——不用申请,改个模型名就能调。 V4.1Flash内测是DeepSeek在2026年9月8日于官方交流群放出的一个中间版本测试,类似把训练途中的某个checkpoint丢进真实API环境里试跑。 只要你有DeepSeek账号和APIkey,老接口不用动,模型名换成下面这个:展开代码语言:TXTAI代码解释deepseek-v4.1-flash-expires-on-0910官方强调base_url 四、计费与限流:价格和v4-flash一样,先算清账再上手计费这块最容易想当然。官方口径是:内测期间计费与deepseek-v4-flash完全相同,并不是「内测就白嫖」。 顺便注意一下,DeepSeek的Flash系列正式价会在9月10日中午下调(我另一篇整理过),价格和到期撞在同一天,账别算岔。
直连DeepSeekV4.1Flash时,在https://api.deepseek.com使用deepseek-flash。充值前先选平台与协议,估算任务费用,再配置同一平台签发的Key。 调用平台本次核查确认的范围充值前检查DeepSeek直连API官方文档确认deepseek-flash对应V4.1Flash账户权限、当前价格和所需操作读取的公开目录显示旧DeepSeek条目,本次未确认 V4.1服务路由实际模型版本与ID、协议、账户价格及支付条款其他网关本文未验证自身当前目录、协议文档与计费条款这一结果是核验边界,不是不可用的证明。 官方deepseek-flash现在对应V4.1Flash。旧Flash名称是兼容别名,expires-on-0910beta配置则属于更早发布阶段。 旧客户端目录可能没有deepseek-flash,网关也可能用另一个ID。不要假定各供应商的未知模型错误一样。
昨天 DeepSeek V4.1 Flash 发布后,我们想来做个测评,但是鹈鹕骑车、放烟花之类的测试 case 太常见了,现有代码仓库又比较敏感。所以,思前想后,我们这次换了一个稍微麻烦点的测试。 把一篇论文 PDF 放进空项目,让 DeepSeek V4.1 Flash 自己读论文、理解公式、实现核心算法、写测试,再设计实验验证自己的实现。 当然喜闻乐见的 DeepSeek V4.1 Flash 不堪一击没发生,结果是:Astra 三轮都没有推翻 V4.1 Flash 的核心算法实现。 V4.1 Flash 初版我们通过 dsh 接入 DeepSeek V4.1 Flash,把论文放进项目目录。 三轮之后这个实验最初想回答的问题是:DeepSeek V4.1 Flash 能不能读一篇论文,把算法写出来?到最后,答案分成了三层。第一层是代码。
不是新番,是 DeepSeek 又降价了——而且这次连带着把 V4.1 Flash 这个新模型也端出来了。 DeepSeek 创始人梁文锋,降价、性能好、便宜的时候被尊称"梁圣""梁祖";8 月那波涨价,又被人叫"梁子""小梁"。这回 V4.1 Flash 一出,梁圣又回来了。 V4.1 Flash 香在哪9 月 8 日晚开启中间版本内测,模型名 `deepseek-v4.1-flash-expires-on-0910`(9 月 10 日到期下线)。 接进 WorkBuddy 怎么搞想试 V4.1 Flash:在 WorkBuddy 的自定义模型里,把模型名改成 `deepseek-v4.1-flash-expires-on-0910`(base_url 你平时用 DeepSeek 跑啥任务?评论区说出来,我帮你算算怎么靠缓存命中把账单砍六成。
刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归大家好,我是程序员鱼皮。刚刚,DeepSeek 正式发布了 V4.1 Flash 模型。 炸裂的是,DeepSeek 官方称:V4.1 Flash 在性能、费用、速度、总用时等各项指标上已经全面超越 V4 Pro!好家伙,自家的快速模型吊打旗舰模型? 怎么用 V4.1 Flash如果你用的是 DeepSeek Harness,更新一下版本,V4.1 Flash 就可以直接在模型列表里选了,不需要额外配置。 如果你是通过 API 调用 V4.1 Flash,现在模型名简化成了 deepseek-flash,不用修改 base_url。 最后再分享个小故事,关于 V4 Pro 下线这件事,DeepSeek 的本意是给用户免费升级模型,V4 Pro 的请求自动路由到 V4.1 Flash,还按更便宜的 Flash 价格计费。
9 月 10 日中午 12 点,DeepSeek 的「梁圣归来」大戏迎来第二幕:V4.1 Flash 正式版上线,同时 Flash 系列 全新低价生效。 > 出处:DeepSeek 开放平台公告(9/9 挂出)、掘金《DeepSeek V4.1 Flash 来了,明天中午 Flash 降价 60%》、腾讯新闻《刚刚,DeepSeek 又要大降价了,最高 二、还有一招「升级降价同步」公告里最狠的一句:在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,平台会把所有指向 V4 Pro 的 API 请求自动路由到 V4.1 Flash,并按 多个开发者反馈:V4.1 Flash 速度暴涨——峰值 507 tokens/秒,平均稳定在 300+ tok/s,比旧 V4 Flash(约 97 tok/s)快近 2–3 倍。 评论区说说你跑一次花多少、主要跑什么任务,我帮你算算切到 V4.1 Flash + 抠缓存命中能省几成,把「缓存命中配置清单」一并发你。
2.3DeepSeekV4.1Flash的缓存优化方向根据官方公布的信息,DeepSeekV4.1Flash针对KVCache进行了压缩优化。 DeepSeek此前多次调整API价格体系,并引入峰谷计费机制。不同时间阶段的价格变化,也体现了模型服务商对于算力供需和用户调用习惯的动态调整。 5.1Harness与Agent运行环境根据公开信息,DeepSeek生态中的Harness工具正在尝试让模型与运行环境结合得更加紧密。 例如:一个团队同时使用:DeepSeek;GPT;Claude;Gemini。如果每个模型分别维护:APIKey;请求地址;SDK配置;调用记录;长期管理成本会增加。 八、DeepSeekV4.1Flash迁移检查清单如果你的项目正在使用旧版本DeepSeek模型,可以按照以下步骤进行迁移。
9月10日 DeepSeek 就发布 V4.1 Flash,依旧是低调发布,只是邮件通知。 大致意思是 V4.1 Flash 性能、费用、速度、总用时等各项指标上全面超越 V4 Pro。 V4.1 Flash 正式上线之后 V4.1 Pro 上线之前,V4 Pro 的请求会全部路由到 V4.1 Flash,按 V4.1 Flash 单价计费。 DeepSeek V4.1 Flash 参数及架构 552B 骨干参数 MoE,1M token 上下文,原生多模态,HF 上的 pipeline 标记是 image-text-to-text。 届时 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,并按 Flash 单价计费。 官方公告《DeepSeek V4.1 Flash:更强、更快、更普惠》:https://www.deepseek.com/news/deepseek-v4-1-flash/ (2026-09-10) DeepSeek
发布日期:2026-09-10|适用读者:MLOps工程师、私有化部署团队、想本地跑DeepSeek的开发者DeepSeekV4.1Flash部署指的是把深度求索(DeepSeek)2026年9月10日以 --reasoning-parser与--tool-call-parser:V4.1的工具调用用DSML标签块而非JSON,解析器名称都是deepseek_v41。 DeepSeek官方API中V4.1Flash的模型名为deepseek-flash,非高峰时段输入每百万token0.15美元、输出0.60美元,并发上限2500。 Q:MacStudio512GB内存能跑DeepSeekV4.1Flash吗?目前不能。llama.cpp尚未合入V4.1架构支持,没有GGUF版本。 参考资料DeepSeek-V4.1-Flash模型卡与inference/encoding目录:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
收到的一张用量页通知截图显示:DeepSeek计划于北京时间2026年9月10日前后正式发布V4.1Flash。通知同时提到,Flash上线后,V4Pro请求将有一段临时路由调整。 我们尚未从DeepSeek公开页面独立获取到同一条通知;本次检查的官方定价页仍列出V4型号,未提供V4.1Flash价格表。下图是发布时间和路由安排的来源,公开文档则用于后续核对正式变更。 通知把V4.1Pro上线作为这段临时安排的终点,但没有给出V4.1Pro的发布时间,也没有说现有V4Flash请求会按相同方式变化。不要把V4Pro的安排扩大到全部DeepSeek型号。 不要把V4.1Flash这个展示名称自行拼成APIID。正式信息应查看DeepSeek定价文档和更新日志。现有DeepSeek价格指南介绍的是此前V4费率,不是V4.1报价。 调用DeepSeek,要注意什么?在模型目录核对实际条目、模型ID和账户适用价格。本文不代表已上架V4.1Flash,也不承诺截图中的路由安排适用于请求。
几乎和 Astra 全量开放同一天,DeepSeek 放出了 V4.1 Flash 的详细技术报告,Hacker News 直接置顶。 所以:- 上下文越长,KV 占的显存越多- 并发越高(很多人同时问),显存越爆- KV 大小直接决定"一台机器能撑多少并发、多长上下文"过去大家靠量化(INT8/INT4)压 KV,但 DeepSeek 二、CSA2 怎么把 KV 压到 890 字节V4.1 Flash 用了两个关键设计:- CED 架构(Causal Encoder-Decoder):20 层因果 encoder 喂 20 层 decoder 适合做"主力廉价层":把高频、对极致智能不敏感的任务全丢给它,把贵模型留给少数重活四、选型:Astra 还是 DeepSeek V4.1 Flash一句话:- 要极致智能、长文档综合推理、会操作电脑 → Astra(但贵)- 要海量并发、低成本、长上下文通吃 → DeepSeek V4.1 Flash(成本约 1%)很多团队的正确姿势是"两层架构":V4.1 Flash 当默认主力,Astra 只处理真正难的任务
把大模型当办公楼看,就懂 DeepSeek 为什么敢一直降价 9 月 10 日,DeepSeek 发布了新模型 V4.1 Flash。 DeepSeek V4.1 Flash 的做法:读到第 20 层,把全部理解压缩成一份「会议纪要」,交给写作区。 21 到 40 层共用这份纪要干活,不再各自记笔记。 每个字的笔记:少了四分之三运行时全局 KV 缓存(字节/Token)上一代 V4 Flash≈3560 BV4.1 Flash890 B↓ 降到约 1/4持久存储(地下仓库常年占用)上一代100%V4.1 Flash≈1/8代价:翻旧账时重读最近几页重建,官方未公布极端恢复耗时数据:DeepSeek 官方发布 · 2026-09 三板斧压到八分之一 会议纪要只是第一刀。 #DeepSeek #大模型 #AI成本 #人工智能#科技前沿 数据来源:DeepSeek V4.1 技术报告与官方发布(2026-09-10)· Terminal-Bench、DeepSWE 官方评测口径
这次我们分别用真实 Benchmark 数据和 DeepSeek V4.1 Flash 的论文图跑了一遍这两条工作流。 其中 DeepSeek V4.1 Flash 使用官方公开成绩,其余主要参考 Artificial Analysis 公开数据。 参考 DeepSeek V4.1 Flash 技术报告 Figure 10 生成一张新图plot-from-data 解决的是“手里已经有数据,怎么从现成论文风格开始画”。 这次我们选了 DeepSeek V4.1 Flash 技术报告中的 Figure 10 作为参考。 图 3:DeepSeek V4.1 Flash Figure 10 原图接下来把 plot-from-image 安装到当前项目:& 'C:\Users\斌斌\.cache\codex-runtimes
它发生在 Kimi 冲刺港股 IPO 的节点上,叠加近期 GPT-6 Astra、DeepSeek V4.1 Flash 密集发布的背景,国产模型的迭代节奏肉眼可见地加快了。 本文只聊一件事:百万上下文对你写代码到底有什么用,以及 K2.8 / DeepSeek V4.1 Flash / GPT-6 Astra 这三款,各自该在什么场景用。 场景二:Agent 跑长流程、调 API 很多用 DeepSeek V4.1 Flash。它便宜、快,长程 Agent 动辄几十轮调用,成本差异会被放大。 一个实用组合:日常 80% 的活儿用 Flash(省钱),长文本理解用 K2.8(省事),卡住的硬骨头用 Astra(省力)。三款不是互斥,是各管一段。- 上下文长 ≠ 记得准。 小任务用大窗口纯属浪费 token,Flash 这类中等窗口反而更稳更快。模型越来越多、越来越强,但"会用组合"比"追新款"重要得多。
放一起比就清楚了:- GPT-5.6 Sol(上代):更便宜,但 Astra 的 token 效率高 70%(同样任务用更少 token)- DeepSeek V4.1 Flash:缓存命中价低到 $0.003 四、避坑:谁该上,谁先等等先别急的:- 成本敏感的小项目、MVP 验证阶段 → 先用 DeepSeek V4.1 Flash / 商汤免费额度把流程跑通- 纯检索问答 → 小模型 + RAG 更划算可以冲的
DeepSeek把三种模式合成一个,为什么速度反而更快了摘要我翻了下DeepSeek近几版的更新记录,这次V4.1把原本分开的模式收进了一个入口,Flash被放在发布页最显眼的位置。 V4.1这次把这道开关收了回去,让模型自己决定要不要想,这才是本次更新里最值得琢磨的动作,比命名和发布页排版重要得多。先说清楚三种模式原先各自在算什么。 Flash这个词大概率落在解码侧:投机解码提高接受率、KVcache更激进的量化、prefill与decode分离后按负载重新配比资源。这些细节不会写进发布页,但会体现在首token那条曲线上。 标签#DeepSeekV4.1#DeepSeekFlash#DeepSeek三种模式合一#国产大模型#DeepSeek最新版本发布#大模型推理速度#AI模型对比#DeepSeek使用体验
V4.1Flash内测的消息还没凉透,DeepSeek又甩了一张价目表出来——这次是真的降价,而且打到了Flash系列头上。 9月9日,DeepSeekFlash系列降价公告挂上开放平台,从明天中午开始,deepseek-v4-flash和deepseek-v4-flash-vision-exp两款模型一起调价,缓存命中输入直接砍到 一、先看价格:9/10中午生效,双时段调价DeepSeek开放平台9月9日发公告,自北京时间2026年9月10日12:00起调整Flash系列模型调用价格,涉及deepseek-v4-flash和deepseek-v4 9月8日V4.1Flash刚官宣内测,9月9日Flash系列就降价,很难不让人多想一层:这一波是在给Flash线的走量和V4.1的正式落地腾位置。 觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:这次Flash降价后,你会把哪部分流量迁到deepseek-v4-flash上?
最近 HuggingFace 上有个 DeepSeek V4 Flash 量化版 突然火了——更狠的是,作者是 antirez(Redis 作者 Salvatore Sanfilippo) 我查了一下 简介 事情其实是这样的:antirez 同步开源了两件配套的事: DeepSeek V4 Flash 的专用量化版 GGUF:托管在 huggingface.co/antirez/deepseek-v4 -gguf DwarfStar 4(简称 ds4):一个专门为 DeepSeek V4 Flash 设计的推理引擎,托管在 github.com/antirez/ds4 注意定语:ds4 不是通用 GGUF : 文件 适合场景 量化重点 DeepSeek-V4-Flash-IQ2XXS-w2Q2K-... 通用性差是事实 不要指望它能跑 Qwen、Llama、其他 DeepSeek——它就只跑 V4 Flash,换模型就得换引擎 总结 ds4 + DeepSeek V4 Flash GGUF 这套组合,是