首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >DGX Spark 极限压榨!深度优化 DeepSeek-V4:35token/s、单机承载 766K 上下文多智能体服务

DGX Spark 极限压榨!深度优化 DeepSeek-V4:35token/s、单机承载 766K 上下文多智能体服务

作者头像
GPUS Lady
发布2026-07-24 19:55:30
发布2026-07-24 19:55:30
1.2K0
举报
文章被收录于专栏:GPUS开发者GPUS开发者

英伟达开发者论坛用户 entrpi 于 7 月 15 日公开一套深度适配DGX Spark(GB10 Blackwell)的 DeepSeek-V4-Flash 推理分支 ds4-on-spark。早在 5 月初 antirez 发布原生 MLX 推理引擎 ds4 时,该开发者便在官方 CUDA 支持落地前,独立完成全套 CUDA 后端开发。上游官方引擎并未针对消费级 Blackwell 硬件做极致服务性能优化,因此作者持续迭代该分支,历经 10 周、409 次代码提交、新增 9 万余行代码,完成全栈深度优化,今日正式开源。

该项目提供一键部署脚本,执行命令即可自动完成环境编译、模型下载(模型约 91GiB,采用 2-bit 专家量化)、smoke 测试,并开放兼容 OpenAI 接口的 8000 端口推理服务:

代码语言:javascript
复制
curl -sSL https://raw.githubusercontent.com/entrpi/ds4-on-spark/main/install.sh | bash -s -- --start

对比基准:同硬件、同 GGUF 模型、关闭投机解码前提下,该分支性能全面超越上游原版引擎,预填充速度最高可达原版 2 倍。

六大核心性能亮点

1. 推理速度大幅提升,自适应投机解码规避性能损耗

项目核心加速方案为DSpark 投机解码:轻量草稿模型预生成候选 token,主模型批量校验,完全不改变模型输出质量。

数学、问答、代码等结构化任务生成速度可达27–35 token/s,原生无加速基线仅 20 token/s;9 类基准测试平均速度为原生 1.38 倍;

首创动态开关机制:实时监测每条请求收益,一旦草稿模型预测失效,中途自动关闭投机解码;

极端难文本(长篇文学《战争与和平》)最坏场景仅为原生 0.96 倍,而传统固定开启投机解码性能暴跌至原生 0.72 倍,彻底解决投机解码负收益痛点。

Throughput across context frontiers: upstream vs fork, 4 panels
Throughput across context frontiers: upstream vs fork, 4 panels

预填充/生成吞吐量对比图

Ship decode across context frontiers, two corpora
Ship decode across context frontiers, two corpora

投机解码各文本性能曲线

2. 智能体工具调用全加速,无串行降级

常规智能体框架调用工具时,语法校验逻辑会强制切到低速串行推理;本优化分支可让带思考、工具调用的智能体请求全程走批量加速链路:

tool-eval-bench 全思考模式基准耗时 50 分钟,优化后仅 37 分钟,整体墙钟耗时降低 27%,评测指标无衰减;

Hermes 完整智能体框架全流程生成均使用加速通道,无性能回落。

3. 单台设备承载超大并发长上下文

单台 DGX Spark 可同时承载766K 有效上下文:包含 518K token 主智能体对话、248K token 子智能体会话并行运行。

250K 超长上下文首次预填充耗时约 13 分钟;

前缀缓存机制生效后,同对话后续交互仅需 1–2 秒即可启动推理;

完成完整长上下文 “大海捞针” 验证:250K、500K 上下文各 10 轮测试,关键信息埋藏在不同深度,模型全部精准检索命中。

4. 严苛全量测试,模型质量稳定无衰减

所有版本候选均通过全套标准化测试,全部指标达标才发布:

工具调用基准:69 类场景、对抗 / 错误注入模式,三轮重复验证一致性;

超长上下文检索测试;

压力稳定性测试:单条百万级长对话持续运行,同时数十客户端高频并发,内存平稳无泄漏、长对话不丢失;

标准能力评测:GSM8K 数学 96.8、HumanEval 代码 90.9、MMLU 通识 63.9,70 轮长上下文检索全部命中;开发过程中同步修复 2 处底层崩溃 bug,交付版本稳定性拉满。

5. 全栈精细化优化,逼近硬件物理上限

性能提升并非单一技术捷径,而是覆盖全链路数百处效率优化:从 2-bit 量化底层计算内核、调度策略、在线服务层逐层打磨,仅保留相比上一版性能提升的改动。作者表示:目前低于 4-bit 量化的大规模 MoE 模型推理引擎中,该分支已将 Blackwell 桌面硬件压榨至接近物理极限,剩余性能提升空间极小。

6. 为大显存需求 MoE 模型提供单机落地方案

主流适配 NVFP4 量化的开源大模型可在消费级 Blackwell 设备流畅运行;但大量高性能 MoE 模型 4-bit 量化后体积超 140GiB,无法装入 128GiB 统一内存的 DGX Spark。本方案采用 2-bit 专家量化,DeepSeek-V4-Flash 仅占用 81GiB 内存,为这类超大 MoE 模型提供单机、批量、长上下文、无损质量的落地范例。

使用限制与注意事项

投机解码收益分场景:代码、数学、事实问答提升显著,创意文学写作仅与原生速度持平;

极长上下文会小幅拉高单 token 延迟:248K 上下文约 146ms/token,519K 上下文约 177ms/token;超长上下文优势是并发承载量与缓存快速启动,而非原始生成速度;

模型采用 2-bit 专家量化方案,效果优秀,但并非无损原始精度版本。

开源仓库与技术致谢

项目仓库

ds4-on-spark:一键安装脚本、完整基准测试集;

https://github.com/Entrpi/ds4-on-spark

Entrpi/ds4:优化后的推理引擎主分支,包含全部修改记录;

https://github.com/Entrpi/ds4

drafter GGUF:投机解码专用草稿模型权重。

https://huggingface.co/bleysg/DeepSeek-V4-Flash-DSpark-drafter-GGUF

技术溯源底层基础来自 antirez/ds4 原生引擎,DSpark 技术思路与 Modal DFlash 同源;模型由 DeepSeek-AI 开源,2-bit 量化方案由 antirez 设计。

项目价值总结

该项目面向单机 DGX Spark 桌面 AI 超算,打通了 284B 参数 DeepSeek-V4-Flash MoE 模型高性能服务的工程链路,兼顾高吞吐预填充、高速生成、智能体工具加速、百万级并发长上下文四大核心需求,为中小开发者、实验室提供无需多机集群的高性能本地大模型推理完整落地方案。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-24,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 六大核心性能亮点
  • 1. 推理速度大幅提升,自适应投机解码规避性能损耗
  • 2. 智能体工具调用全加速,无串行降级
  • 3. 单台设备承载超大并发长上下文
  • 4. 严苛全量测试,模型质量稳定无衰减
  • 5. 全栈精细化优化,逼近硬件物理上限
  • 6. 为大显存需求 MoE 模型提供单机落地方案
  • 使用限制与注意事项
  • 开源仓库与技术致谢
  • 项目价值总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档