首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >又一神器火爆了!上下文压缩98%,帮Cladue Code省下一大笔Token费用

又一神器火爆了!上下文压缩98%,帮Cladue Code省下一大笔Token费用

作者头像
OpenNiuma
发布2026-07-20 13:14:03
发布2026-07-20 13:14:03
620
举报

一次 ls -la 吃掉56KB上下文,跑半小时任务40%的空间就没了。Claude Code 不是变笨了,是窗口被撑爆了。有个小工具拦在中间,315KB变5.4KB,98%的Token就这么省下来了。


最近GitHub上有个项目一夜暴涨两千多星,总Star数已突破1万。不是什么花里胡哨的框架,就是一个解决痛到不能再痛的问题的MCP服务器——Context Mode。

先问一个问题:有没有发现用Claude Code或者Cursor写代码,刚开始啥都挺灵,半小时后就开始犯迷糊?明明刚刚改了哪个文件,下一秒就忘了;明明刚才做了决策,过了会儿又重复问一遍。

别急着怪模型。问题出在一个容易被忽略的地方——上下文窗口被工具输出的垃圾数据撑爆了。

01 痛点直击

先算一笔账:一次Playwright页面快照吃掉56KB上下文,抓取20个GitHub Issues消耗59KB,一份访问日志45KB。这些还只是在“看”,还没开始写代码呢。

跑个30分钟的任务,光工具调用的原始输出就能吃掉40%的上下文。等模型不得不压缩对话来腾空间的时候,好玩的事情就发生了:忘了正在编辑哪个文件、忘了任务进行到哪一步、忘了刚才的问题是什么。

不是AI变笨了。是 AI的“短期记忆”被塞满了 ——每次读文件、查网页,原始内容一股脑全倒进上下文窗口,像在往一个杯子里拼命倒水,迟早溢出来。

Context Mode的核心思路,就是从源头上动手脚。

02 沙盒拦截

Context Mode在模型和工具之间插了一层“沙箱”——所有外部数据都进不了上下文

具体来说,原始的输出(日志文件、API响应、页面快照)被分块索引,存入本地的SQLite数据库,只有摘要或匹配的片段返回给对话

来对比一下:

场景

原始大小

压缩后

压缩比例

Playwright 页面快照

56 KB

299 B

99.5%

GitHub Issues(20个)

59 KB

1.1 KB

98.1%

访问日志(500条请求)

45 KB

155 B

99.7%

分析型CSV(500行)

85 KB

222 B

99.7%

仓库调研(子Agent)

986 KB

62 KB

93.7%

整个会话合计

315 KB

5.4 KB

≈98%

效果显而易见了。

更骚的操作在后面——Context Mode还做了一件事:会话连续性。每一次文件编辑、git操作、任务进度、报错信息、用户决策,全部记录在本地SQLite里。当对话被压缩时,它不会把这些数据重新塞回上下文,而是用FTS5全文索引加BM25检索,只取当前相关的部分。模型能从断掉的地方无缝接上,而不是从头再来。

:98%这个数字来自官方在11个真实场景下的整体测算,日常编码的实测压缩率通常在60%-80%之间,但已经相当可观了。

03 测试数据

Context Mode自带诊断工具可以直接看每一笔账

代码语言:javascript
复制
查看按工具分类节省了多少Token

以上是Claude Code插件版的斜杠命令。其他平台直接在聊天框输入命令名,模型会自动调用对应的MCP工具。

支持12个平台:Claude Code、Cursor、Gemini CLI、VS Code Copilot、OpenCode、KiloCode、OpenClaw、Codex CLI、Antigravity、Kiro、Zed、Pi。

支持11种语言运行时:JavaScript、TypeScript、Python、Shell、Ruby、Go、Rust、PHP、Perl、R、Elixir。Bun自动检测,JS/TS跑起来比默认快3-5倍。

04 安装上手

Claude Code最省事,一条命令的事

代码语言:javascript
复制
/plugin marketplace add mksglu/context-mode
/plugin install context-mode@context-mode

然后重启Claude Code(或 /reload-plugins)。跑一下诊断确认一切正常:

代码语言:javascript
复制
/context-mode:ctx-doctor

所有检查项显示 [x] 即完成。

MCP-only安装(无钩子、无自动路由,适合试用)

代码语言:javascript
复制
claude mcp add context-mode -- npx -y context-mode

要求:Node.js 18+。如果Claude Code版本低于v1.0.33,先用 brew upgrade claude-codenpm update -g @anthropic-ai/claude-code 更新。

05 玩转技巧

让模型写代码而不是处理数据的思路值得单独拿出来说。想统计50个文件里某个函数被调用了多少次?常规做法是把50个文件全塞给模型让它数。Context Mode的做法是:让模型写一个脚本去数,只把结果 console.log 出来。

一个脚本替代十次工具调用,节省上百倍上下文。

几个典型的高效使用场景

  • 大量文件搜索与分析——替代十次原始读取调用,Token用量断崖式下降
  • 测试流程跑起来——原本烧掉5K Tokens的测试流程,现在几乎零成本
  • API响应处理——原始数据不进窗口,只取需要的段落

一个具体例子:让模型调用 ctx_batch_execute 同时执行5个独立脚本,原来37次工具调用现在只用5次,986KB变62KB。

06 边界与代价

当然没有那种“啥场景都省98%”的完美工具,Context Mode也有自己的边界。

沙盒化最适合这些场景:大量文件搜索、多命令批量执行、需要运行脚本做分析的任务。一个脚本替代十次工具调用,收益明显。

不太适合的场景:简单单次任务,沙盒的额外开销可能大于收益;需要实时查看完整长输出的场景——沙盒只返回stdout的摘要,想看全貌就不太合适。

另一个需要注意的细节:不加 --continue 参数启动新会话时,上次的会话数据会被立即删除。这是刻意设计的——新会话等于干净的空白石板,不会把上个项目的垃圾带进来。

Token消耗是AI编程绕不开的话题。窗口被撑爆导致模型“失忆”这件事,很多人遇到过但没深究。Context Mode提供了一个直接有效的治本方案——让不该进窗口的东西压根儿进不来。1万颗Star在那儿摆着,社区的反应某种程度上已经说明了一切。

#11 #上下文压缩 #ClaudeCode #MCP神器 #Token省钱

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-04-27,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 OpenNiuma 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 01 痛点直击
  • 02 沙盒拦截
  • 03 测试数据
  • 04 安装上手
  • 05 玩转技巧
  • 06 边界与代价
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档