社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

Claude 省下 65% token 的秘密!Github 8w+star 项目教学

AI academic space • 2 周前 • 82 次点击  

点击蓝字 关注我们

AI academic space


进社群领取100+ Skills!

推荐使用最新科研AI工具:

https://chat.cnpaperdata.com

 

你有没有过这种经历:让 AI 帮你改一行代码,它先回你一句“当然!我很乐意帮你解决这个问题”,然后从背景讲起,铺垫三段,正文藏在最后。API 余额肉眼可见地往下掉,你只想说:能不能闭嘴,直接说重点?

2026 年上半年,一个叫 Caveman(穴居人) 的开源项目,就靠解决这个痛点,在 GitHub 上拿了超过 86,000 个 Star,一度霸榜 Trending。它的口号简单粗暴:

“why use many token when few token do trick.”(少点 Token 能搞定的事,干嘛用那么多?)

今天这篇文章,就把 Caveman 讲清楚:它是什么、怎么用、到底能省多少、什么人不适合用。

Caveman 是什么?一句话:让 AI 别客套

项目地址:https://github.com/JuliusBrussee/caveman

Caveman 不是新模型,也不是推理优化,本质上是一条精心编写的系统提示词(System Prompt) 。

把它装进你的 AI 编程助手,AI 的说话风格会从“温文尔雅的英伦管家”变成“能用三个词绝不说四个的原始人”。

它支持的平台很广,包括 Claude Code、Codex、Gemini、Cursor、Windsurf、Cline、Copilot 等 30 多个 AI 编程工具。

核心规则只有一条:技术术语和代码块必须保留,报错信息原样引用,其余能砍就砍。

具体砍什么?

  • 冠词(the / a / an)
  • 语气填充词(basically / actually)
  • 客套话(“当然!我很乐意帮你……”)
  • 犹豫性表达(“可能大概也许……”)

允许用短句、碎片句,优先选更短的同义词——说“大”而不是“庞大”,说“修”而不是“实施一个解决方案”。

看一个真实对比:

正常模式(69 tokens) :

“你的 React 组件重新渲染的原因,很可能是因为每次渲染周期都在创建一个新的对象引用。当你把一个内联对象作为 prop 传入时,React 的浅比较会认为每次都是不同的对象,从而触发重新渲染。我建议用 useMemo 来缓存这个对象。”

Caveman 模式(19 tokens) :

“New object ref each render. Inline object prop = new ref = re-render. Wrap in  useMemo.”

同样的诊断,同样的修复方案。死的只有喉咙里的客套。

到底能省多少?先看“诚实数字”

项目方在 v1.9.1 版本中做了个很实在的事:把节省数字统一为 65% ,并专门写了一份 HONEST-NUMBERS.md 文档,说明什么时候省 Token、什么时候反而费 Token。

65% 是怎么来的?基于 10 个编程任务的基准测试,输出 Token 平均从 1214 个压缩到 294 个,范围在 22% 到 87% 之间——技术性越强的任务,压缩效果越明显。

但有几个关键事实必须说清楚:

第一,它只省“输出 Token”。 输入 Token 和模型的推理 Token 完全不受影响。更关键的是,这个技能本身每轮对话会增加约 1,000–1,500 个输入 Token 的开销。如果某个任务本身输出就很短,省下来的还不够填这个坑。

第二,独立测试显示效果远低于宣传。 IDE 开发商 JetBrains 用 86 个真实软件工程任务做了基准测试,发现输出 Token 实际只减少了约  8.5% 。原因是编程 Agent 的 Token 大头花在读取项目文件、推理任务逻辑、调用工具和生成代码上,聊天文字本身只占很小一部分。

所以务实的结论是:Caveman 能帮你省,但省的是“对话税”,不是账单的大头。

三档强度,按需选择

Caveman 提供了三档压缩级别,你可以根据需要切换:

Lite 模式(轻度)去掉填充词和犹豫表达,保留完整句子。

“连接池会复用已经打开的数据库连接,而不是每次请求都新建一个。”

Full 模式(默认)允许碎片句,用短词替代。

“连接池复用已打开的DB连接。不是每个请求都新建。”

Ultra 模式(极限)大量缩写,箭头表达因果。

“连接池=复用DB连接。跳过握手→高并发更快。”

适合谁,不适合谁

适合用 Caveman 的人:

  • 每天高频使用 AI 编程助手的开发者,受不了“话痨”干扰心流
  • 做 Bug 修复、代码审查、API 调试等技术性任务——这类任务“要的是结果,不是解释”
  • 按量付费、对输出 Token 成本敏感的团队

不适合的人:

  • 需要详细解释的场景。 比如教新人理解代码逻辑,Caveman 的碎片句反而增加沟通成本。
  • 创意写作、多角色对话、数学证明等需要精细风格控制的任务。极简指令会丧失必要的约束精度。
  • 输出本身就短的任务。 如果你只是让 AI 改个变量名,技能自身每轮多出来的 1,000+ 输入 Token 可能让总成本不降反升。项目方自己的文档也说了:如果固定开销超过输出节省,直接关掉。

实操避坑:三个要点

1. 中文对话要加一句“全中文回复”。 Caveman 的示例全是英文,启用后在中文对话里 AI 有时会中英文混着说。

2. 不要和其他 Skill 混用。 如果你已经装了 code-reviewer、git-helper 之类的自定义 Skill,Caveman 的系统提示词可能被覆盖。建议新建独立配置文件,别把风格约束和其他功能指令塞在一起。

3. 安装很简单,但先测一个任务。 一行命令即可安装:

npx skills add JuliusBrussee/caveman

装完后输入 /caveman 或说“talk like caveman”即可激活。建议先挑一个你日常最常做的任务,对比开启前后的输出质量和 Token 消耗,确认适合自己再全面启用。

总结

Caveman 不是什么黑科技,它做的事很朴素: 把 AI 嘴里那些“不影响信息、但持续烧钱”的客套话删掉。

它火了,不是因为技术多高深,而是因为它精准地捅破了一个所有人都感受到了、但没人认真解决的痛点:AI 的“废话文学”。

如果你每天用 AI 写代码,花 30 秒装一下,至少能让你的阅读体验清爽不少。但别指望它把账单砍掉一半——省的是“说话方式”的钱,不是“干活方式”的钱。


InfinitePaper AI 现已正式上线!

我们诚邀您即刻体验,感受AI如何重塑您的科研工作流。

  • 新用户专享福利:即日起关注公众号后台发送 [ AI福利 ] ,即可领取  7 天高级会员 !


  • 教育福利:添加客服完成 教育认证,即可再享受会员 8 折优惠!


  • 分享福利:转发本文至朋友圈(保留2小时)或科研群(15人以上),截图发送 至客服,可领取科研工具包 (包含:经济学理论手册、科研AI手册)!




活动期间永久会员最高可直降 560 元!



点击“阅读原文” 直达官方网站

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201079