Py学习  »  Git

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

极市平台 • 2 周前 • 103 次点击  
↑ 点击蓝字 关注极市平台
来源丨量子位
编辑丨极市平台

极市导读

 

开源编程 Agent Pi 采用最小工具集与持续追加的会话结构,使 DeepSeek 前缀缓存复用率提升至 99.93%,对应缓存不命中率 0.07%。Composio 对 8 款 Agent Harness 的横向量化显示,相同模型下成功任务的平均成本最高相差约 7 倍。 >>加入极市CV技术交流群,走在计算机视觉的最前沿

DeepSeek官方版还在路上,民间「最佳Harness」已经率先出现。

项目名叫「Pi」,是一款在GitHub获得约8.6万Star开源编程Agent

项目之所以受到关注,主要还是因为它足够节省成本。

以开发者Evan Kim为例,他将DeepSeek接入Pi后,约 99.93% 的输入Token都成功命中缓存。

换句话说,缓存不命中率只有0.07%,绝大部分重复上下文无需重新计算。

此外,Composio团队最近横向测试了8款主流Agent Harness,将DeepSeek V4 Flash接入运行真实任务。

结果出来之后,情况颇具戏剧性——

Pi完成一次成功任务的平均成本最低,只需要约 0.028美元

Claude Code:成本被拉到Pi的7倍。

DeepSeek:Token定价已经很低。

Pi等省钱项目:还能进一步减少用户的Token用量。

 四个工具配DeepSeek,缓存不命中率低至0.07%

介绍Pi之前,先简单说明Harness是什么。

我们都知道,大模型本身更像一颗负责思考的大脑——

想让它真正进入代码仓库干活,还得给它配上眼睛、手脚和工作流程。

就比如谁来读取文件、怎样调用终端、修改代码后如何运行测试,这些围绕模型运转的工程系统,统称为Harness。

也正因如此,同一个模型换一套Harness,实际表现和调用成本都可能出现巨大差距。

而开发者Mario Zechner创建的这个「Pi」,干的就是给大模型搭建这样一套编程工作台。

整体来看,Pi的思路相当直接——

它从一开始,就没打算把「所有功能」全塞进核心里。

具体来说,在默认情况下Pi只给模型四件工具—— 读文件、写文件、改文件和执行命令。

如果用户需要计划模式、子Agent、MCP、Git检查点或权限控制,可以通过扩展和Skills逐件添加。

大致就像先交付一间水电齐全的毛坯房,Pi负责把四面墙盖好,最终装修成工作室、电竞房还是三室一厅,由用户自己决定。

这恰好契合了DeepSeek的需求。

众所周知,DeepSeek的推理与编程能力较强,但工具调用、上下文管理和思考内容回放却有自己的接口规则。

这就导致我们直接塞进围绕OpenAI或Claude设计的通用Harness,容易遇到工具格式不兼容、推理内容回放报错和缓存失效等问题。

在DeepSeek官方产品还在路上时,Pi先动手适配了——

在今年4月的时候,Pi加入DeepSeek原生Provider支持,同时修复了V4会话回放中的400报错。

它会按照DeepSeek接口要求保留reasoning_content,并将Pi内部的推理强度映射到DeepSeek支持的思考级别。

可以说是民间专属定制。

但真正让Pi与DeepSeek一拍即合的,还是「缓存」。

毕竟Coding Agent每执行一步,都要把系统提示词、工具定义、历史对话和代码重新发给模型,这就导致——

模型任务越做越久,请求也会越滚越长,其中大部分内容,DeepSeek其实早就处理过。

这时候,自动前缀缓存就能派上用场了。

它能暂时记住已经计算过的请求开头,下一轮调用时,只要系统提示词、工具定义和历史对话仍然保持一致,这一大段内容就能直接复用,模型只需处理末尾新增的信息。

而「缓存命中率」,衡量的正是这次输入中,有多少Token成功复用了此前的计算结果。

命中率越高,重新计算的Token越少,调用成本自然也越低。

但麻烦也藏在这里,提示词多一个时间、工具换个顺序,缓存都可能当场失忆,再从头计算。

但Pi的优势就是足够简单:默认工具少,会话内容持续向后追加,很少回头修改前面的内容。

这样一来,DeepSeek读取日志时,前面看过的几百页可以直接跳过,只处理最后新添的几页,缓存不命中率大幅降低。

开发者Evan Kim的实际使用也验证了——

DeepSeek接入Pi后的缓存不命中率低至 0.03%,对应约99.97%的缓存命中率。

换算下来,10亿token处理费用仅约19元,如果不使用缓存,成本则高达900多元

此外,Composio团队最近横向测试了8款主流Agent Harness,将DeepSeek V4 Flash接入运行真实任务。

结果颇具戏剧性:同一个DeepSeek,换一套Harness,成本差距最高能拉到7倍

可以看出,Pi完成一次成功任务的「平均成本」最低,只需约 0.028美元

排在后面的分别是Deep Agents、Hermes Agent、OpenCode、Codex、Oh My Pi和Prime Agent。

再来看Claude Code,它是当之无愧的「最贵选手」——

完成一次成功任务平均需要约 0.195 美元,接近Pi的7倍

当然,这个数字并不代表Claude Code能力不行,毕竟它本身就是围绕Claude模型打造的完整工程体系。

只能说当底层模型换成DeepSeek后,原本针对Claude生态优化的工作流,并没有完全吃到DeepSeek低成本、高缓存效率的红利。

模型还是那个DeepSeek,Pi只是让它少读了很多遍已经读过的内容。

Pi:静待官方Harness超越自己。

 官方Harness已经组队,目标直指Claude Code

当然,Pi再适合DeepSeek,眼下仍是一套第三方方案。

毕竟DeepSeek自己也已经决定亲自下场造Harness,距离上线或许也不远了。

今年5月的时候,DeepSeek资深研究员陈德里确认,公司内部正在组建Agent Harness团队,用一句相当直白的话概括其目标——

从零开始做DeepSeek Code Harness,对标Claude Code

这几个月,关于Harness产品经理和研发工程师的岗位也在官网上密集发布,例如:

到了7月底,DeepSeek Agent Harness团队负责人、ACM金牌得主崔添翼仍在网上招募相关项目的开发者。

进展已接近水到渠成。

把几条线索放在一起,DeepSeek的路径已经逐渐清楚了。

V4负责补强底层推理、编程和Agent能力;官方Harness负责把模型接入终端、代码仓库与工具链;上下文管理和测试反馈又能把真实用户的失败案例送回模型团队。

当然,等官方产品上线后,Pi也不会因此失去位置。

DeepSeek Harness主打开箱即用,以及与自家模型更深的协同。

Pi则把工作台留给用户自行改造,更适合喜欢控制工具、定制工作流和随时更换模型的开发者。

毕竟Pi从一开始就没把自己绑死在DeepSeek身上。

Claude、OpenAI、Gemini、Kimi、MiniMax这些都支持,今天用DeepSeek省Token,明天换其他模型处理特殊任务,用户随时可以切换Provider。

这也意味着,DeepSeek官方Harness真正要面对的,除了一众Claude Code式产品,还有Pi这类已被开发者改造得相当顺手的开放工作台。

所以现在,压力给到了官方版——

自己给DeepSeek做的Harness,总不能还不如第三方懂得怎么省Token。

 参考链接

• https://x.com/composio/status/2086814488162972027?s=20

• https://github.com/earendil-works/pi


公众号后台回复“数据集”获取100+深度学习各方向资源整理

极市干货


技术专栏:多模态大模型超详细解读专栏搞懂Tranformer系列大视觉模型 (LVM) 解读 扩散模型系列极市直播
技术综述:小目标检测那点事大模型面试八股含答案万字长文!人体姿态估计(HPE)入门教程

点击阅读原文进入CV社区

收获更多技术干货


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199675