社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

量子位 • 22 小时前 • 22 次点击  
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI

好啊好啊。

DeepSeek官方版还在路上,民间「最佳Harness」已经先杀出来了!(卷死算了.jpg)

项目名叫「Pi」,一款在GitHub狂揽揽揽揽揽约8.6万Star的开源编程Agent。

项目之所以so火爆,主要还是因为这玩意儿太《省》了。。。

瞧下面这位开发者老哥Evan Kim,人家把DeepSeek接入Pi后,约99.93%的输入Token都成功命中缓存。

换句话说,缓存不命中率只有0.07%,绝大部分重复上下文无需重新计算???

甚至吧,Composio团队最近还横向测试了8款主流Agent Harness,直接把DeepSeek V4 Flash塞进去跑真实任务。

结果出来之后,多少也有点抓马——

Pi完成一次成功任务的平均成本最低,只需要约0.028美元

Claude Code:咋直接把我干到Pi的7倍价格啦!!!

DeepSeek:我的Token已经卖这么便宜了。

Pi等一众省钱项目:没事,我还能让用户少买点哈。

四个工具配DeepSeek,缓存不命中率低至0.07%

说Pi之前,我们再来小唠一下Harness到底是个啥。

我们都知道,大模型本身更像一颗负责思考的大脑——

想让它真正进入代码仓库干活,还得给它配上眼睛、手脚和工作流程。

就比如谁来读取文件、怎样调用终端、修改代码后如何运行测试,这些围绕模型运转的工程系统,统称为Harness。

也正因如此,同一个模型换一套Harness,实际表现和调用成本都可能出现巨大差距!!

而开发者Mario Zechner创建的这个「Pi」,干的就是给大模型搭建这样一套编程工作台。

我翻了一遍项目,浅浅总结下来就是,Pi的思路相当《直给》——

那就是这玩意儿,其实从一开始,就没打算把「所有功能」全塞进核心里。。。

具体来说,在默认情况下Pi只给模型四件工具——读文件、写文件、改文件和执行命令。

如果用户需要计划模式、子Agent、MCP、Git检查点或权限控制,那可以再通过扩展和Skills逐件装上去~

emm…大概就像先交付一间水电齐全的毛坯房,Pi负责把四面墙盖好,最后装修成工作室、电竞房还是三室一厅,全看用户自己折腾??

好巧不巧呢,这恰好撞上了DeepSeek的需求。。。

众所周知,DeepSeek的推理与编程能力蛮强,但工具调用、上下文管理和思考内容回放却有自己的接口规则。

这就导致我们直接塞进围绕OpenAI或Claude设计的通用Harness,容易遇到工具格式不兼容、推理内容回放报错和缓存失效等问题。

这不嘛DeepSeek官方产品还在路上,Pi先动手适配了——

在今年4月的时候,Pi加入DeepSeek原生Provider支持,同时修复了V4会话回放中的400报错。

它会按照DeepSeek接口要求保留reasoning_content,并将Pi内部的推理强度映射到DeepSeek支持的思考级别。

真·民间专属定制了也是。

但!真正让Pi与DeepSeek一拍即合的,还是「缓存」。

毕竟Coding Agent每执行一步,都要把系统提示词、工具定义、历史对话和代码重新发给模型,这就导致——

模型任务越做越久,请求也会越滚越长,其中大部分内容,DeepSeek其实早就看过了。。。

这时候,自动前缀缓存就能派上用场了。

它能暂时记住已经计算过的请求开头,下一轮调用时,只要系统提示词、工具定义和历史对话仍然保持一致,这一大段内容就能直接复用,模型只需处理末尾新增的信息。

而「缓存命中率」,衡量的正是这次输入中,有多少Token成功复用了此前的计算结果。

命中率越高,重新计算的Token越少,调用成本自然也越低。

但麻烦也藏在这里,提示词多一个时间、工具换个顺序,缓存都可能当场失忆,再从头计算。

但Pi人家的优势就是《足够简单》:默认工具少,会话内容持续向后追加,很少回头折腾前面的内容。

这样一来,DeepSeek翻开日志后,前面看过的几百页可以直接跳过,只处理最后新添的几页,缓存不命中率直接大大降低~

这不嘛,网友Evan Kim现身说法验证了——

DeepSeek接入Pi后的缓存不命中率低至0.03%,对应约99.97%的缓存命中率。

换算一下就是10亿和token处理费用成本仅为19块钱左右,如果不使用缓存的话,那成本得900多块钱。。

此外,Composio团队最近还横向测试了8款主流Agent Harness,直接把DeepSeek V4 Flash塞进去跑真实任务。

结果出来之后,多少有点戏剧性,同一个DeepSeek,换一套Harness,成本差距最高能拉到7倍???

打眼一看,确实Pi Agent完成一次成功任务的「平均成本」最低,只需要差不多0.028美元

排在后面的分别是Deep Agents、Hermes Agent、OpenCode、Codex、Oh My Pi和Prime Agent。

咱再来看看A社大宝贝Claude Code,当之无愧「最贵选手」——

完成一次成功任务平均需要约0.195美元,是的,接近Pi的7倍。。。(天塌啦)

当然啦,这个数字并不代表Claude Code能力不行,毕竟它本身就是围绕Claude模型打造的完整工程体系。

只能说当底层模型换成DeepSeek后,原本针对Claude生态优化的工作流,并没有完全吃到DeepSeek低成本、高缓存效率的红利。

模型还是那个DeepSeek,Pi只是让它少读了很多遍已经读过的内容。

Pi:静等官方Harness超越俺哈。

官方Harness已经组队,目标直指Claude Code

当然了,Pi再适合DeepSeek,眼下仍是一套第三方方案。

毕竟DeepSeek自己,也已经决定亲自下场造Harness了,甚至八成离上线的日子也不远了?(我猜)

今年5月的时候,DeepSeek资深研究员陈德里确认,公司内部正在组建Agent Harness团队,用一句相当直白的话概括其目标——

从零开始做DeepSeek Code Harness,对标Claude Code。

然后中间这几个月,关于Harness产品经理和研发工程师的岗位也铺天盖地地在官网上狂更狂上,be like:

然后就是7月底,DeepSeek Agent Harness团队负责人、ACM金牌大神崔添翼在网上还是招募相关项目的开发者。

也算是快水到渠成了。

把几条线索放在一起,DeepSeek的路径已经逐渐清楚了。

V4负责补强底层推理、编程和Agent能力;官方Harness负责把模型接入终端、代码仓库与工具链;上下文管理和测试反馈又能把真实用户的失败案例送回模型团队。

当然了,说实话,等官方产品上线后,Pi也不会因此失去位置。

DeepSeek Harness主打开箱即用,以及与自家模型更深的协同。

Pi则把工作台留给用户自行改造,更适合喜欢控制工具、定制工作流和随时更换模型的开发者。

毕竟Pi从一开始就没把自己绑死在DeepSeek身上。。。

Claude、OpenAI、Gemini、Kimi、MiniMax这些都支持,今天用DeepSeek省Token,明天换其他模型处理特殊任务,用户随时可以切换Provider。

emm…这也意味着,DeepSeek官方Harness真正要面对的除了一众Claude Code式产品,还有Pi这类已经被开发者改造得相当顺手的开放工作台。(doge)

所以现在,压力正式给到官方版——

自己给DeepSeek做的Harness,总不能还没有第三方懂得怎么省Token吧???(doge)

参考链接:

[1]https://x.com/composio/status/2086814488162972027?s=20

[2]https://github.com/earendil-works/pi

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199639