社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

Python数据科学 • 1 周前 • 182 次点击  
来源丨量子位
大家好,我是东哥。

DeepSeek官方版还在路上,民间「最佳Harness」已经率先出现。

项目名叫「Pi」,是一款在GitHub获得8.6万Star开源编程Agent

项目之所以受到关注,主要还是因为它足够节省成本。

以开发者Evan Kim为例,他将DeepSeek接入Pi后,约 99.93% 的输入Token都成功命中缓存。

换句话说,缓存不命中只有0.07%,绝大部分重复上下文无需重新计算。

此外,Composio团队最近横向测试了8款主流Agent Harness,将DeepSeek V4 Flash 接入运行真实任务。

结果出来之后,情况颇具戏剧性——

Pi完成一次成功任务的平均成本最低,只需要约 0.028美元

Claude Code:成本被拉到Pi的7倍。

DeepSeek:Token定价已经很低。

Pi等省钱项目:还能进一步减少用户的Token用量。

01 四个工具配DeepSeek,缓存不命中率低至0.07%

介绍Pi之前,先简单说明Harness是什么。

我们都知道,大模型本身更像一颗负责思考的大脑——

想让它真正进入代码仓库干活,还得给它配上眼睛、手脚和工作流程。

就比如谁来读取文件、怎样调用终端、修改代码后如何运行测试,这些围绕模型运转的工程系统,统称为Harness。

也正因如此,同一个模型换一套Harness,实际表现和调用成本都可能出现巨大差距。

而开发者Mario Zechner创建的这个「Pi」,干的就是给大模型搭建这样一套编程工作台。

整体来看,Pi的思路相当直接——

它从一开始,就没打算把「所有功能」全塞进核心里。

具体来说,在默认情况下Pi只给模型四件工具—— 读文件、写文件、改文件和执行命令。

如果用户需要计划模式、子Agent、MCP、Git检查点或权限控制,可以通过扩展和Skills逐件添加。

大致就像先交付一间水电齐全的毛坯房,Pi负责把四面墙盖好,最终装修成工作室、电竞房还是三室一厅,由用户自己决定。

这恰好契合了DeepSeek的需求。

众所周知,DeepSeek的推理与编程能力较强,但工具调用、上下文管理和思考内容回放却有自己的接口规则。

这就导致我们直接塞进围绕OpenAI或Claude设计的通用Harness,容易遇到工具格式不兼容、推理内容回放报错和缓存失效等问题。

在DeepSeek官方产品还在路上时,Pi先动手适配了——

在今年4月的时候,Pi加入 DeepSeek原生Provider支持,同时修复了V4会话回放中的400报错。

它会按照DeepSeek接口要求保留reasoning_content,并将Pi内部的推理强度映射到DeepSeek支持的思考级别。

可以说是民间专属定制。

但真正让Pi与DeepSeek一拍即合的,还是「缓存」。

毕竟Coding Agent每执行一步,都要把系统提示词、工具定义、历史对话和代码重新发给模型,这就导致——

模型任务越做越久,请求也会越滚越长,其中大部分内容,DeepSeek其实早就处理过。

这时候,自动前缀缓存就能派上用场了。

它能暂时记住已经计算过的请求开头,下一轮调用时,只要系统提示词、工具定义和历史对话仍然保持一致,这一大段内容就能直接复用,模型只需处理末尾新增的信息。

而「缓存命中率」,衡量的正是这次输入中,有多少Token成功复用了此前的计算结果。

命中率越高,重新计算的Token越少,调用成本自然也越低。

但麻烦也藏在这里,提示词多一个时间、工具换个顺序,缓存都可能当场失忆,再从头计算。

但Pi的优势就是足够简单:默认工具少,会话内容持续向后追加,很少回头修改前面的内容。

这样一来,DeepSeek读取日志时,前面看过的几百页可以直接跳过,只处理最后新添的几页,缓存不命中率大幅降低。

开发者Evan Kim的实际使用也验证了——

DeepSeek接入Pi后的 缓存不命中率低至 0.03%,对应约99.97%的缓存命中率。

换算下来,10亿token处理费用仅约19元,如果不使用缓存,成本则高达900多元

此外,Composio团队最近横向测试了 8款主流Agent Harness,将DeepSeek V4 Flash接入运行真实任务。

结果颇具戏剧性:同一个DeepSeek,换一套Harness,成本差距最高能拉到7倍

可以看出,Pi完成一次成功任务的「平均成本」最低,只需约 0.028美元

排在后面的分别是Deep Agents、Hermes Agent、OpenCode、Codex、Oh My Pi和Prime Agent。

再来看Claude Code,它是当之无愧的「最贵选手」——

完成一次成功任务平均需要约 0.195 美元,接近Pi的7

当然,这个数字并不代表Claude Code能力不行,毕竟它本身就是围绕Claude模型打造的完整工程体系。

只能说当底层模型换成DeepSeek后,原本针对Claude生态优化的工作流,并没有完全吃到DeepSeek低成本、高缓存效率的红利。

模型还是那个DeepSeek,Pi只是让它少读了很多遍已经读过的内容。

Pi:静待官方Harness超越自己。

02 官方Harness已经组队,目标直指Claude Code

当然,Pi再适合DeepSeek,眼下仍是一套第三方方案。

毕竟DeepSeek自己也已经决定亲自下场造Harness,距离上线或许也不远了。

今年5月的时候,DeepSeek资深研究员陈德里确认,公司内部正在组建Agent Harness团队,用一句相当直白的话概括其目标——

从零开始做DeepSeek Code Harness,对标Claude Code

这几个月,关于Harness产品经理和研发工程师的岗位也在官网上密集发布,例如:

到了7月底,DeepSeek Agent Harness团队负责人、ACM金牌得主 崔添翼仍在网上招募相关项目的开发者。

进展已接近水到渠成。

把几条线索放在一起,DeepSeek的路径已经逐渐清楚了。

V4负责补强底层推理、编程和Agent能力;官方Harness负责把模型接入终端、代码仓库与工具链;上下文管理和测试反馈又能把真实用户的失败案例送回模型团队。

当然,等官方产品上线后,Pi也不会因此失去位置。

DeepSeek Harness主打开箱即用,以及与自家模型更深的协同。

Pi则把工作台留给用户自行改造,更适合喜欢控制工具、定制工作流和随时更换模型的开发者。

毕竟Pi从一开始就没把自己绑死在DeepSeek身上。

Claude、OpenAI、Gemini、Kimi、MiniMax这些都支持,今天用DeepSeek省Token,明天换其他模型处理特殊任务,用户随时可以切换Provider。

这也意味着,DeepSeek官方Harness真正要面对的,除了一众Claude Code式产品,还有Pi这类已被开发者改造得相当顺手的开放工作台。

所以现在,压力给到了官方版——

自己给DeepSeek做的Harness,总不能还不如第三方懂得怎么省Token。

03 参考链接

https://x.com/composio/status/2086814488162972027?s=20

https://github.com/earendil-works/pi

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199710