ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

缓存命中率99.93%,DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

缓存命中率99.93%,DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star 缓存不命中率低至0.07%好啊好啊。DeepSeek官方版还在路上民间「最佳Harness」已经先杀出来了卷死算了.jpg项目名叫「Pi」一款在GitHub狂揽揽揽揽揽约8.6万Star的开源编程Agent。项目之所以so火爆主要还是因为这玩意儿太《省》了。。。瞧下面这位开发者老哥Evan Kim人家把DeepSeek接入Pi后约99.93%的输入Token都成功命中缓存。换句话说缓存不命中率只有0.07%绝大部分重复上下文无需重新计算甚至吧Composio团队最近还横向测试了8款主流Agent Harness直接把DeepSeekV4 Flash塞进去跑真实任务。结果出来之后多少也有点抓马——Pi完成一次成功任务的平均成本最低只需要约0.028美元。Claude Code咋直接把我干到Pi的7倍价格啦DeepSeek我的Token已经卖这么便宜了。Pi等一众省钱项目没事我还能让用户少买点哈。四个工具配DeepSeek缓存不命中率低至0.07%说Pi之前我们再来小唠一下Harness到底是个啥。我们都知道大模型本身更像一颗负责思考的大脑——想让它真正进入代码仓库干活还得给它配上眼睛、手脚和工作流程。就比如谁来读取文件、怎样调用终端、修改代码后如何运行测试这些围绕模型运转的工程系统统称为Harness。也正因如此同一个模型换一套Harness实际表现和调用成本都可能出现巨大差距而开发者Mario Zechner创建的这个「Pi」干的就是给大模型搭建这样一套编程工作台。我翻了一遍项目浅浅总结下来就是Pi的思路相当《直给》——那就是这玩意儿其实从一开始就没打算把「所有功能」全塞进核心里。。。具体来说在默认情况下Pi只给模型四件工具——读文件、写文件、改文件和执行命令。如果用户需要计划模式、子Agent、MCP、Git检查点或权限控制那可以再通过扩展和Skills逐件装上去emm…大概就像先交付一间水电齐全的毛坯房Pi负责把四面墙盖好最后装修成工作室、电竞房还是三室一厅全看用户自己折腾好巧不巧呢这恰好撞上了DeepSeek的需求。。。众所周知DeepSeek的推理与编程能力蛮强但工具调用、上下文管理和思考内容回放却有自己的接口规则。这就导致我们直接塞进围绕OpenAI或Claude设计的通用Harness容易遇到工具格式不兼容、推理内容回放报错和缓存失效等问题。这不嘛DeepSeek官方产品还在路上Pi先动手适配了——在今年4月的时候Pi加入DeepSeek原生Provider支持同时修复了V4会话回放中的400报错。它会按照DeepSeek接口要求保留reasoning_content并将Pi内部的推理强度映射到DeepSeek支持的思考级别。真·民间专属定制了也是。但真正让Pi与DeepSeek一拍即合的还是「缓存」。毕竟Coding Agent每执行一步都要把系统提示词、工具定义、历史对话和代码重新发给模型这就导致——模型任务越做越久请求也会越滚越长其中大部分内容DeepSeek其实早就看过了。。。这时候自动前缀缓存就能派上用场了。它能暂时记住已经计算过的请求开头下一轮调用时只要系统提示词、工具定义和历史对话仍然保持一致这一大段内容就能直接复用模型只需处理末尾新增的信息。而「缓存命中率」衡量的正是这次输入中有多少Token成功复用了此前的计算结果。命中率越高重新计算的Token越少调用成本自然也越低。但麻烦也藏在这里提示词多一个时间、工具换个顺序缓存都可能当场失忆再从头计算。但Pi人家的优势就是《足够简单》默认工具少会话内容持续向后追加很少回头折腾前面的内容。这样一来DeepSeek翻开日志后前面看过的几百页可以直接跳过只处理最后新添的几页缓存不命中率直接大大降低这不嘛网友Evan Kim现身说法验证了——DeepSeek接入Pi后的缓存不命中率低至0.03%对应约99.97%的缓存命中率。换算一下就是10亿和token处理费用成本仅为19块钱左右如果不使用缓存的话那成本得900多块钱。。此外Composio团队最近还横向测试了8款主流Agent Harness直接把DeepSeekV4 Flash塞进去跑真实任务。结果出来之后多少有点戏剧性同一个DeepSeek换一套Harness成本差距最高能拉到7倍打眼一看确实Pi Agent完成一次成功任务的「平均成本」最低只需要差不多0.028美元。排在后面的分别是Deep Agents、Hermes Agent、OpenCode、Codex、Oh My Pi和Prime Agent。咱再来看看A社大宝贝Claude Code当之无愧「最贵选手」——完成一次成功任务平均需要约0.195美元是的接近Pi的7倍。。。天塌啦当然啦这个数字并不代表Claude Code能力不行毕竟它本身就是围绕Claude模型打造的完整工程体系。只能说当底层模型换成DeepSeek后原本针对Claude生态优化的工作流并没有完全吃到DeepSeek低成本、高缓存效率的红利。模型还是那个DeepSeekPi只是让它少读了很多遍已经读过的内容。Pi静等官方Harness超越俺哈。官方Harness已经组队目标直指Claude Code当然了Pi再适合DeepSeek眼下仍是一套第三方方案。毕竟DeepSeek自己也已经决定亲自下场造Harness了甚至八成离上线的日子也不远了我猜今年5月的时候DeepSeek资深研究员陈德里确认公司内部正在组建Agent Harness团队用一句相当直白的话概括其目标——从零开始做DeepSeekCode Harness对标Claude Code。然后中间这几个月关于Harness产品经理和研发工程师的岗位也铺天盖地地在官网上狂更狂上be like然后就是7月底DeepSeekAgent Harness团队负责人、ACM金牌大神崔添翼在网上还是招募相关项目的开发者。也算是快水到渠成了。把几条线索放在一起DeepSeek的路径已经逐渐清楚了。V4负责补强底层推理、编程和Agent能力官方Harness负责把模型接入终端、代码仓库与工具链上下文管理和测试反馈又能把真实用户的失败案例送回模型团队。当然了说实话等官方产品上线后Pi也不会因此失去位置。DeepSeekHarness主打开箱即用以及与自家模型更深的协同。Pi则把工作台留给用户自行改造更适合喜欢控制工具、定制工作流和随时更换模型的开发者。毕竟Pi从一开始就没把自己绑死在DeepSeek身上。。。Claude、OpenAI、Gemini、Kimi、MiniMax这些都支持今天用DeepSeek省Token明天换其他模型处理特殊任务用户随时可以切换Provider。emm…这也意味着DeepSeek官方Harness真正要面对的除了一众Claude Code式产品还有Pi这类已经被开发者改造得相当顺手的开放工作台。doge所以现在压力正式给到官方版——自己给DeepSeek做的Harness总不能还没有第三方懂得怎么省Token吧原文链接缓存命中率99.93%DeepSeek最适合的Harness来了GitHub狂揽8.6万Star-36氪
返回列表