多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

省钱三件套横评:Caveman Skill、Caveman proxy、通用压缩中间件,谁才是真省钱

省钱三件套横评:Caveman Skill、Caveman proxy、通用压缩中间件,谁才是真省钱 省钱三件套横评Caveman Skill、Caveman proxy、通用压缩中间件谁才是真省钱【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/cavemanAI 编码代理的账单主要花在两个地方模型说太多输出 token 里的客套话、复述、总结和模型读太多每次调用都要重发的系统提示、对话历史、工具返回的日志与 JSON。Caveman 生态把这两个方向拆成了三个独立组件——管输出的 Skill、管输入的 proxy、以及面向自建应用的通用压缩中间件。它们不是同一件事的三层包装而是作用在模型调用链路不同位置的省钱工具。本文基于仓库实测数据docs/WRAP-BENCHMARK.md、docs/HONEST-NUMBERS.md逐一拆解各自能省多少、代价是什么、按什么场景选型。三个工具在链路中的位置先把三者按压什么、在哪压对齐组件压缩对象介入点典型用法Caveman Skillskills/caveman/SKILL.md模型输出Agent 提示词层注入说话规则/caveman、/ultracave、/megacaveCaveman proxyproxy/README.md模型输入工具结果、日志、文件本地 HTTP 反向代理base-URL-swapcaveman startcaveman claude通用压缩中间件packages/middleware/typescript/README.md应用内请求的工具结果自建 Agent/应用的 SDK 适配器withCavemanOpenAI(...)、with_caveman_agent(...)Skill 是一条规则注入它不改任何请求字节只让模型换个口吻说话。proxy 是一个真正的字节级代理caveman start在127.0.0.1:8787起一个与 Anthropic/OpenAI/Gemini/Bedrock 协议兼容的监听把 agent 的 base URL 指过去流量经本地 Engine 压缩后再转发到真实提供商。中间件则是把 Engine 的压缩能力以适配器形式塞进你自己写的应用代码里框架OpenAI SDK、LangChain、LiteLLM、Vercel AI SDK 等保留自己的推理客户端、重试和流式逻辑。三者可以独立运行也可以叠加——proxy 在包裹 Claude Code 时会顺带挂上 Skill这就是 README 中整会话基准的默认形态。各能省多少三份实测数据Skill输出侧砍的是废话而不是内容Skill 的核心规则写得很克制回答先行、杀掉寒暄、一句一个意思、代码块/命令/路径/错误信息逐字符保留、否定词永不丢。它明确声明never perform caveman——如果口语化并不更短就用平实写法。也就是说它压的是仪式感不是信息。仓库用 claude-opus-5-5 对十道开发题做过一次输出长度实测README.md 基准表harness 见 evals/README.md指令输出 token无任何约束6,983Answer concisely.4,334/caveman4,119/ultracave2,693注意其中两件事其一新模型已经天生会简短所以真正的对照基线是 4,334 这一行其二/caveman相比请简洁回答只再省约 3%在噪声范围内/ultracave才是量级选手中位数再省 35%/megacave文言文靠的是字符数暴降、token 收益有限中位数 9%区间从 12% 到 −39%。社区流传的砍 65%更多来自 Adobe Research 等外部复现八个模型、五个数据集成本下降 1.4–2.4×而仓库自己发布的口径是输出压缩没有公开的权威基准只有上面这份单次快照。Skill 的代价是明码标价的规则文本大约为每次调用增加约 1,000 个输入 tokenREADME.md。短任务可能净亏——GitHub 上就有人测出固定提示开销超过输出节省HONEST-NUMBERS 记录在案。而且它只对按 token 计费的平台有效按请求计费如 Copilot premium requests时答案变短了价格不变纯属白忙。Proxy输入侧压缩的是agent 反复重读的东西Agent 会话中真正的 token 大头往往不是对话而是每轮都会重新发送的工具结果几十 KB 的 CSV、日志、YAML、测试输出、JSON。proxy 的 Engineengine/README.md按内容形状匹配压缩器默认注册表有 15 个JSON、日志、代码、diff、表格、配置、TOON 等每次有损压缩前先把原始字节存进本地 CCR 恢复库再给模型一个更小的表示和可取回原样的句柄解析失败、存不下或压缩后不变小就原样透传且不认领任何节省。仓库的 Wrap 基准docs/WRAP-BENCHMARK.md给出了目前最扎实的一手数字六个确定的、agent 形态的工具输出工作负载每个 60–95 KB每臂三次重复Claude Code 直连 vs Caveman 包裹共 54 次运行指标直连Caveman 包裹变化提供商报告的输入 token 总量885,793591,673−33.2%95% 区间 14.6%–48.5%精确答案校验18/1818/18无损失单看文件级压缩更夸张CSV 28,041→314−98.9%、日志 22,810→348−98.5%、YAML 20,447→178−99.1%、测试输出 −98.9%、JSON −98.5%。但文件缩小不等于会话缩小——整会话还带着系统提示、工具定义、对话历史和 Skill 规则所以会话级只有 33.2%。最诚实的部分藏在表格尾部HTML 没有对应压缩器Caveman 只付了自己的开销没赚回一分钱该用例−9.9% 反超支且没有被隐藏或剔出聚合。这正是社区对 Caveman 信任的来源反例留在表里。proxy 的代价是运维性的需要常驻本地进程、CCR 存储默认上限 512 MiB和管理恢复句柄订阅流量Claude Pro/Max默认不压缩subscription_compress: false避免在订阅计费下引入风险。中间件给自建应用的那一份可恢复压缩如果你不是在包裹现成编码 agent而是自己写 agent 或服务中间件把同样的压缩能力以适配器形式开放出来packages/middleware/typescript/README.md 与 packages/middleware/python/README.md。它的行为契约比 proxy 更严格压缩需要恢复工具只有能注册caveman_retrieve的入口点才会真正压缩如withCavemanOpenAI的runTools、withCavemanAgent普通messages.create只记录、透传报告recovery_unbound。三种模式off/record/compress。客户端默认压缩独立 runtime 默认记录两边都要显式设置。fail-open 版本门控适配器检查框架版本超出测试范围就原样透传并告警一次任何内部异常都不会改写你的请求。作用域隔离scope 按命名空间和 session_id 切分runtime.deleteSession(scope)只删某个用户的原件多租户一个 client 实例即可。一个反直觉但重要的设计最终决策报告里没有 token 计数器。本地分段估计是推断的inferred提供商用量和账单节省是另一套证据本地示例不验证任何账单节省。也就是说中间件给你的是可观测性和可恢复压缩省钱数字要拿提供商账单自己验证——它宁可少报也不虚报。按部署形态与计费模式选型计费模式是第一道筛子按 token 计费API key 直连、BYOK三件套全部适用输入侧proxy/中间件收益通常大于输出侧。按请求/信用计费Copilot premium requests 等输出压缩完全无效输入压缩仍有意义吗部分平台按上下文大小阶梯计价需要自己 A/B。HONEST-NUMBERS 的规则很简单同一任务在开/关 Caveman 下对比提供商账单净增就关掉。订阅制Claude Pro/Maxproxy 的订阅压缩默认关闭因为订阅下输入 token 的边际成本为零——先检查自己的套餐再决定要不要开subscription_compress。部署形态决定用哪个壳个人开发机、高频使用Skill 一条命令npx skills add JuliusBrussee/caveman -g零成本起步先砍输出觉得不够再npm install -g caveman-ai/cli caveman setup --installcaveman claude起本地代理。本地 proxy 默认只监听127.0.0.1:8787无入站认证单机 BYOK。团队共享/自托管同一caveman-proxy二进制可部署为一个共享服务docs/technical/deploy.md。设置CAVEMAN_AUTH_TOKENopenssl rand -hex 32生成后才允许非回环监听且该 token 在转发前即被消费、绝不会到达提供商SSRF 防护默认拦截私网/环回上游除非显式加入CAVE_SSRF_ALLOWLIST。仓库提供 Docker、Compose、K8s含 HA 版、ECS Fargate、Cloud Run、Fly.io 全套清单。这里的关键约束SQLite 状态一份卷只允许一个写入者K8s 清单用Recreate而非滚动更新中间件存储可切 Postgres才能多副本水平扩展。自建应用/Agent 服务走中间件适配器。部署拓扑上推荐 sidecar 模式——每个应用 Pod 一个 runtime回环监听多租户隔离靠 Postgres schema 与身份共享 token、token map、OIDC、mTLS 四级身份源需要加密原件时配CAVEMAN_MIDDLEWARE_ENCRYPTION_KEYAES-256-GCM。组合策略从最小路径开始product-model 文档给了一张最小路径表原则是一次只加一层只有当某层在你自己的负载上实测赚回开销才继续叠加目标最小组件只是想要更短的回答装 Skill/caveman起步重活上/ultracave想压缩输入且可恢复caveman agent本地包裹自建应用接入改 base URL或withCaveman*适配器想知道 token 到底花在哪caveman learndocs/technical/learn.md观测是省钱的第一步caveman learn只读本机会话历史给配置税、死技能、超窗消息、重复粘贴块逐项打分并给出机械修复建议且只在你确认后逐个 diff 应用、净亏自动回退。把观测层与执行层分开是 Caveman 这套工具链区别于一个魔法开关的核心。社区热度与把反例写进文档的文化Caveman 的破圈不需要复述——百万级 star、Hacker News 榜首、被 Adobe Research 论文引用、被 JetBrains 做 A/B86 个真实编码任务p0.82无可测质量损失、被 Elasticsearch Labs 改造成 63.6% 响应 token 削减的变体这些都在 README.md 的 In the wild 一节有据可查。比热度更值得学习的是它的实证纪律输出压缩不吹权威基准、HTML 反例留在图表里、规则开销和按请求计费的失效场景写进 docs/HONEST-NUMBERS.md、本地数字只允许标inferred永不标verified。三件套横评的结论因此很明确——没有谁最能省钱的普适答案只有按链路、按计费、按部署形态各自测量输出侧的 Skill 门槛最低但天花板有限且要吃 1,000 token 规则税输入侧的 proxy 收益最大会话级 33.2%但要扛起代理运维和恢复存储中间件给自建应用留了同样的可恢复压缩代价是严格的版本门控与作用域管理。先跑一次caveman learn看清自己的钱花在哪再决定让哪块石头扛活。【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表