
极简主义的边界caveman 的最小代理循环压到多薄才算好【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman2026 年一个把 AI 输出压缩成原始人语的项目在 GitHub 上突破十万 star、冲上 Hacker News 榜首还被 Adobe Research、JetBrains、Elastic 三个机构分别独立验证过。社区里流传的数字一个比一个夸张平均省 65% 输出 token、CSV 压缩 98.9%、整场 Claude Code 会话省 33.2% 输入 token。热度之下真正值得追问的不是它能省多少而是一个更本质的工程问题一个编码代理的最小循环到底能压多薄压到哪一层薄才开始伤到任务本身本文从仓库源码出发拆解 caveman 的最小代理循环的构成、它的 token 控制策略以及它在任务边界之外必须付出的代价最后给出极简主义与重型框架的适用分界线。最小可行代理循环的构成与 token 控制策略caveman 的最小循环不是一个文件搞定一切而是由一组职责单一的小进程通过文件、stdio、回环 HTTP 和 MCP 拼合而成。文档 docs/technical/architecture.md 把这条本地链路画得很清楚既有的编码代理或 SDK 发出 provider 请求caveman-proxy在回环地址上接住做路由与凭证映射交给 Caveman Engine 检测与变换再转发上游模型响应与用量计数原路返回并写入本地 SQLite。整个过程是 base-URL swap——代理代码与请求格式原封不动只换掉 base URL。这个循环里最薄的部分是 Engine 的四个稳定操作Compress、Retrieve、Detect、Stats外加一个不落盘的Simulate干跑。在 engine/engine.go 的注释里写得明白这四个调用就是 proxy、SDK、CLI、MCP 服务器与浏览器构建共享的稳定契约。检测环节为 JSON、终端输出、diff、HTML、表格、源码、日志、搜索结果、配置文本、普通文本十类内容自动分派压缩器默认注册表里有 15 个压缩器代码压缩器保留 import、签名和类型声明只略去函数体且用 tree-sitter 解析 Go、Python、TS、JS、Rust、Java、C、C 八种语言。token 控制策略的骨架是每个压缩器都是纯字节变换它不数 token、不存恢复、不碰网络这些控制全部由 Engine 在压缩器外围提供见 engine/compressors/compressor.go。计数则用一个把 tiktoken o200k_base 词表内嵌进二进制的离线 BPE 计数器全离线、确定性、可复现engine/tokens/tokens.go。这个薄不是功能的薄而是边界的薄——把可变的、有网络与存储副作用的控制逻辑全部收拢到一个核心里压缩器因此可以独立测试、独立替换。代价也是显式的本地计数只能标inferred永远不能冒充 provider 账单。README 里公布的基准数字同样带着这个诚实标签——54 次 Claude Code 运行里 18/18 答对六类文件整体压缩 82.4%整场会话输入 token 省 33.2%但 HTML 因为没有压缩器整场反而贵了 9.9%。极简循环没有掩盖自己的失败案例而是把它们写成了表格里的红行。极简的代价任务边界清晰之外呢极简主义最常被忽略的真相是它把复杂度从运行时挪到了规则与责任上。caveman 的输出风格不是坏语法而是一套有底线的受控语言。skills/caveman/SKILL.md 的规则表写得很具体先答后述、一句一义以航空维修手册使用的 ASD-STE100 受控英语为下限单句不超过 20 词、not/never/no/only一个都不能丢、数字与单位必须精确、代码/命令/路径/错误信息逐字符不动、工具调用之间不许闲聊。发送前还有一道预检首句预告计划就删末句复盘就删任何否定词缺失或语句有歧义就改回完整句。但规则再严密也只是提示词它的输入开销是实打实的。docs/technical/product-model.md直接承认skill 的指令文本本身要消耗输入 token一个短任务开启 skill 后总 token 反而可能变多。仓库里专门维护了一份 docs/HONEST-NUMBERS.md逐一列出 caveman 会输的案例按请求而非按 token 计费的 Copilot premium requests 省不了钱#506有人实测固定 prompt 开销超过输出缩减净亏损#145一次 Cursor A/B 显示 caveman 场景 4.3M token 对基线 1M token、墙钟时间翻倍#550——虽然那次跑无法复现但结论是规则重复注入、重试与缓存记账足以淹没输出节省。更深的代价在输入侧输出 skill 只是让模型少说真正省输入 token 的是代理。可代理一旦有损压缩就必须保证可恢复这正是 CCRCaveman Context Recovery存在的理由。有损结果要遵守四步序列先把原始字节精确存入 CCR再返回更小的模型可见表示附带一个能取回原件的句柄存储/解析/尺寸任一检查失败就原样放行docs/technical/context-recovery.md。句柄是内容寻址的ccr_前缀加 SHA-256 前 16 字节同一份字节永远得到同一个句柄。换句话说极简代理的薄是以一个本地恢复数据库为代价换来的——它不薄它只是把厚度搬到了别处。代理层还有第三重代价安全不变量必须在极简的同时保持完备。proxy 的 breakpoint 规划器有双重 fail-closed 闸门默认关闭只有会话 ledger 测得无害才会放行优化杠杆proxy/internal/gateway/breakpoint_plan.go未知路由返回 404、未知运行时模式退回 record、变换输出没变小就转发原件、CCR 不可用就原样放行。架构文档把这条写成了表格化的失败行为矩阵本地数据路径的失败永远偏向正确转发 provider 流量变换失败绝不能变成合成的成功或客户端解析错误docs/technical/architecture.md。薄循环与安全完备并不矛盾但实现两者的注意力成本不低——这正是极简最容易被低估的隐性开销。任务边界清晰之外还有一类场景是规则主动让位安全警告、不可逆操作、可能被片段打乱顺序的分步指令、用户困惑或重复提问一律恢复完整句之后 grunt 再继续。规则说得很直白压缩与清晰冲突时清晰获胜。极简主义在这里不是全局开关而是带豁免的默认值——这本身就是对压到多薄问题的一个回答最薄的那一层必须保留退出通道。极简主义与重型框架的适用分界线分界线可以归纳为三条可检验的标准任务是否边界清晰、token 是否按量计费、开销是否可被本地测量。先看第一条。caveman 官方给出的适用画像高度吻合日志、CSV、JSON、YAML、测试输出这类低价值大噪声输入代理层能压掉 98.5%–99.1%代码审查、批量重命名这类答案唯一、格式固定的任务输出风格化几乎没有信息损失。JetBrains 用 86 个真实编码任务做配对 A/B结论是无可测质量损失p 0.82、输出 token 少 8.5%Elastic 在 8 个实时 MCP 场景里拿到 63.6% 更少响应 token 且零信息损失。反过来任务一旦需要长链推理、跨文件规划、多轮协商、开放设计决策极简循环缺乏的东西就暴露出来了它不维护自己的规划状态机不提供任务契约之外的推理脚手架——这类活恰是重型框架Agent SDK、LangChain 这类带 planner、memory、tool orchestration 的体系的主场。第二条是计费模型。README 自己说了规则每次调用要吃掉约 1,000 个输入 token按请求计费GitHub Copilot premium requests时更短的答案并不更便宜直接跳过 caveman。所以分界线不在省不省 token而在你的账单是否按 token 走。按 token 计费、输出冗长、输入含大量结构化噪声——caveman 的每一条杠杆都正中靶心按请求/信用计费或者任务短到 skill 的指令开销盖过收益就该关掉它。第三条是测量。caveman 把自己测自己做成了产品的一部分caveman learn从磁盘上已有的 agent 历史里排你的 token 去向caveman trial在自己的真实工作上做 A/Bcaveman stats读会话日志给出本场用量docs/technical/cli-reference.md。HONEST-NUMBERS 的规则只有一句话用同任务、开与不开 caveman 的 provider 账单总额对比变贵就关。这不是营销话术而是一个极简工具敢于给自己划出的边界。caveman 的答案可以浓缩成一句话最小代理循环不是最薄的实现而是把复杂度摆在能被测量和能被关掉的位置。它的薄体现在运行时边界——每个进程只管一条边界、每类压缩器都是纯函数、每条数据路径都 fail-closed它的厚体现在契约——CCR 恢复库、会话 ledger、四类证据标签inferred、provider-reported、benchmark_counterfactual、verified让每一分节省都可追溯、可复现、可否认。当省 token 的冲动遇上任务边界模糊、账单按请求计费、或开销无法本地测量时极简主义的正确动作不是硬压而是退回到完整表达——就像megacave用 13 个 token 说完的事必要时仍会为一句安全警告让出十个完整句。压到多薄才算好caveman 给出的工程判据是薄到每一项节省都配得上一条可验证的证据薄到每一条规则都留着一个恢复完整表达的出口。再往下压省下的就不是 token而是任务的正确性了。【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考