
从 Skill 到 Proxy 再到 MCPcaveman 的省钱插件生态正在长成【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman2026 年 4 月一个 19 岁开发者把它当作玩笑提交到 GitHub三个月后它拿下 Hacker News 榜首 904 分、GitHub Trending 总榜第一并在 Adobe Research 的 arXiv 论文中被正式引用。这个项目叫 caveman口号是why many token when few do trick——中文社区里被戏称为让 AI 说人话或者说人话都别多说的省钱插件。它把 AI 编码代理的输出 token 平均砍掉 65%输入 token 在整场会话中再省 33%而代码、路径、错误信息一字不改。更值得注意的不是数字本身而是支撑这些数字的工程形态caveman 没有做成一个万能插件而是拆成了 Skill压缩输出、Proxy压缩输入与 MCP工具化恢复与统计三层。这三层恰好对应了 AI 编码代理生态里三种不同的接入方式。本文结合仓库源码拆开这套省钱插件生态是如何长出来的。Skill只压废话不碰payloadcaveman 的第一个组件是 Skill——一个以 Markdown 规则文件形态存在、随npx skills add JuliusBrussee/caveman -g一键注入任意编码代理的提示词包。它的核心逻辑全部写在 skills/caveman/SKILL.md 里而这份文件本身可以被看作一份给模型的压缩协议Answer first回复必须遵循[thing] [action] [reason]. [next step].的结构删掉开场白、复述与结尾客套Payload verbatim代码块、命令、路径、API 名、错误串必须逐字符保留——这是整份规则的不可触碰区Meaning never droppednot/never/no/only等否定词永远不能删数字与单位保持精确One idea per sentence以航空维修手册的受控英语 ASD-STE100 为底线每句不超过 20 词、用主动语态Knows when to stop遇到安全警告、不可逆操作、分步指令或用户困惑时退出压缩模式说完整句子然后恢复。这套规则的巧妙之处在于它定位为voice, not broken grammar——不是让模型模仿语法破碎的原始人说话而是压缩仪式感。仓库 README 里给过一对对比普通 agent 解释 React 重渲染用了 63 个 token/caveman模式只用 20 个 token 说清楚同一个修复而/megacave文言文模式见 skills/megacave/SKILL.md甚至压到 13 个 token。README 还给出了诚实边界Answer concisely.一句话本身就是基线/caveman在中位数上再省 3%/ultracave再省 35%——没有夸大。围绕这个核心 Skill仓库长出了一整排兄弟命令/caveman-commit输出 Conventional Commits 规范的一行式提交信息skills/caveman-commit/SKILL.md/caveman-review用一行一条 finding的格式做代码审查/caveman-compress专门压缩 CLAUDE.md 这类记忆文件见 skills/caveman-compress/SKILL.md它把压缩后的备份存到树外目录避免被 agent 自动加载器再次读入。Skill 是这套生态的零成本入口只改变模型说话的方式不需要任何守护进程。ProxyAgent 不改一行代码流量自动瘦身Skill 解决了说太多的问题但 jetBrains 的 A/B 实验带来一个关键洞察agent 会话的大部分 token 其实花在反复读取日志、JSON、测试输出和 diff 上。于是 caveman 长出第二块石头——caveman-proxy一个 base-URL-swap 的反向代理proxy/README.md。它最值得称道的设计是接入零成本把 agent 指向http://127.0.0.1:8787代理在本地解析 provider 凭证、检查请求体、应用压缩变换、转发上游、解析用量并落库。从 agents/agents.json 可以看到每个代理的注入方式都被声明式描述Claude Code 通过ANTHROPIC_BASE_URL环境变量注入Aider 走OPENAI_API_BASE而通用于所有代理的是一套wire_protocolinjection元数据——这就是它能兼容 30 编码代理而不需要为每家写插件的原因。安装脚本 install.sh 自动探测机器上已安装的代理逐家走原生安装路径plugin / extension / rule file /npx skills add然后跳过没有安装的全程约 30 秒。代理的压缩能力来自本地运行时 engine/README.md默认注册表里有 15 个压缩器JSON、日志、代码、diff、搜索结果、文本、HTML、表格、配置、工具 schema、TOON、可访问性树、重复内容、终端输出。压缩是有损但可逆的——压缩前原始字节先落入本地 CCR SQLite 存储agent 随时可以通过 recovery handle 取回逐字节一致的原件如果输入无法解析或压缩后 token 不减反增就原样透传且不声称任何节省。README 的基准数字很诚实CSV 单文件从 28,041 token 压到 31498.9%日志从 22,810 到 348整场 Claude Code 会话含系统提示词、工具定义、对话输入 token 平均省 33.2%而 HTML 因为没有压缩器是唯一更差的一行——红行就摆在那里不藏。代理层还承载了记账与治理能力单操作员、BYOK、零云依赖caveman.yaml与环境变量双轨配置团队共享部署时用CAVEMAN_AUTH_TOKEN做门禁共享 token 在转发上游前被消费掉本地caveman.db记录每次请求的真实花费且节省一律标注为inferred推断而非verified已验证。MCP把压缩能力变成可组合的工具协议Skill 和 Proxy 覆盖了提示词注入与流量旁路两条接入路径但还有第三种让压缩能力直接以工具的形式出现在 agent 的工具箱里。这正是 mcp/README.md 描述的caveman-mcp服务器做的事情——五个工具通过 stdio 提供给任意 MCP host工具作用caveman_compress压缩一段输入返回推断压缩率与 recovery handlecaveman_retrieve用 handle 取回逐字节一致的原件支持查询排序caveman_stats本进程的压缩调用统计前后 token、请求数、比率caveman_toon_encode/decodeJSON ↔ TOON 显式互转不可编码时透传并注明MCP 层补齐了代理层做不到的一件事流式响应与订阅制鉴权的 agent 会话里压缩块的恢复必须由 agent 侧发起——docs/technical/architecture.md里的请求路径图清晰画出了这一点代理压缩、CCR 存储、MCP 负责retrieve handle取回原件。于是三层拼成了完整的闭环Skill 压输出、Proxy 压输入、MCP 保恢复与可观测。同样的能力还被包装成了更多形态caveman-browsebrowse/README.md通过 Chrome DevTools Protocol 读取可访问性树把网页压成 agent 可读的紧凑快照200 行表格从 15,704 token 压到 121caveman-shrink压缩工具目录cavemem提供持久记忆与排序召回TypeScript/Python 的caveman-ai/middlewarepackages/middleware/typescript/README.md则让自建 agent 以一行 wrapper 接入 Vercel AI SDK、LangChain、OpenAI 或 Anthropic。每个进程只负责一个边界失败时回退而不编造结果。生态位为什么兼容 30 代理是战略而非工程细节社区对 caveman 的普遍疑问是市面上压缩 prompt 的方案不少凭什么它长到了 10 万星源码给出的答案藏在两个文件里INSTALL.md 的 40 行代理矩阵与 agents/agents.json 的声明式协议描述。前者说明能装到哪里后者解释为什么装得上去——把每个代理的注入机制、wire protocol、skill 目录、hook 方式固化成结构化数据新增一个代理就是新增一条 JSON 记录而不是重写一个插件。这个生态位意味着三件事。第一caveman 的价值不绑定任何单一厂商Claude Code 用 Anthropic Messages 协议Aider 走 OpenAI 兼容Codex 有自己的 CLI但它们都能通过各自的原生接缝接入同一个压缩引擎——这正是 proxy 文章里一个字节安全、BYOK、零云依赖的 AI API 反代被社区热议的原因。第二它把省钱从技巧变成了基础设施Skill 只解决输出侧Proxy 解决输入侧MCP/SDK 解决自建场景三层互相独立又共享同一个 Engine 核心docs/technical/architecture.md称之为一组由文件、stdio、回环 HTTP 与 MCP 连接的小进程。第三诚实计量是它抵御怀疑的护城河节省一律inferred、失败透传不声称、HTML 行保持红色、JetBrains 的 p0.82 说明无质量损失——当 ThePrimeagen 的这不可能真的有用成为被引用的标题时项目用可复现的基准而不是话术来接住质疑。回看这套生态的成长路径它是被问题驱动的而非被路线图驱动的先有输出太啰嗦→ Skill再有输入反复读→ Proxy再有自建 agent 也要省→ Middleware/SDK再有网页、记忆文件、工具目录也该省→ browse / compress / shrink。每一种新形态都不是推翻重做而是在同一套 Engine 上开新的接缝。对一个以省钱为卖点的项目而言这或许是最好的产品形态它不要求你迁移到某个 IDE、某个 CLI 或某个云服务而是让自己长成你手头任何编码代理都能咬一口的通用省 token 层。对于正在评估 token 成本、或者干脆想抄这套多形态兼容架构的开发者caveman 仓库本身就是最好的教材——从一份 88 行的 SKILL.md到声明式的代理注册表再到可逆压缩的 Engine每一层都足够小而清楚单独拿出来都能用。【免费下载链接】caveman why use many token when few token do trick. Viral skill proxy for coding agents that cuts 65% of tokens by talking like a caveman.项目地址: https://gitcode.com/GitHub_Trending/caveman1/caveman创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考