多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

小模型价格战开打:选型别再只盯每百万 Token 报价

小模型价格战开打:选型别再只盯每百万 Token 报价 这几天小模型这块挺热闹。Anthropic 放出了 Claude Haiku 5.5官方跑分逐项压过 OpenAI 的 GPT-6 Luna定价也对标着 Luna 走差不多同一时间微软把编程模型 MAI-Code-1.1-Flash 的价格降到了初代的四分之一更早一点GPT-6 Luna 把输入价拉到了每百万 token 0.1 美元。几个消息叠在一起给人的感觉是小模型不要钱了。但真到给自己项目选型的时候只看这个数会踩坑。先把小模型的定位说清楚Haiku 这种档位卖点从来不是能力天花板而是速度和跑量。官方数据里Terminal-Bench 4.0 上 Haiku 5.5 拿 39.2%同门的 Sonnet 5.5 是 70.6%——复杂多步编码、跨文件重构、长周期自主规划差距摆在那。Anthropic 自己在文档里也建议复杂的 agent 编码优先用 Sonnet 或 Opus。也就是说变的是价格没变的是分层。便宜的那档能干的是分类、提取、问答、短链路调用和批量任务真到读一堆文件、改一处、跑测试、错了再回来改的长流程小模型还是容易掉链子。把它当成降本工具没问题当成旗舰平替就容易在返工上把省下的钱吐回去。一个反向信号不是所有价都在降小模型这边打价格战另一边却在涨价。据报道2026 年 DeepSeek 上调了 API 定价还引入了工作日高峰翻倍的峰谷计费有统计称2026 年第二季度国内大模型平均 API 输入价格升到每百万 token 约 4.9 元、输出约 21.9 元相比 2025 年第一季度分别涨了约 48% 和 80%。原因不复杂Agent 任务的单次算力消耗比普通对话高出一两个数量级高峰时段 GPU 本来就紧低价拉来的调用量越大边际成本越兜不住。有云业务交叉补贴的厂商可以把 API 当引流入口独立厂商则要靠 API 收入活命价格迟早要回到成本线上。所以降价是相对的小模型在降是因为它们单价本来就低、拼的是跑量效率而算力总体是紧的谁也没法长期无条件便宜。对普通开发者来说这件事有两面。好的一面是写代码、做小工具、跑批量任务的门槛确实在往下走以前舍不得开的高频调用现在可以放进日常流程里。麻烦的一面是选型比过去更费脑子了——一年前大家还习惯认准最强的那一个现在同一个能力档位里能挑的模型有七八个价格、上下文长度、是否支持视觉、缓存怎么算全都不一样。更别说这些价格还都是浮动的今天降、明天可能就调回去。这带来一个很现实的建议别把模型名硬编码在业务逻辑里。把调用封一层薄薄的适配层模型、单价、endpoint 都放到配置里换模型的时候只改配置不改代码。这样不管下一轮是涨价还是降价你都还有腾挪的空间而不是被某个 SDK 绑死。技术上的两个坑报价不等于成本第一个坑是 tokenizer。Haiku 5.5 换了新的分词器同样的任务会多消耗一些 token代码、表格、非英语内容的膨胀更明显。标价看着砍了九成实际省下来的可能少一截。第二个坑更根本厂商自己都在从看跑分转向强调 cost per task也就是跑完一个任务到底花多少钱。这才是你该拿来比的口径。一个每百万 token 只要 0.1 美元、但需要来回折腾五轮的模型未必比一个贵一点但一次跑对的模型便宜。同一块基准上也能看出这点。微软 model card 里MAI-Code-1.1-Flash 在 SWE-bench Verified 上是 72.6%、Terminal Bench 2.1 上是 62.9%而第三方整理的对照表里DeepSeek-V4-Flash 在 Terminal Bench 2.1 上是 82.7%价格还更低。单看一张图就下结论很容易被打脸。实用部分怎么选、怎么省一、用你自己的 eval 算单任务成本。别拿厂商的跑分表比挑十几条你真实场景里的任务固定输入同一套评分标准跑一遍记录两个数通过率和实际 token 消耗。下面这段是真能跑的骨架把两个模型的单价填进去就能对比fromopenaiimportOpenAI clientOpenAI(api_keyYOUR_KEY,base_urlYOUR_ENDPOINT)# 每百万 token 的单价按你所用模型的官方价填PRICES{model-a:{in:0.10,out:0.50},model-b:{in:2.00,out:10.0},}defrun(model,prompt):respclient.chat.completions.create(modelmodel,messages[{role:user,content:prompt}],)uresp.usage pPRICES[model]costu.prompt_tokens/1e6*p[in]u.completion_tokens/1e6*p[out]returnresp.choices[0].message.content,cost,u.total_tokensfornameinPRICES:out,cost,tokensrun(name,把这段日志里的报错原因分类)print(name,tokens,tokens,cost$%.5f%cost) 十几条下来你会得到一张谁在你的任务上更划算的表比任何榜单都靠谱。**二、把缓存的折扣吃满。**缓存命中的那部分输入便宜很多GPT-6这类模型缓存输入能到九折以上的降幅MAI-Code-1.1-Flash 的缓存输入价是每百万 token0.02美元。做法很简单把系统提示、few-shot 示例、固定上下文放前面保持不变把变量放最后批量任务能错峰就错峰很多厂商的谷时价是高峰的半价。**三、做模型分层路由。**FAQ、分类、字段提取、简单改写这类固定模式的任务走小模型甚至用本地开源小模型兜底只有长链路 agent 编码、复杂推理才路由到大模型。别用一个模型扛所有场景那是最贵也最容易翻车的用法。 价格战对开发者当然是好事但便宜只是入场券。真正拉开差距的是谁能把每一分 token 花在刀刃上。你现在的项目是怎么选模型的会不会定期重跑一遍成本对比评论区聊聊。
返回列表