多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

别再迷信“参数越大越聪明“

别再迷信“参数越大越聪明“ 别再迷信参数越大越聪明同一个 DeepSeek 模型只重做了一遍后天教育Agent 能力暴涨 6 倍价格只剩闭源巨头的 1/90。7 月 31 日晚上DeepSeek 悄悄把 V4-Flash 的正式版 API 端了上来。没有新模型发布没有新架构论文甚至连新闻稿都短得可怜。官方只说了两句话模型结构和尺寸跟预览版完全一致只重新做了一遍后训练。结果 benchmark 一出来圈子里炸锅了。用来测 AI Agent 真实长周期编程能力的 DeepSWEV4-Flash 从预览版的 7.3 分直接飙到 54.4 分。这不是小进步是六倍多的跳涨。Terminal Bench 2.1 干到 82.7逼近 Claude Opus 4.8 的 85.0在 Artificial Analysis 的智能指数榜上拿了 50 分而同类可比模型的中位数只有 17。更扎眼的是价格输入 0.14 美元、输出 0.28 美元每百万 token缓存命中时只要 0.02 元每百万 token。Claude Opus 5 的定价是 5/25 美元GPT-5.6 Sol 是 5/30 美元。粗算下来DeepSeek 的价格大约是人家的 1/90。同一个模型骨架没换脑子只换了个补习班成绩从二本冲到清北。“后训练听起来很技术你可以把它理解成毕业后的在职培训”模型先在预训练里读完互联网上的海量书本和代码相当于念完大学后训练再教它怎么打电话、怎么查资料、怎么写报告、怎么跟客户沟通。大学文凭只能证明你学过能不能干活靠的是后面这套训练。这不是神话这是信号。01 数据先说话后训练到底能带来什么我先把关键数字摊开来。DeepSeek-V4-Flash-0731 的参数没动总参数量 2840 亿激活参数 130 亿MoE 架构100 万 token 上下文支持思考/非思考双模式。真正变了的是后天——后训练策略。效果有多夸张DeepSWE 从 7.3 涨到 54.4涨了 6 倍多。DeepSWE 是专门用来测 Agent 在真实、长周期、多步骤编程任务里自主解决能力的基准。这个分数一跳说明模型不再只是会写代码而是开始能自己规划、自己找 bug、自己跑通一个项目。Terminal Bench 2.1 从 72.1 涨到 82.7超过 GLM-5.2 的 81.0逼近 Opus 4.8。这个测试看的是 Agent 在 Linux 终端里自主规划、执行多步命令、犯错后恢复的能力。说白了就是你给它一个服务器账号它能不能自己把活干完。其他几项也不差DSBench-FullStack 68.7Cybergym 76.7Toolathlon verified 70.3。AI 评测机构 Artificial Analysis 给它的综合智能指数打了 50 分GPT-5.6 Luna 是 51 分仅差 1 分。在 Arena.ai 的前端代码竞技场里V4-Flash-High 以 1586 分登榜比预览版高出 154 分。还有一个容易被忽略的细节它支持 100 万 token 的上下文窗口。Agent 干活时要读大量文档、代码库和历史记录上下文越长它越能记住整个项目而不是每次都得重新补课。这里最反直觉的是GPT-5.6 Luna 是 OpenAI 花了大价钱、大算力训练出来的旗舰而 DeepSeek 用同一副骨架靠后训练就追到了身后一步。价格更是让人坐不住。V4-Flash 输入 0.14 美元/百万 token输出 0.28 美元/百万 token。对比 Claude Opus 5 的 5/25 美元DeepSeek 不到它的 1/90。即便 OpenAI 在 7 月 30 日把 Luna 的价格猛砍 80%DeepSeek 的单任务成本仍然比它低约 60%。而且 DeepSeek 的缓存命中折扣高达 98%业内普遍只有 90%。你反复调用同一段上下文时它几乎不收钱。这不是简单的便宜是把单位有用结果的价格打下来了。02 预训练是基因后训练是教育很多人对大模型的理解还停留在参数越多越聪明。这个逻辑以前没问题。GPT-3 到 GPT-4参数翻几十倍能力确实跨了一个台阶。那段时间所有人都在堆数据、堆算力、堆参数。万亿参数成了口头禅仿佛谁的模型大谁就赢。但今年以来这条路的边际收益在明显递减。从 GPT-3 到 GPT-4算力涨了几十倍能力提升也肉眼可见。但再往后每多烧一亿美元训练出来的改进正在变得越来越小。行业内部早就在传继续堆参数、堆数据训练成本指数级上升但考试分数的提升可能只有几个点。这不是说预训练没价值而是说它的性价比在下滑。预训练本质上是在给模型喂知识海量互联网文本、代码、论文让它学会语言规律和事实关联。你可以把它理解成基因——决定了这个模型的智商上限、知识储备、语言天赋。但基因好不等于会干活。一个智商 140 的孩子没经过训练也未必能写出好文章、解出竞赛题、谈下客户。真正把知识变成手艺的是教育怎么思考、怎么调用工具、怎么纠错、怎么在复杂任务里不跑偏。后训练就是这个教育阶段。它包括监督微调SFT、强化学习RLHF、工具调用训练、多轮任务规划训练以及针对 Agent 工作流的专项优化。简单说预训练让模型知道后训练让模型做到。最近半年还有一个明显趋势推理阶段的计算越来越重要。OpenAI 的 o 系列、DeepSeek 的思考模式都是让模型在回答前多想一会儿。这个想一会儿不是预训练能解决的它靠的就是后训练里教的推理策略。换句话说以前大家比谁读书多现在比谁更会思考。过去两年行业把 90% 的注意力放在预训练上。现在风向变了。DeepSeek 这次用行动证明同一副骨架只要把后训练做深做细Agent 能力可以提升六倍以上而且成本可以压到原来的零头。这就像两个同样聪明的孩子一个上了普通公立一个进了顶级竞赛班。三年后差距不是智商差距是训练方法差距。更深层地看后训练崛起有一个产业背景模型基座正在快速基础设施化。开源模型、蒸馏模型、MoE 架构已经把好基因的成本拉得很低。DeepSeek、Qwen、GLM、Kimi 的基座能力越来越接近差距从代际缩短到个位数。当大家基因差不多的时候比的就是谁更会教育模型。03 OpenAI 被迫降价 80%价格战进入下半场DeepSeek V4-Flash 上线的前一晚OpenAI 做了一件罕见的事把 GPT-5.6 Luna 的价格下调 80%。这不是慈善。这是被价格战逼的。今年以来AI 圈的叙事已经从谁能训练出更大的模型转向谁能用更低的成本交付有用的结果。DeepSeek 擅长把后者做到极致。它用兼容 OpenAI Responses API 的策略让开发者几乎可以零成本地把原本为 OpenAI 设计的 Agent 工作流迁移过来。切换成本几乎为零价格却只有几分之一。对开发者来说这相当于同一条路突然之间过路费从 90 块降到 1 块。OpenAI 的应对是降价清场——把 Luna 降到原来的两折试图用价格守住生态。但 DeepSeek 的缓存折扣和 API 兼容策略让它仍有成本优势。这不是单次降价能解决的。为什么这次价格战这么狠因为 Agent 时代的商业模式变了。以前大模型主要卖聊天你问一句它答一句按 token 计费。现在 Agent 要调用搜索、读文档、跑代码、查数据库、发邮件一个任务可能要几十轮推理和工具调用。token 消耗量是以前的十倍甚至百倍。如果推理成本不降Agent 就是玩具。只有把完成一件事的成本压下来Agent 才能进企业、进工作流、进真实业务。价格下降已经在改变产品形态。网易有道在 V4-Flash 上线当天就宣布全线产品完成接入覆盖词典、翻译、同传、AI 答疑笔和办公助手 LobsterAI。对这类高频调用场景来说token 成本每降一个数量级产品里能放的功能就多一个数量级。对个人开发者和一人公司来说这更是一剂强心针。以前搭一个 AI 工具最大的不确定因素就是算力账单现在你可以用几毛钱的成本跑一个多步骤 Agent做出能收费的产品。创业者的试错成本被压到前所未有的低。所以这场价格战真正的战场不是每百万 token 多少钱而是完成一个真实任务要花多少钱。DeepSeek 的杀手锏不是绝对低价而是把单位有用结果的成本打穿了地板。对企业老板来说这意味着什么以前你可能听说 AI 客服能省 40% 成本但一算 API 账单发现省的钱还不够付 token 费。现在这个价格很多场景的 ROI 是真的能算过来了。市场调研、合同审查、代码重构、数据清洗、多语言客服——这些原来要人干几天的活Agent 可能几个小时就干完成本还低一个数量级。04 白菜价不是万能药话说到这我得泼点冷水。便宜不等于好用更不等于适合你。DeepSeek V4-Flash 的架构没变说明它的能力上限仍然受基座约束。后训练可以让它更会干活但不能让它知道它本来不知道的事。如果你的任务需要极强的专业知识、超长上下文推理、或者对错误率零容忍基座更大的模型可能还是更稳。另外后训练的质量高度依赖训练数据和方法。一个模型可能被训练得很会考试但一到真实场景就照本宣科、过度拟合 benchmark。你看到的分数很漂亮实际用起来可能要多试几轮、多纠正几次。这些隐形成本不会写在价格表上。更微妙的是评估漂移。当某个 benchmark 成为行业通用标准厂商就会针对它做专项优化分数涨得快真实能力不一定同步涨。这就像学生专门刷高考真题模拟考分数上去了进了大学未必能适应。所以看 benchmark 要看它测的是不是真实工作而不是看谁的数字更大。还有一个容易被忽略的点API 兼容是把双刃剑。DeepSeek 原生支持 OpenAI Responses API开发者可以无缝迁移。这大大降低了试用成本但也意味着你的工作流可能越来越依赖某个 API 格式。今天从 OpenAI 切到 DeepSeek 很容易明天如果从 DeepSeek 切出去也未必难。关键是别让自己的业务被一家公司的接口标准绑架。所以我给企业选型提一个简单标准别看每百万 token 多少钱看完成一件事的总成本。总成本包括模型调用费、重试费、人工审核时间、错误带来的返工、以及迁移和锁定的风险。有些模型 token 便宜但错误率高算下来反而更贵。有些模型 token 贵但一次过综合成本更低。便宜是结果不是目的。目的是用更低的成本拿到更靠谱的结果。05 三类人三句话这场后训练价格战的变局对不同人意味着不同的事。如果你是普通用户或小企业主别追参数追同样钱能干多少活。你可以开始认真试试 AI Agent 工作流了。以前可能因为贵而舍不得跑的多步骤任务现在成本可能已经降到可以接受了。如果你是开发者或技术负责人拿 DeepSeek 这类兼容 API 做迁移实验成本极低。但别让一家公司定义你的工作流抽象层。多封装一层自己的任务调度、重试、日志和评估体系这样将来换模型不会伤筋动骨。如果你是行业观察者或政策制定者后训练的数据来源、价值对齐、安全护栏会比预训练更快地浮出水面。当模型越来越便宜、越来越会自主调用工具监管的重点也该从模型有多大转向模型在真实场景里会做什么、做错了谁负责。过去两年AI 行业像是在打一场基因军备赛谁的参数多谁的数据多谁的算力堆得高谁就领先。DeepSeek V4-Flash 这件事告诉我们基因竞赛的天花板已经若隐若现后天教育的红利才刚刚开始。同一个模型换种教法成绩可以从二本冲到清北。价格还能砍到原来的 1/90。这不是某个公司的胜利这是一个时代的切换。拼参数的时代正在过去。拼后训练、拼工程化、拼单位结果成本的时代来了。对普通人来说最朴素的判断标准也变了别再问这个模型有多大要问它帮我干完这件事要花多少钱、要返工几次。答案越便宜、越稳定AI 就越快变成你的员工而不是你的玩具。
返回列表