多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

肉搏战里掉队的会是谁?V4 Pro、Grok 4.6、Kimi K3 三方正面对撞

肉搏战里掉队的会是谁?V4 Pro、Grok 4.6、Kimi K3 三方正面对撞 肉搏战里掉队的会是谁V4 Pro、Grok 4.6、Kimi K3 三方正面对撞【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-08132026 年的大模型竞争已不再是发布即封神的单点叙事。DeepSeek V4 Pro 正式版0813选择在深夜突袭上线华尔街见闻用多项测试逼近 Fable 5、撞车 Grok 4.6来形容它社区第一时间跑分的结果却更微妙——综合得分落后于 Kimi K3、仅与 Grok 4.6 相当。同一时间Grok 4.6 与 Kimi K3 也在各自的能力版图上加码三家头部模型在智能体Agent赛道正面互搏。本文基于 DeepSeek-V4-Pro-0813 官方仓库的 benchmark 表与源码拆解这场肉搏战的真实格局分数口径差在哪里、V4 Pro 靠什么护住身位、以及国产模型厂商在贴身竞争中的策略选择。三方 Benchmark 数据对照与口径差异先看官方口径。仓库根目录的 README.md 中公布了 DeepSeek-V4-Pro-0813 与 Kimi K3、Fable-5、Opus-4.8、GLM-5.2 及自家 Flash 系列的横向对比表这里摘取智能体相关核心项BenchmarkV4-Pro-0813Kimi K3Opus-4.8Fable-5 (w/ fallback)V4-Pro (Preview)HLE (wo / w tools)42.7 / 60.043.5 / 56.049.8 / 57.953.3 / 63.037.7 / 48.2Terminal Bench 2.187.988.385.088.072.1DeepSWE62.767.558.070.012.8Toolathlon-Verified74.176.576.277.955.9Agents Last Exam25.727.625.7-16.5Cybergym83.380.078.383.152.7这张表的信息量很大但它恰恰说明了肉搏阶段的第一个残酷现实头部模型之间的差距已经缩小到个位数百分点而谁赢谁输高度取决于评测口径。注意几个关键口径细节HLE 的w/ tools栏V4 Pro 0813 带工具达到 60.0反超 Kimi K3 的 56.0 和 Opus-4.8 的 57.9逼近 Fable-5 的 63.0但不带工具时 42.7 又落后 Kimi K3 的 43.5。这说明三方在裸答与工具增强两个模式下的相对优势并不一致单报一个数字很容易误读。DeepSWE 的分化最剧烈Kimi K3 以 67.5 领先V4 Pro 0813 的 62.7 虽从 Preview 的 12.8 暴涨 4 倍但 Fable-5 仍以 70.0 压住全场。社区流传V4 Pro 综合得分落后 Kimi K3、接近 Grok 4.6与这张表里部分项落后 Kimi K3、部分项反超的格局吻合。README 的注释Notes交代了评测条件V4 Pro 0813 的代码智能体任务是在 DeepSeek Harness 作为 agent 框架、max推理档位、temperature 1.0, top_p 0.95下测得的DSBench 两项还标注为内部测试集。也就是说跨厂商比较时评测框架、推理预算、采样参数都会影响排名——这正是肉搏阶段舆论争议的根源。V4 Pro 退场悬念Grok 4.6 与 Kimi K3 的攻防焦点情报中有一条值得细读的线索V4 Pro 的 API 服务原定于 9 月 14 日下线而 V4.1 Flash 已于 9 月提前发布并宣称全面超越 V4 Pro。这意味着V4 Pro 实际上正在进入退场倒计时而它留下的空档正是 Grok 4.6 与 Kimi K3 争夺的增量市场。攻防焦点集中在两个方向第一智能体长链路执行能力。从 Preview 到 0813 正式版最大的跃迁不在通用对话而在工具调用与多步执行。这一点在仓库代码里能找到直接的架构证据。inference/model.py中V4 的主干采用 Hyper-Connectionshc_mult 4的隐藏状态多副本混合见 inference/model.py 中Block类的hc_pre/hc_post61 层中前 3 层为哈希路由n_hash_layers: 3、其余层为sqrtsoftplus打分 top-6 专家路由n_routed_experts: 384、num_experts_per_tok: 6见 config.json。推理时叠加 DSpark 投机解码模块3 个 MTP 阶段dspark_target_layer_ids: [58, 59, 60]、Markov 头 置信度头负责草稿采样与验收DSparkMarkovHead、DSparkConfidenceHead见 inference/model.py。这一整套稀疏 MoE 投机解码的协同正是 0813 能在 DeepSWE、Cybergym 上把 Preview 甩开 34 倍的底层原因也是它与 Grok 4.6、Kimi K3 掰手腕的底气。第二工具调用的工程完备度。三方都把工具用得稳当作决胜点。V4 的做法是把工具调用协议直接做进 tokenizer 层encoding/encoding_dsv4.py用DSML标记定义了一套 XML 风格的工具调用块支持stringtrue|false区分字符串与 JSON 参数工具结果以tool_result块合并进 user 消息merge_tool_messages并按前一轮 tool_calls 的顺序重排sort_tool_results_by_call_order见 encoding/encoding_dsv4.py。同时reasoning_effort支持low/high/max三档max档在提示词头部注入Beyond maximum前缀强制深度思考见 encoding/README.md——这与 HLE 带工具 60.0 的成绩直接相关。反观 Grok 4.6 与 Kimi K3前者靠 X 生态的实时数据闭环后者靠 K2 以来积累的代码 Agent 口碑三方在工具协议标准化上的路线并不相同但争夺的都是同一种东西开发者把 Agent 从 Demo 推向生产的信任度。从肉搏看国产模型厂商的竞争策略把镜头拉远肉搏的本质是基准分数趋同之后竞争维度开始向工程、生态与成本迁移。DeepSeek 在这轮里给出了清晰的策略组合其一性价比依旧是护城河。社区共识头条情报、CSDN 多篇实测反复出现同一句话V4 Pro 的综合得分落后 Kimi K3、接近 Grok 4.6但护城河仍是性价比。1.6 万亿参数、每 token 只激活 6 个专家的稀疏 MoE见 config.json配合权重 FP8 量化 专家层 FP4 量化expert_dtype: fp4inference/convert.py中cast_e2m1fn_to_e4m3fn提供 FP4→FP8 无损转换路径把推理成本压到海外同级的数分之一。这正是分数略低、账单价更低的组合拳。其二开源 MIT 许可做生态杠杆。仓库以 MIT 许可发布权重与代码见 LICENSE并附上完整自包含实现encoding/目录提供不依赖框架的 prompt 编解码参考实现与 4 组回归测试encoding/test_encoding_dsv4.pyinference/目录提供权重转换inference/convert.py与本地交互推理inference/generate.pyvLLM/SGLang 各一行参数即可启用 DSpark 投机解码见 README.md。对第三方平台而言这意味着接入成本 ≈ 复制一段配置阿里云百炼、硅基流动、各类 Claude Code 网关的快速跟进即是明证。其三与时间赛跑的迭代节奏。V4 Pro 从 Preview 到 0813 不过数月DeepSWE 从 12.8 飙到 62.7紧接着 V4.1 Flash 发布、V4 Pro 服务官宣退场——用自我替换而非等对手犯错来维持身位。这种节奏的代价也写在了社区反馈里纯文本无多模态、500 并发上限、旧模型名 7 月 24 日退役带来的迁移成本、API 网关对模型标识符的强校验deepseek-v4-pro是唯一合法注册名拼错即 400。当分数差距收窄到小数点后一位掉队与否已不由单一榜单决定而由谁能最快把模型能力沉淀进生产管线决定——这或许才是这场肉搏战真正的淘汰赛规则。【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表