
开源推理一周年R1 与 o1 的差距现在还剩多少【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R12025 年 1 月 20 日DeepSeek 开源 DeepSeek-R1 系列并以性能对标 OpenAI o1的姿态进入推理模型战场。彼时o1 是封闭生态里的标杆R1 则以 MIT 协议把 671B 参数的完整推理模型和全套蒸馏小模型一起交到了开发者手中——从发布当周开始本地跑一个能思考的大模型就不再是少数人的特权。一年过去o1 系列已迭代多轮DeepSeek 也经历了官方小版本升级与新模型传闻双方在同一张考卷上的分数差距到底还剩多少本文以仓库源码与实测数据为底逐项拆解这份年度答卷。发布时的对标口径并非追赶而是各有输赢在仓库 README.md 的引言中官方对 R1 的定位写得非常克制DeepSeek-R1 achieves performance comparable to OpenAI-o1 across math, code, and reasoning tasks。注意措辞是 comparable相当不是 surpassed。这种克制恰恰是可信的——因为对照表里双方是互有胜负而非一边倒。以 README.md 第 4 节评估表为基准R1 与 OpenAI o1-1217即发布时的 o1 正式版的关键数据对比如下基准o1-1217DeepSeek R1胜负AIME 2024 (Pass1)79.279.8R1 胜MATH-500 (Pass1)96.497.3R1 胜LiveCodeBench (Pass1-COT)63.465.9R1 胜SWE Verified (Resolved)48.949.2R1 微胜ArenaHard (GPT-4-1106)92.092.3R1 微胜Codeforces (Percentile)96.696.3o1 微胜GPQA-Diamond (Pass1)75.771.5o1 胜SimpleQA (Correct)47.030.1o1 明显胜这张图景非常有意思在数学AIME、MATH-500和代码LiveCodeBench、SWE Verified这两条推理硬指标上R1 反而略压 o1 一头差距主要体现在 GPQA-Diamond博士级科学问答和 SimpleQA事实性短答上。也就是说R1 在用推理解决结构化难题的能力上已经打平甚至反超真正的短板在于知识密度与事实记忆——这更像预训练阶段数据与规模的差距而非推理范式本身的差距。官方在 figures/benchmark.jpg 中给出的全景对比图直观呈现了这种数学代码领先、事实问答落后的剪刀差格局。671B 的架构底牌R1 不是o1 的开源复刻对标口径只是结果更关键的是 R1 走了一条与 o1 完全不同的技术路线。从仓库文件可以完整还原这条路线1. 它是 MoE 稀疏模型不是稠密模型。查看 config.jsonn_routed_experts: 256、num_experts_per_tok: 8、n_shared_experts: 1总参数 671B 而每 token 仅激活 37B。这意味着单次推理的成本接近 37B 稠密模型这是 R1 API 敢把价格打到行业地板的结构性原因。2. 路由机制是无辅助损失的专家选择。在 modeling_deepseek.py 的MoEGate实现中topk_method noaux_tcauxiliary-loss-free token choice用 sigmoid 打分加e_score_correction_bias偏置做分组路由topk_group: 4先选组再选专家绕开了经典 MoE 的负载均衡辅助损失——这是 DeepSeek-V3 时期就验证过的工程创新R1 直接继承。3. 注意力是 MLA 低秩压缩而非标准 MHA。在 modeling_deepseek.py 的DeepseekV3Attention中KV 通过kv_a_proj_with_mqa压到kv_lora_rank: 512再展开配合q_lora_rank: 1536的查询低秩投影。KV 缓存大幅缩减长上下文推理的显存压力被结构性缓解。4. 长上下文靠 YaRN 扩展。config.json 中rope_scaling.type: yarn、factor: 40把original_max_position_embeddings: 4096扩展到max_position_embeddings: 163840这也是 README 标称 128K 上下文的实现基础。5. 权重直接以 FP8 分发。quantization_config指明quant_method: fp8、fmt: e4m3仓库内 163 个 safetensors 分片即 FP8 存储配合 generation_config.json 中temperature: 0.6、top_p: 0.95的默认采样配置使用。但真正让 R1 区别于开源 o1的是后训练管线R1-Zero 证明了纯 RL、零 SFT就能涌现出自我验证、反思和长思维链R1 则在此之上加入冷启动数据与两轮 RL/SFT 交替解决可读性差、语言混杂等问题。这条RL 驱动的推理涌现路径是 o1 从未公开过的部分也正是 R1 一年来被复刻、被蒸馏、被写进无数论文的根源。一年后的版本对比o1 换了赛道R1 完成了补课发布之后的一年里双方都在迭代但节奏和方向完全不同o1 一侧OpenAI 先发布了 o1-pro随后 o3 系列o3、o3-mini登场并最终将推理能力并入 GPT-5 体系。o1-1217 这个当年的对照锚点如今已是被官方弃用的旧档位——封闭生态的优势在于可以不停换卷子。R1 一侧按社区多方报道官方对 R1 完成了小版本试升级编程与逻辑理解能力上了一层官方口径称多项表现已接近国际顶尖模型而在 R1 发布一周年之际DeepSeek 新模型社区流传代号MODEL1的信息开始曝光外界普遍将其解读为继任者临近的信号。同期流传的还有 DeepSeek 适配昇腾芯片、推进去英伟达化部署的消息——R1 的技术红利正在向国产算力栈外溢。一个容易被忽略的事实是o1 的迭代是黑盒换版本而 R1 的迭代是被整个开源社区共同拉动的。一年间围绕 R1 出现了 20 个衍生版本满血版、蒸馏版、量化版齐备、覆盖 Ollama/vLLM/SGLang/RAGFlow 的成套部署方案甚至出现了在 RK3588 嵌入式主板这类边缘设备上移植 R1 的实践。o1 无法被本地部署、无法被微调、无法被蒸馏而 R1 的每一个 checkpoint 都可以被任何人拿去改造——这种版本演进的维度是封闭模型永远不具备的。开源推理的天花板不是模型是方法论回看仓库中蒸馏模型的评测表README.md 第 4 节有一组数据比满血版更有冲击力DeepSeek-R1-Distill-Qwen-1.5BAIME 2024 pass1 达 28.9是 GPT-4o9.3的三倍多DeepSeek-R1-Distill-Qwen-7BAIME 2024 pass1 达 55.5超过 Claude-3.5-Sonnet16.0与 QwQ-32B-Preview44.0DeepSeek-R1-Distill-Qwen-32BAIME 2024 pass1 达 72.6、Codeforces rating 1691全面超过 o1-mini63.6 / 1820当时刷新了稠密模型的最优成绩。一个 1.5B 的模型能拿到 28.9 分的 AIME 2024这在一年前是不可想象的。它证明了 R1 方法论中最锋利的一环推理能力可以像蒸馏酒一样浓缩——用大模型的 CoT 数据微调小模型效果优于在小模型上直接跑 RLREADME 原文distilled smaller models perform better than the reasoning patterns discovered through RL on small models。这直接改写了开源社区的小模型路线图此后 Qwen3、Llama 后续版本纷纷把长思维链与推理微调作为默认能力R1 蒸馏出的 80 万条 CoT 样本成了全行业共享的推理训练语料。那么开源推理的天花板在哪一年前的答案是能不能追上 o1今天的答案已经变成推理能力是否还配得上被称作壁垒。当 1.5B 的模型都能解竞赛数学、当 32B 的蒸馏模型能压过 o1-mini、当完整的 671B 推理模型以 MIT 协议自由分发LICENSE推理本身已经从稀缺能力变成了默认能力。真正的天花板从来不在开源一侧的分数上——而在于下一轮迭代中谁能把 RL 与冷启动数据的配方做出下一个量级的突破。R1 已经证明这条路走得通接下来只看MODEL1们还能把它推多远。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考