多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

一夜之间,俄罗斯科技巨头下场:Yandex 为什么偏偏在现在开源 80B 基座

一夜之间,俄罗斯科技巨头下场:Yandex 为什么偏偏在现在开源 80B 基座 一夜之间俄罗斯科技巨头下场Yandex 为什么偏偏在现在开源 80B 基座【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base当开源大模型的天平被 DeepSeek 式低激活成本 深度推理叙事反复拨动时绝大多数玩家还在围绕中文与英文市场贴身肉搏。而这一夜出手的是 Yandex——俄罗斯最大的互联网公司带着一个 80B 总参数、单 Token 仅激活 3B 的混合架构基座模型 AliceAI-Foundation-80B-A3B-Base连同权重、源码与一套俄语事实评测基准一起砸进了开源社区。这不是一次简单的开源表态。从仓库里 49 个 safetensors 分片到 modeling_alice_ai.py 中逐行可读的 KDA 线性注意力与 Sigmoid TopK 路由实现从 262,144 token 的长上下文到预训练阶段就埋入的 MTP 投机解码头这家公司把过去两年押注在推理效率上的全部技术赌注一次性摊开。本文基于仓库源码与公开情报拆解三件事Yandex 为什么选在这个时间点出手这个 80B-A3B 架构到底在打谁以及在多语言与通用基座的定位下它卡住了哪块市场。不是刷存在感一次有备而来的生态卡位先看这次开源动作的弹药量。模型从零训练trained entirely from scratch训练语料是重新构建的架构与超参数经过了系统性选择关键设计决策用多轮各 2 万亿 token 的独立训练逐一验证——这意味着发布方对什么能涨、什么不涨是有明确认知的而不是把某个 checkpoint 随手丢出来。仓库同时发布了两套面向俄语语境的评测基准 WikiWebFacts 与 HardMultiQA并附评估协议。这里有一个容易被忽略的信号随权重开源评测基准是把俄语事实知识从一个模糊的营销词变成可复现工程指标的动作。在开源生态里语言能力的口碑从来不是靠发布会而是靠 benchmark 表。Yandex 选择把俄语能力的度量权交出来恰恰是为了让社区替它完成后续的信任建设——这是标准的生态卡位打法。至于为什么是现在时间点上的三重共振值得注意其一稀疏 MoE 极小激活参数 MTP 多 Token 预测的组合已被 DeepSeek 系列验证为高能力与低推理成本兼得的主流路线市场心智已经成熟此时发布无需教育成本其二开源世界在俄语高质量模型上长期存在供给空白主流榜单几乎被中英文模型垄断俄语事实知识与考试类任务成了罕见的无人区其三基座模型 Apache-2.0 许可 附带微调工具链意味着它可以低成本地吸引全球社区为其做 SFT 与 RL把Alice 系生态做大——这在开源模型竞争已经进入生态战阶段的当下是典型的先手棋。80B-A3B架构一句话总结它想打谁用一个句子概括这个模型80B 总参数、每 Token 激活 3B 的稀疏混合基座用 48 层中 36 层线性注意力换 262K 长上下文用 512 专家 MoE 换能力上限用预训练内建的 MTP 头换推理速度。它的每一个设计都在回应同一个问题如何在单卡到四卡就能跑起来的成本区间里打出接近更大参数量模型的分数。KDA 线性注意力长上下文的成本解药在 config.json 的layer_types中可以看到清晰的节奏48 层里36 层是linear_attention只有 12 层是full_attention每 4 层插入 1 次全注意力即 README 描述的12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))。线性注意力层名为 KDAKeyDelta-Activation键增量激活。在 modeling_alice_ai.py 的AliceAIKDA._torch_kda实现中状态更新遵循 delta 规则模型维护一个随 token 递推的隐状态每步先用当前 key 对状态做预测再用真实 value 与预测之差乘以一个经 sigmoid 门控的beta系数去修正状态——delta (value_i - prediction) * beta随后state state einsum(key_i, delta)。这正是增量记忆 可学习遗忘的线性注意力范式把 O(n²) 的注意力矩阵换成 O(1) 的常数空间递推KV 缓存与计算量随序列长度不再爆炸。两个工程细节进一步支撑 262K 上下文K/Q/V 三路都先过因果卷积q_conv1d/k_conv1d/v_conv1dkernel4给线性注意力补上局部位置建模能力RoPE 只施加在partial_rotary_factor0.25的维度上rotary_dim int(head_dim * 0.25)避免全量旋转破坏线性注意力的递推结构。配合rope_theta1e6长距离相对位置信息得以保留。而每 4 层保留 1 次 Gated Attention 全注意力层16 query 头、2 KV 头、head_dim 256输出再乘 sigmoid 门控则负责精确检索式的全局信息提取弥补线性注意力在复杂指代与精读任务上的短板。全注意力层数被压到 12 层正是长上下文下显存预算的精准配比。Sigmoid TopK 偏差校正免辅助损失的工业级 MoEMoE 侧同样不循常规。512 个专家、TopK10 路由、外加 1 个共享专家num_experts: 512、num_experts_per_tok: 10、shared_expert_intermediate_size: 512支撑 80B 总量下约 3B 激活。关键在于路由打分函数Sigmoid 独立打分router_score_function: sigmoid路由实现中scores router_logits.sigmoid()。与 softmax 的此消彼长竞争式归一不同sigmoid 让每个专家独立判断自己是否合适TopK 选择更稳定、稀疏性更强可学习偏差校正router_bias_correction: true时注册e_score_correction_biasbuffertorch.zeros(num_experts)前向时把它加进选择分数scores bias再取 TopK但路由权重仍用原始 sigmoid 分数计算weights scores.gather(...)后归一。效果是不改打分分布、不加辅助损失只通过一个可学习的偏置向量动态调节哪些专家更容易被选中从而缓解负载失衡。这也是微调脚本 finetune/finetune_lora.py 里特意以ROUTER_BUFFER_NAME e_score_correction_bias为单位保存/恢复该 buffer 的原因——它不在 LoRA 适配器里微调时必须单独处理共享专家AliceAISparseMoEBlock中共享专家输出再乘一个独立 sigmoid 门控shared_expert_gate保证通用能力不依赖 TopK 命中率。MTP训练时已经为推理加速埋好伏笔仓库里_keys_to_ignore_on_load_unexpected [r^mtp\.]与mtp_num_hidden_layers: 1表明模型在预训练阶段就内建了 1 层 MTP多 Token 预测头权重随基座一起发布。这意味着在 vLLM 中可通过--speculative-config {method:mtp,num_speculative_tokens:1}直接启用投机解码一次前向生成 2 个 Token无需额外草稿模型实测加速约 1.2–1.8× 且无精度损失。在一个激活仅 3B 的模型上再叠加 MTP推理时延被压到了极致——这正是 DeepSeek 验证过的训练成本换推理成本路线的延续。基准数据说话它真正赢在哪里仓库 README 的评测表内部评测基础设施、vLLM 推理、t0给出了与同档位及更大模型的横向对比。最值得注意的不是总分而是赢在哪个象限维度AliceAI 80B-A3BQwen3.5-35B-A3BGLM-4.5-Air (106B-A12B)Nemotron-3-Super (120B-A12B)DeepSeek-V4-Flash (284B-A13B)WikiWebFacts俄语事实86.562.470.272.883.2HardMultiQA俄语事实67.947.248.654.565.4CultCat文化事实86.559.259.166.380.7EduBench Russian74.242.939.044.067.7ExpertFactsQA Law49.627.922.524.340.5MATH-50091.181.960.284.880.7EGE CoT俄高考90.584.777.884.390.3LiveCodeBench v5-6 CoT 1-shot50.550.422.650.438.1三点结论清晰可辨。第一俄语事实知识是碾压级的WikiWebFacts、HardMultiQA、CultCat 三项俄语事实基准全部第一其中 ExpertFactsQA Law 领先第二名 DeepSeek 近 9 分——在俄语事实、法律与教育场景这是当前开源模型里的第一梯队第二数学与推理不输大参数量对手MATH-500 91.1 分超过 DeepSeek-V4-Flash80.7与 Nemotron84.8AIME 2026 pass32 与 HMMT 2026 Feb pass32 也处于最高档说明 3B 激活的稀疏结构并未牺牲推理上限第三英文与代码不是它的主战场TriviaQA 79.0 落后于 GLM/Nemotron/DeepSeekMMLU-Pro CoT 66.8 低于 Nemotron 的 69.9——它没有试图在英文全能榜上正面硬刚而是把优势集中投向俄语 推理 长上下文的复合象限。多语言与通用基座定位下的市场卡位把以上事实拼起来Yandex 的卡位逻辑就非常清楚了。其一它打的不是最强而是俄语生态的事实标准。词表 129,024SentencePiece BPELlamaTokenizer 加载legacy: false保证空格处理符合预期词表中预置了[COT_ENABLE]/[COT_START]/[COT_END]与工具调用 token——这些不是 HF 特殊 token而是普通原子 token。结合 finetune/chat_template.jinja 中为 agent 训练准备的system/user/assistant/tool/meta五角色渲染与[TOOL_CALL_START]标记可见预训练语料本身就包含大量思维链与工具调用数据。也就是说这是一个生而为 Agent 化准备的基座谁想往俄语 Agent、搜索增强、企业知识库方向做 SFT它就是现成的地基。配合发布的俄语基准俄语社区完全可以围绕它建立一套可复现的评测与迭代闭环。其二成本结构决定了下游的采用门槛。3B 激活参数 262K 上下文 MTP 投机解码意味着在 4×80GB GPUREADME 的 LoRA 示例正是四卡 80GB FSDP2 配置甚至更低规格的硬件上就能完成推理与微调。这直接击中了俄语市场的现实企业对算力的获取成本高、对本地化部署需求强一个能在有限 GPU 上跑起来且俄语足够好的开源基座远比一个只能云端调用的超大模型有吸引力。其三它故意停在基座这一步。README 末尾明确声明这是 pre-training 阶段的模型未做 post-training/alignment定位是研究与二次开发不承诺开箱即用的产品化。表面看是免责实则是生态分工——把 SFT/RL/对齐的增值空间留给社区与下游厂商自己只占据俄语最强开源基座这一不可替代的位置。这与 DeepSeek 开源基座、让社区百花齐放的策略一脉相承而俄语市场的空白恰好给了它更高的议价权。结语回到标题的问题为什么偏偏是现在因为稀疏激活路线的心智已被验证因为俄语开源模型的供给空白正在被中英文模型挤压也因为训练成本换推理成本的军备竞赛让每一个后发玩家都必须在发布时就把推理效率写进架构里。Yandex 选择在这个时间点用一套从 KDA 线性注意力、Sigmoid 偏差校正路由到 MTP 投机解码的完整技术栈卡住了俄语 3B 激活 262K 上下文这个此前无人占据的生态位。从 config.json 里 50 多个超参数键到 modeling_alice_ai.py 中可直接审计的算子实现这个仓库最难得的地方在于它把高效稀疏模型到底怎么造的答案连同俄语能力到底怎么测的尺子一起交了出来。至于它能否复制 DeepSeek 在中文社区那样的生态效应接下来就要看俄语开发者社区和全球研究者的二次创作了——而这一次俄罗斯科技巨头已经下场。【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表