
80B 总参、3B 激活、262K 上下文一张参数表看懂 Yandex 的野心【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base2025 年下半年以来开源基座模型的参数表变得越来越耐人寻味当大家都在比拼总参数量时Yandex 发布的 AliceAI-Foundation-80B-A3B-Base 却在同一个 repo 里塞进了三个看似矛盾的数字——总参数 80B、单 token 仅激活 3B、上下文窗口 262144 token。总参数量几乎是 Qwen3.5-35B 的两倍多激活参数却同样是 3B上下文长度是主流 128K 的两倍推理开销却按 3B 激活量来算。这三个数字不是营销话术它们全部落在仓库的 config.json 和 modeling_alice_ai.py 里可以被逐字段、逐行代码验证。本文就从这张参数表出发拆解 Yandex 到底在打什么算盘。一张参数表藏着全部答案打开 config.json三个核心数字对应的字段一目了然数字config.json 字段取值80B 总参num_experts/num_hidden_layers/hidden_size组合512 专家 × 48 层3B 激活num_experts_per_tok10 路由专家 1 共享专家262K 上下文max_position_embeddings262144但真正的架构细节藏在更深的字段里layer_types48 层按linear_attention × 3 → full_attention × 1的模式重复 12 组即 36 层 KDA 线性注意力 12 层 Gated Attention 全注意力router_score_function: sigmoid与router_bias_correction: true路由打分方式与免辅助损失的负载均衡机制mtp_num_hidden_layers: 1内置 1 层多 Token 预测MTP模块供投机解码使用vocab_size: 129024、hidden_size: 2048词表与隐藏维度与 tokenizer.model 的 SentencePiece BPE 词表对应rope_theta: 1000000.0、partial_rotary_factor: 0.25RoPE 基频与部分旋转策略是长上下文能力的超参数支撑。80B总参数量与 162.6GB 的现实重量先看总参数字背后的物理现实。model.safetensors.index.json 的 metadata 中记录了total_size: 162572866816约 162.6GBBF16 下约合 81.3B 参数被切分为 49 个 safetensors 分片。这意味着想加载完整权重至少需要两张 80GB 的 GPU 做权重分片或者借助 README.md 中给出的 FSDP2 多卡方案。为什么 Yandex 愿意背上这么大的权重体量README 给出了两个关键信息模型完全从零训练且关键设计决策经过了一系列每次 2 万亿 token 的独立验证性训练。也就是说80B 不是凑出来的总参而是知识容量的设计目标——词表 12.9 万、48 层、2048 隐藏维度配合 512 个专家共同撑起一个俄语事实知识容量远超同激活量级模型的基座。这一点在基准上看得非常清楚WikiWebFacts 86.5、HardMultiQA 67.9、CultCat 86.5全部显著领先同级别开源模型详见后文对比。3B稀疏激活的工程密码80B 总参 ≠ 80B 的计算量。3B 激活量由 MoE 稀疏路由实现而它的实现细节是全文最值得读源码的部分。在 modeling_alice_ai.py 的AliceAISigmoidTopKRouter第 530 行起中路由机制是Sigmoid 独立打分对 512 个专家分别计算router_logits.sigmoid()每个专家获得 0~1 的独立分数而非 Softmax 的竞争归一化偏差校正向量当router_bias_correction为 true 时路由会叠加一个可学习的e_score_correction_bias注册为 buffer用它动态调节专家选择频率、实现负载均衡——全程不引入辅助 lossTop-10 选择selection_scores.topk(10, dim-1)选出分数最高的 10 个专家权重归一化最终专家权重按选中分数之和归一化且 1 个共享专家shared_expert始终参与计算并通过 sigmoid 门控shared_expert_gate决定其贡献。AliceAIExperts第 488 行的每个专家中间维度仅 512专家数量多、单专家小10 路由 1 共享专家在 48 层上的总激活量正好落在 3B 量级。这也是为什么 finetune/finetune_lora.py 在 FSDP2 微调时要专门处理e_score_correction_bias它被暂时从模块中移除remove_router_buffers、只由 rank 0 持有避免其在分布式 checkpoint 加载时被错误初始化微调恢复后再广播回所有进程——这是把免辅助损失路由真正落到工程实践的细节。262K混合注意力的取舍262144 token 的上下文窗口靠的是 36:12 的 KDA/全注意力混合架构而不是简单地把全注意力层堆高。config.json 的layer_types定义了每 4 层一组的节奏modeling_alice_ai.py 中AliceAIDecoderLayer据此在两种注意力之间切换KDA 线性注意力AliceAIKDA第 275 行起36 层中的主力。其核心是带因果卷积的状态空间递推——q/k/v 各自经过 kernel size 为 4 的因果卷积linear_conv_kernel_dim: 4number_of_conv_states: 3再以门控衰减 delta 状态更新的方式维护循环状态。源码_torch_kda中state state * gate.exp()与delta (value - prediction) * beta.sigmoid()两行就是整个线性注意力递推的缩影每步只做常数时间的状态更新KV 缓存不随序列长度线性膨胀Gated Attention 全注意力AliceAIAttention第 151 行起每 4 层出现 1 次16 个 query 头、仅 2 个 KV 头num_key_value_heads: 2、head_dim 256配合 zero-centered RMSNorm 的 q/k 归一化与 sigmoid 输出门控负责在关键位置提供精确的全局信息检索块级残差block_attn_res_block_size: 4让残差流按 4 层分块混合_depth_softmax_mix把线性层遗忘与全注意力层精确记忆按块组织。这套组合在长上下文基准上给出了可验证的结果FinQA 128k 74.1、LongMemEval 128k 64.6数据取自 README.md 官方评测。线性注意力保证成本可控12 层全注意力保证 128K 场景下依然有全局检索能力——这是262K能写进参数表、而不是停留在宣传页的技术底气。三个数字组合起来瞄准的是什么场景把 80B / 3B / 262K 放在一起Yandex 的目标场景其实非常清晰其一俄语事实知识的护城河。官方明确表示模型在俄语事实知识任务上尤其强并随权重发布了 WikiWebFacts、HardMultiQA 两个俄语事实基准及评测协议。EGE CoT俄高考90.5、EduBench Russian 74.2、EduBench History 82.0 的成绩说明这不是泛泛的多语言支持而是针对俄语生态包括 Yandex 助手 Alisa 的真实用户查询做了定向优化。其二复杂推理与代码。数学/推理基准全线领先AIME 2026 pass32 96.7、HMMT 2026 Feb pass32 96.9、IMO Answerbench pass8 88.7、MATH-500 91.1、LiveCodeBench v5-6 pass1 60.4。考虑到 3B 激活量这些成绩的性价比相当惊人。其三低成本规模化推理。3B 激活意味着单 token 前向的计算量只和 3B 稠密模型相当而 config.json 里的mtp_num_hidden_layers: 1进一步压低了推理成本MTP 头权重已直接融合进 checkpoint模型加载时通过_keys_to_ignore_on_load_unexpected: [r^mtp\.]忽略其意外加载vLLM 只需在 README.md 的启动命令中加一行--speculative-config {method:mtp,num_speculative_tokens:1}即可让一次前向生成 2 个 token无需任何额外草稿模型。社区实测报告显示加速比约 1.2–1.8×且不损失精度。与当下主流基座参数选择的对比把 AliceAI 放到 2025 年主流开源基座的参数表里差异立刻显现官方评测中列出的对比对象及全部数据见 README.md模型总参/激活上下文激活占比AliceAI-Foundation-80B-A3B-Base80B / 3B262K3.8%Qwen3.5-35B-A3B-Base35B / 3B—8.6%GLM-4.5-Air-Base106B / 12B—11.3%Nemotron-3-Super-120B-A12B-Base120B / 12B—10.0%DeepSeek-V4-Flash-Base284B / 13B—4.6%Yandex 的选择在业界谱系中相当极端总参/激活比接近 27:1比以稀疏著称的 DeepSeek-V4-Flash约 22:1还要激进。效果上它用 3B 激活在多个推理基准上压过了 12B 激活的 Nemotron 与 GLMHMMT 96.9 vs 66.7/87.9、IMO Answerbench 88.7 vs 64.5、LiveCodeBench pass1 60.4 vs 34.7AIME 2026 则以 96.7 与 Qwen3.5 并列第一。而俄语事实类基准WikiWebFacts 86.5 vs 62.4/70.2、CultCat 86.5 vs 59.2/59.1更是拉开了 15 个百分点以上的代差。当然这不是没有代价超低激活占比对路由质量、专家利用率和长上下文记忆提出了更高要求而 80B 总参也让部署门槛162.6GB 权重高于 35B 级别的竞品。Yandex 的取舍逻辑也因此一目了然——用总参数换知识容量与长上下文上限用 3B 激活换推理经济学用 262K 窗口换工程上的不可替代性。在俄语生态里这是一条几乎无法被通用模型平替的路线。回到开头的三个数字80B 决定它知道多少3B 决定它跑多快262K 决定它能一次吃进多少。三者咬合在一起构成了 Yandex 对下一代基座模型的完整回答——不是把某一项做到极致而是用一张参数表同时锁死容量、成本与上下文三个维度这也是它在开源生态里最值得研究的野心所在。【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考