
满血、蒸馏、量化怎么选20 个 R1 版本的一次性对照表【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R12025 年 1 月 20 日DeepSeek 正式发布并开源第一代推理模型 DeepSeek-R1 与 R1-Zero随后官方又放出 6 个基于 Qwen2.5 与 Llama 系列的蒸馏版本社区在极短时间内又为每个小模型补上了 Q4_K_M、Q8_0 等量化变体满血版、蒸馏版、量化版三分法由此流传开来——20 个可下载版本摆在面前参数从 1.5B 一路排到 671B显存需求从 1GB 跨度到 1TB。它们到底差多少、怎么选本文结合仓库源码与官方评测数据把这张对照表一次讲清楚。一、20 个版本从哪里来R1 家族谱系先建立一张总览图。社区整理的20 版本口径通常指官方 8 款模型R1-Zero、R1 满血版 6 款蒸馏版 12 个主流量化变体6 款蒸馏模型各自的 Q4_K_M / Q8_0。2025 年 5 月 28 日官方又为 8B 与 671B 发布了 R1-0528 小版本升级家族还在继续扩张。官方 8 款满血与蒸馏仓库 README.md 中的模型下载表给出了官方模型全景模型总参数激活参数上下文长度定位DeepSeek-R1-Zero671B37B128K纯强化学习无 SFT探路实验DeepSeek-R1671B37B128K满血推理版对标 OpenAI-o1DeepSeek-R1-Distill-Qwen-1.5B1.5B1.5B128K密集蒸馏DeepSeek-R1-Distill-Qwen-7B7B7B128K密集蒸馏DeepSeek-R1-Distill-Llama-8B8B8B128K基于 Llama-3.1-8BDeepSeek-R1-Distill-Qwen-14B14B14B128K密集蒸馏DeepSeek-R1-Distill-Qwen-32B32B32B128K官方最强蒸馏版DeepSeek-R1-Distill-Llama-70B70B70B128K最大蒸馏版满血版 R1 / R1-Zero 基于 DeepSeek-V3-Base 训练是混合专家MoE架构总参数 671B但每个 token 只激活 37B 参数——这正是671B 的体量、37B 的算力消耗的来源。而 6 款蒸馏版全部是密集Dense模型用 R1 生成的 80 万条推理数据微调而来架构与 Qwen/Llama 原生一致生态兼容性最好。12 个量化变体把模型塞进消费级显存量化是社区二次加工的结果。以 Ollama 生态为例6 款蒸馏模型各提供 Q4_K_M 与 Q8_0 两个主流量化档位另附带 FP16 参考对应关系如下模型Q4_K_MQ8_0FP16 参考Distill-Qwen-1.5B1.1GB1.9GB3.6GBDistill-Qwen-7B4.7GB8.1GB15GBDistill-Llama-8B4.9GB8.5GB16GBDistill-Qwen-14B9.0GB16GB30GBDistill-Qwen-32B20GB35GB66GBDistill-Llama-70B43GB75GB141GB也就是说一颗 8GB 显存的消费级显卡就能跑 1.5B/7B 的 Q4 量化版24GB 显卡可以上 32B 的 Q4 版。至于满血 671B后期生态也给出了参考Q4_K_M 约 404GB、Q8_0 约 713GB、FP16 约 1.3TB——这不是单机单卡能承载的量级通常需要多卡集群配合张量并行。二、满血版凭什么满血源码里的三组关键数字架构参数MoE 的细粒度与共享专家仓库根目录的 config.json 直接给出了满血版的核心配置61 层 Transformerhidden_size7168128 个注意力头n_routed_experts256个路由专家 n_shared_experts1个共享专家每个 token 激活num_experts_per_tok8个专家kv_lora_rank512、q_lora_rank1536——多头潜在注意力MLA的低秩压缩设计显著压缩 KV 缓存num_nextn_predict_layers1多 token 预测MTP层为推理效率提供额外加速。其中256 专家 每 token 选 8 个是 DeepSeek-V3 系细粒度专家路线的标志性设计专家数量多、单个专家尺寸小路由更灵活激活参数占比37B/671B ≈ 5.5%远低于传统 MoE。门控路由分组限流 缩放因子路由不是简单粗暴的 top-8。在 modeling_deepseek.py 的MoEGate中可以读到完整的选路逻辑# 先按组打分每 token 限定在 8 组中选 topk_group4 组 group_scores scores_for_choice.view(bsz * seq_len, self.n_group, -1).topk(2, dim-1)[0].sum(dim-1) group_idx torch.topk(group_scores, kself.topk_group, dim-1, sortedFalse)[1] ... # 再在限定的组内取 top-8 专家 _, topk_idx torch.topk(tmp_scores, kself.top_k, dim-1, sortedFalse) ... # 归一化后乘上路由缩放因子 topk_weight topk_weight * self.routed_scaling_factor # config 中为 2.5配合scoring_funcsigmoid的评分函数与routed_scaling_factor2.5的缩放这套先分组限流、再组内选专家的机制保证了每个专家都能分到足够稠密的 token是 MoE 推理吞吐的关键工程细节。出厂即 FP8仓库权重本身就是量化版容易被忽略的一点是官方发布的全量权重并不是 FP16而是 FP8 量化格式。看本仓库model.safetensors.index.json 中quantization_config标注quant_method: fp8、fmt: e4m3、动态激活量化、weight_block_size: [128, 128]权重共拆成 163 个分片文件model-00001-of-000163.safetensors至model-00163-of-000163.safetensors每个约 5.2GB合计约 850GB索引元数据中与权重一一对应的weight_scale_inv条目多达 45808 个——这正是 FP8 块级反量化尺度scale每个 128×128 的权重组块都带一个独立缩放因子以缓解 FP8 低精度带来的精度损失。所以严格来说满血版与量化版之间并非泾渭分明官方满血版是 FP8 出厂量化 块级 scale 补偿社区 Q4_K_M 则是更激进的二次压缩文件体积从 850GB 进一步压到 404GB。三、蒸馏版性能与成本的甜蜜区在哪官方在 README.md 中公布了蒸馏模型的完整评测。用三个指标就能看出梯度模型AIME 2024 (pass1)MATH-500 (pass1)Codeforces RatingOpenAI o1-mini参考63.690.01820Distill-Qwen-1.5B28.983.9954Distill-Qwen-7B55.592.81189Distill-Llama-8B50.489.11205Distill-Qwen-14B69.793.91481Distill-Qwen-32B72.694.31691Distill-Llama-70B70.094.51633DeepSeek-R1 满血79.897.32029两个值得注意的现象第一蒸馏版甚至比小模型自己跑强化学习更强。官方论文明确表述大模型的推理模式蒸馏到小模型后效果优于在小模型上直接 RL 发现推理模式。所以蒸馏不是简单压缩而是把 671B 模型摸索出的 CoT 行为模式复制到 32B 甚至 1.5B 上。第二32B 是公认的性价比拐点。Distill-Qwen-32B 在 AIME 2024 上拿到 72.6超过 o1-mini 的 63.6逼近满血 R1 的 79.8而其 Q4 量化版仅约 20GB 文件、单张 24GB 显卡即可部署。README 也特别指出32B 是密集模型的新 SOTA。70B 蒸馏版则在 GPQA-Diamond65.2与 LiveCodeBench57.5上拿到蒸馏家族最高分适合对知识密度要求更高的场景。仓库 README.md 中的基准对比图直观呈现了这套能力分布部署蒸馏模型与跑普通 Qwen/Llama 完全一致。README 给出的一行命令即可拉起服务vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager也可以使用 SGLangpython3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2。四、使用配置满血与蒸馏的潜规则无论选哪个版本README.md 的 Usage Recommendations 都建议遵守以下配置否则推理效果会明显打折温度设在 0.5–0.7 之间官方推荐 0.6——仓库根目录的 generation_config.json 默认值正是temperature: 0.6、top_p: 0.95不要加 system prompt所有指令放进 user prompt数学题建议在 prompt 中要求逐步推理并把最终答案放入\boxed{}评测时应多次采样取平均。一个容易被忽略的坑R1 系列偶尔会跳过思考直接输出空的think/think导致性能下滑。官方给出的解法是强制模型以think\n开头确保每次输出都进入完整推理链。这个细节在满血版上影响尤其大值得写进任何部署脚本。五、按场景选型一张决策清单把性能、成本、硬件三个维度叠起来结论其实很清晰你的场景首选版本显存/存储参考理由云端 API、追求极致推理满血 R1DeepThink无需本地部署数学、代码、推理全面对标 o1私有化集群多卡 A100/H100R1 671B FP8 官方权重约 850GB 权重需多卡并行本仓库即 FP8 分片格式配合 vLLM 张量并行企业级单卡/双卡48–80GBDistill-Qwen-32BQ4 约 20GB / FP16 约 66GB官方评测中最接近满血的性价比之王单卡 24GB4090 级别Distill-Qwen-14BQ4 约 9GB / FP16 约 30GBAIME 69.7数学能力明显溢出 8B 档8–16GB 消费卡/笔记本Distill-Qwen-7B / Llama-8BQ4 约 4.7–4.9GB编程与通用对话完全可用边缘设备、低功耗推理Distill-Qwen-1.5BQ4 约 1.1GB社区已有 RK3588 等嵌入式移植案例以知识问答/文档理解为主Distill-Llama-70BQ4 约 43GB / FP16 约 141GBGPQA-Diamond 65.2蒸馏家族最强最后补两点提醒授权边界R1 系列采用 MIT 协议支持商用与任意衍生包括蒸馏再训练但 6 款蒸馏版继承了基底模型的授权——Qwen 系列为 Apache-2.0Llama 8B/70B 为 Llama 系协议商用前需要分别确认。版本会继续进化R1-0528 小版本升级后编程与逻辑理解能力又有提升8B换基座为 Qwen3-8B与 671B 都衍生出新版本。选型时优先看目标生态Ollama / vLLM / SGLang / 推理框架最新支持的 tag比纠结哪个版本最全更实际。一句话总结要极致效果用满血要单卡性价比用 32B要极限轻量用 1.5B–8B 量化版而20 个版本之间的差异本质是同一套推理能力在不同硬件预算下的重新定价。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考