
GLM5.2-KV-Offloading-FusedSfaOverlap快速开始从镜像加载到2P1D推理服务一键部署的完整新手教程【免费下载链接】GLM5.2-KV-Offloading-FusedSfaOverlap项目地址: https://ai.gitcode.com/Ascend-SACT/GLM5.2-KV-Offloading-FusedSfaOverlap本仓库GLM5.2-KV-Offloading-FusedSfaOverlap是一个面向华为昇腾 NPU 的 GLM-5.2 大模型推理部署方案核心能力是KV Cache 卸载KV Offloading、Fused SFA/PoolingSFA 融合算子优化与Prefill-Decode 分离式2P1D推理服务部署。仓库内置了完整部署镜像、部署脚本、负载均衡 proxy 与多份优化补丁新手只需按本文顺序执行命令即可把 2 个 Prefill 节点 1 组 Decode 节点的 GLM-5.2 长上下文推理服务跑起来。一、先搞懂这个方案在解决什么问题在部署 GLM-5.2 这类超长上下文模型时有两个典型痛点显存HBM不够放 KV Cache1M 级别的上下文会让 KV Cache 膨胀到数百 GB必须卸载到主机内存DRAM甚至远端存储即 KV Offloading。Prefill 与 Decode 争抢资源长提示词的第一阶段计算Prefill是算力密集型逐 token 生成Decode是访存密集型混跑会互相拖累。本方案的解法一览组件作用对应资料部署镜像glm52_offload_poolingsfa_v0827.tar预装 vLLM、vllm-ascend、memfabric、memcache 与 2p1d 部署脚本glm52_offload_poolingsfa_v0827.tarMemFabric / MemCache跨节点 KV 数据高速传输与远端 KV 存储refer.mdKV Offload 框架优化补丁Fused SFA、LRU 线程解约束、MTP 同步优化等fsa_framework_optimizations_default_on.patch2P1D 部署脚本2 台 Prefilldp1tp16 2 台 Decodedp8tp4拉起README.md 2P1D 表示P0、P1 两个 Prefill 节点各跑 1 个 TP16 的实例D0、D1 两个 Decode 节点合计构成 1 个 DP8、TP4 的解码集群中间通过负载均衡 proxy 串联。二、三步加载部署镜像最快路径这是推荐的一键部署路径全程只需三条命令。第 1 步克隆本仓库获取镜像与脚本git clone https://gitcode.com/Ascend-SACT/GLM5.2-KV-Offloading-FusedSfaOverlap第 2 步加载镜像到本地 Dockerdocker load -i /path_to/glm52_offload_poolingsfa_v0827.tar⚠️ 新手避坑该镜像文件体积较大仓库启用了 Git LFS 管理。如果克隆下来的.tar只有几百字节请执行git lfs install git lfs pull重新拉取真实文件。第 3 步基于镜像创建容器镜像中已集成部署脚本、配置文件和 proxy归档路径位于容器内/vllm-workspace/2p1d可以直接参考修改。如果你追求极限性能还可在容器内回退/更新 memfabric 到指定提交详见 README.md 第 1 节cd /vllm-workspace/memfabric-hybrid_kvoffload git reset --hard badae06512cb4f676988aee8465990dae8806082 bash script/build_and_pack_run.sh三、镜像不可用时现场构建安装环境可选若现场无法直接使用镜像可按依赖顺序手动安装完整命令见 README.md 第 2 节顺序不能乱vLLM 0.25.1直接取对应版本镜像或源码编译安装vllm-ascend源码安装pip install --no-build-isolation -e .memfabric克隆后执行script/build_and_pack_run.sh编译安装memcache注意初始化3rdparty子模块后再编译Decode 节点额外安装clang与libomp-dev四、配置要点两份 MemCache 配置文件若使用镜像配置文件已随容器提供/vllm-workspace/2p1d/mmc新手重点关注下面几个参数即可配置项含义建议值mmc-meta.conf中的meta_service_urlMeta 服务地址tcp://127.0.0.1:5000mmc-local.conf中的protocol数据传输协议device_sdma跨 NPU 高效 DMAdram.size用于 KV Offload 的主机内存大小按机器内存设置如10GBworld_size支持的最大 rank 数需 ≥ 实际节点数修改后需重启 meta然后在 Prefill 节点上用脚本拉起 memcache service本质是一个 Python 后台进程详见 README.md 第 3 节。五、2P1D 部署四个节点各干什么部署拓扑与关键参数如下脚本中的 IP、网卡名需按实际环境替换节点角色并行配置启动端口KV 端口/RankP0Prefilldp1, tp16812120070 / rank0P1Prefilldp1, tp16812120071 / rank1D0Decodedp8, tp4735020050 / rank2D1Decodedp8, tp4rank 4 起735020050 / rank2每个节点执行两步准备脚本在节点上放置launch_online_dp.py多进程启动器与run_dp_template.sh真正的vllm serve命令模板完整内容可直接从 README.md 第 2 节复制其中已包含 MTP 投机解码、--quantization ascend、KV transfer connector 等全部关键参数。启动推理服务以 P0 为例python launch_online_dp.py \ --dp-size 1 --tp-size 16 --dp-size-local 1 \ --dp-rank-start 0 --dp-address $node_p0_ip \ --dp-rpc-port 16600 --vllm-start-port 8121 \ glm_52.log 21 D0/D1 节点改为--dp-size 8 --tp-size 4 --dp-size-local 4D1 的--dp-rank-start为 4--dp-address指向 D0 节点 IP。 Decode 节点的关键差异在ADDITIONAL_CONFIG中开启了kv_offload_decode_config: {enabled: true, use_fused_overlap: true, ...}这正是本项目 Fused SFA 与 KV Offloading 优化的开关所在。六、拉起负载均衡 Proxy聚合为统一入口四个推理实例就绪后用仓库内置的 proxy 示例程序做请求转发源码位于 vllm-ascend 的examples/disaggregated_prefill_v1/目录完整代码见 README.md 第 4 节python load_balance_proxy_server_example.py \ --port 8000 --host 0.0.0.0 \ --prefiller-hosts $node_p0_ip $node_p1_ip \ --prefiller-ports 9081 9081 \ --decoder-hosts $node_d0_ip $node_d0_ip $node_d0_ip $node_d0_ip \ $node_d1_ip $node_d1_ip $node_d1_ip $node_d1_ip \ --decoder-ports 9900 9901 9902 9903 9900 9901 9902 9903 \ proxy.log 21 proxy 支持 OpenAI 兼容的/v1/completions与/v1/chat/completions接口并自带/healthcheck健康检查。七、一条 curl 验证服务已就绪export ADDRESShttp://proxy_ip:8000 curl -s $ADDRESS/v1/completions -H Content-Type: application/json -d { model: glm, prompt: 世界最高峰是珠, max_tokens: 10, min_tokens: 10, temperature: 0 }收到续写返回如穆朗玛峰即代表 2P1D 全链路proxy → Prefill → MemFabric 传输 → Decode全部打通 ✅八、进阶性能与精度测试性能压测安装 AISBench 后可运行 16K/64K/128K/256K/512K/1M 输入 × 1K 输出、不同并发的前缀缓存压测用例脚本模板见 README.md 第 6 节精度验证配置vllm_api_general_chat模型条目后运行 C-Eval、GSM8K、AIME 等数据集评估命令见 README.md 第 7 节绑核优化性能敏感场景建议对宿主机与容器内推理进程执行绑核cpu_bind_all.py -a/-t九、仓库文件速查表文件说明README.md主部署文档镜像、安装、配置、2P1D 脚本、proxy、验证与测试glm52_offload_poolingsfa_v0827.tar部署镜像包Git LFS 管理connectorv1_memfabric-READE.mdMooncakeConnectorV1 MemFabric P PushD2RH链路说明与 P/D 配置参考connectorv1_memfabric-d2rh.patchMemFabric 直推数据面补丁fsa_framework_optimizations_default_on.patchFSA 框架优化默认开启补丁含 offload 管理器与图编译优化fsa-internal-planner-original-baseline.patch内部 Planner 原始基线补丁sfa_kv_offload_mtp_validation_debug_only.patchSFA KV Offload MTP 校验调试补丁prefill_dcp-connector_memfabric_rd2h-decode_offload.md方案总览Prefill DCP MemFabric Decode Offload 组合链路refer.md0.26 基线 1P1D 部署指导与 memcache/memfabric 版本参考按以上步骤你只需要一台能加载镜像的机器和 4 台 NPU 节点就能完整体验 GLM-5.2 的 KV Offloading 与 2P1D 分离式推理部署。祝部署顺利【免费下载链接】GLM5.2-KV-Offloading-FusedSfaOverlap项目地址: https://ai.gitcode.com/Ascend-SACT/GLM5.2-KV-Offloading-FusedSfaOverlap创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考