)
Prefill一次性处理 prompt构建 KV Cache计算密集对应 TTFTDecode循环逐 token 生成访存密集对应 TPOT。模型量化模型量化是用更低比特数值表示权重、激活值或 KV Cache通常不改变网络结构和参数数量从而降低模型存储、显存和内存带宽占用部分硬件上还能提升推理速度。W4A8 表示权重 4 bit、激活值 8 bitW8A8 表示权重和激活值均为 8 bitINT4/INT8 表示数值位宽具体作用对象需结合上下文判断。稀疏与 MoE动态稀疏模型和 MoE 属于模型架构一般需要在基座模型基础上训练得到。动态稀疏推理时部分权重连接不参与计算MoE 推理时仅激活部分专家子网进行计算。二者目标一致在拥有大参数量模型能力的前提下降低推理阶段的计算量。静态稀疏模型则是稠密模型训练完成后通过剪枝剔除无效权重得到。SFTSFT监督微调是在预训练模型基础上使用带有目标输出的问答、指令或领域标注数据进行训练使模型更好地遵循指令、完成特定任务或适应专业领域。它可以采用全参数或参数高效微调但不能仅凭 SFT 保证模型成为真正的领域专家。1、vllm推理vLLM 的推理分为 Prefill 和 Decode 两个阶段。Prefill 会并行处理整个 Prompt完成 Transformer 前向计算并为每层生成 KV Cache。最后根据 Prompt 最后一个位置的 logits 采样出第一个输出 token。这个阶段包含大量 GEMM计算密度较高所以通常是 compute-bound主要看 GPU 的 Tensor Core 算力。对于超长上下文Attention 的二次复杂度也会成为瓶颈。Decode 从第一个输出 token 开始自回归生成。每一轮输入最新 token复用历史 KV Cache再生成下一个 token。由于每轮只处理少量 token却需要读取大量模型权重和不断增长的 KV Cache所以通常是 memory-bound主要受 HBM 显存带宽限制。TTFT 指请求到达后客户端收到第一个输出 token 的时间大致可以拆成TTFT 预处理 排队调度 Prefill 首次采样 传输优化 TTFT我会先通过监控确认时间花在排队、Prefill 还是返回链路然后分别处理。第一减少输入 token例如压缩历史对话和 RAG 文档多模态模型还可以减少图片数量、分辨率和视频帧数。第二对重复的 system prompt、工具定义或公共文档启用 Prefix Caching复用已有 KV Cache。它要求前缀 token 完全一致而且首次请求没有收益。第三高并发时降低排队和阶段间干扰。可以调整并发量、max_num_batched_tokens和max_num_seqs使用 Chunked Prefill或者做 Prefill/Decode 分离。Chunked Prefill 能缓解长 Prompt 的队头阻塞但分块过小可能增加单请求 TTFT。第四提高 Prefill 本身的执行效率例如使用更小或低精度模型、高效 Attention kernel、更强硬件以及合理的 Tensor Parallel。并行度过高也会引入通信开销需要实测。2、xprofiler工具昆仑芯推出的性能采集工具用于采集应用运行期间的 XPU 执行轨迹导出的 Trace 文件通过 Perfetto 进行可视化和 SQL 分析以定位性能瓶颈它的核心作用是回答推理任务的时间到底消耗在了哪里例如XPU 计算 Kernel 执行 Cluster/SDNN 运算 数据搬运和 DMA Stream 等待 多卡同步 Kernel 下发间隔 设备负载不均 显存带宽使用典型使用流程是启动 XProfiler → 运行推理程序或发送推理请求 → XProfiler 记录 CPU/XPU 活动 → 导出 Trace JSON → 使用 Perfetto 查看时间线 → 统计和定位性能瓶颈最常用的 time 模式命令是/usr/local/xpu/profiler/xprofiler \ --xpuall \ --time60 \ --resolution-interval500 \ --export-profile/实际路径/trace.jsonXProfiler 有三种运行模式fork由 XProfiler 启动一次性程序记录程序从启动到退出的全过程。time记录已经运行的服务在指定时间窗口内的活动适合 SGLang 这类常驻推理服务。deamon由业务代码调用 profiler start/stop只记录指定代码片段。