
开头做技术选型的人这两年怕是都绕不开AI芯片这个话题。我也一样从关注GPU参数到研究ASIC的能效比再到盘点各家生态的成熟度这轮调研断断续续做了将近两个月。最直观的感受是AI芯片已经不是一个单纯的硬件概念了它是算力、带宽、互联、软件栈四位一体的综合体单看任何一项都会被带偏。这篇文章是我这次调研的完整记录覆盖芯片分类、核心参数、主流产品线、软件生态、场景选型以及实际选型中踩过的坑。适合三类人看一是要给团队做AI算力选型的技术负责人二是对芯片行业感兴趣、想搞明白各家产品差异的开发者三是做投资或行业分析、需要快速建立技术坐标系的朋友。内容尽量说人话遇到底层原理我也会用生活化的类比拆开讲保证没有AI基础也能跟上节奏。1. 先搞清楚AI芯片到底是什么1.1 一个容易混淆的定义边界入行这些年我发现大家对AI芯片的定义差异很大。有人觉得只要带神经网络加速单元的都算AI芯片有人觉得只有能跑大模型训练的才算。这里我建议按照AI计算链路来划分会更清晰一些。AI芯片本质上是针对张量计算做了特殊设计的处理器。张量计算是什么说白了就是大规模的矩阵乘法外加一部分激活、归一化、池化这类神经网络标配操作。通用CPU也能做但效率很低——就好比你让一个全能型的大厨专门去削土豆皮他虽然会但成本和速度都顶不住。AI芯片就是那个专门削土豆皮的刀形状专门优化过批量处理特别快。按这个逻辑目前市面上的AI芯片大致分四类GPU、FPGA、ASIC、NPU这里NPU作为ASIC的一种典型形态单独拎出来讲。GPU是通用性最强的加速器什么AI模型都能跑但现在越来越多专用化的设计FPGA是半定制电路逻辑可以现场重构好处是灵活坏处是做矩阵乘法的能效比不如硬核ASICASIC是专用芯片电路逻辑在流片时就固定了能效最高但灵活性最差NPU是面向神经网络指令集深度定制的ASIC如今手机SoC里基本都有一个。1.2 训练芯片和推理芯片的两套逻辑另一个容易踩坑的区分维度是训练和推理。很多第一次接触AI芯片的朋友以为训练和推理用的是同一种芯片或者以为推理芯片比训练芯片“小一号”而已。实际上这两个场景对芯片的要求完全不同。训练阶段的特点是数据量巨大、模型迭代频繁芯片需要支持高精度的浮点计算比如FP32用来做精度兜底FP16/BF16用来做混合精度加速同时需要极高的显存带宽来喂饱计算单元。推理阶段模型参数已经固定芯片可以做大量的权重裁剪和量化优化用INT8甚至更低精度来换吞吐量对显存带宽的要求也相对低一些但更看重延迟和单位功耗的吞吐能力。这就是为什么你会看到很多芯片厂商把产品线分成两条一条叫做训练卡一条叫做推理卡。两者体系、规格、最优场景完全不一样选型时如果混为一谈后面部署上线的时候多半要返工。我见过有人拿训练卡硬做高并发推理服务结果功耗打满、成本报表直接惨不忍睹。1.3 云端和端侧的分水岭再看应用位置AI芯片还分成云端芯片和端侧芯片。云端芯片放在数据中心不担心功耗上限也可以说很担心但驱动的核心动力是更强大的绝对算力通过PCIe或高速网络对外提供服务端侧芯片嵌入手机、汽车、摄像头、机器人这些设备里面积、功耗、成本都被卡得非常死能抠出一瓦是一瓦。这次调研我最大的感受是端侧AI芯片的权重正在快速上升。以前大家的注意力全在云端大模型训练卡上但现在很多推理任务已经压到端侧去做了因为省带宽、省成本、时延低。比如手机上跑的小模型翻译、汽车上的车道偏移预警都是端侧芯片的活。端侧比拼的已经不是单纯的TOPS数字了而是一整套“算法压缩异构调度”的综合能力。2. 核心参数怎么读别被纸面性能骗了2.1 算力单位里的门道看AI芯片配置单第一行一定是算力单位有TOPS每秒万亿次运算、TFLOPS每秒万亿次浮点运算。这两个单位经常混着出现但本质有区别TOPS通常对应整数运算INT8TFLOPS对应浮点运算FP16/FP32。同一个芯片算力数值会跟着计算精度变。比如一张卡标称FP16算力500 TFLOPSINT8算力可能标到1000 TOPSFP32可能只有250 TFLOPS。宣传册上通常会挑最大那个数字放在显眼位置这不算造假但确实容易误导。我的习惯是把同精度、同批次的数字单独列出来比不然就等于拿苹果比橘子。还有一点必须留意很多芯片标的是稀疏算力也就是利用神经网络里的零权重跳过计算得来的理论上限。稀疏计算需要硬件和软件协同支持激活稀疏度的损失率如果不达标纸面性能就要再打个折扣。选型的时候我一般会要求厂商提供稠密算力和稀疏算力两个数字然后以稠密算力为基准做容量规划。2.2 带宽和显存决定实际效率的另一条腿只看算力不看带宽是外行最容易犯的错。AI计算是典型的访存密集类型数据要在显存和计算单元之间持续搬运如果带宽不够算力再高也只能干等着。这个原理和装货一样吞吐量再大的传送带如果供料跟不上也得空转。显存有两个指标容量和带宽。容量决定你能放下多大的模型带宽决定每个时钟周期能喂多少数据给计算核心。举个例子一个70B参数的大模型即使量化到INT8光权重就需要约70GB显存低于80GB基本没法跑哪怕勉强塞下KV Cache和激活值都没地方放。所以大模型训练和推理大显存是硬门槛。带宽这个指标经常被人忽略。HBM高带宽显存普及以后主流AI芯片的带宽都干到3TB/s以上了相比前几年的GDDR显存提升是数量级的。如果你拿一张大显存但带宽小的卡跑大模型光是权重加载阶段你就会等到怀疑人生。2.3 互联设计单卡再强也要看怎么连单卡性能只是基础AI芯片真正的硬仗用在大规模集群场景。这时候更关键的参数是互联方式。AI计算是个高度协作的过程千卡集群里一张卡算完自己那一块马上要把结果传给下一张卡接着算传输速度直接影响整个集群的扩展效率。NVIDIA的招牌互联技术叫NVLink和NVSwitch多卡之间的通信带宽远高于普通PCIe。AMD有Infinity FabricGoogle有TPU的ICI互联。国内厂商也有各自的高速互连方案。关于互联我的建议是别只看单卡规格要看支持多少卡组网、拓扑是什么样对端到端时延和成本收益做综合测算。很多纸上谈兵的方案一到万卡集群就掉链子原因之一就是低估了互联复杂度。2.4 制程和功耗物理设计的现实约束先进制程的价值不用多说直接从速度和功耗层面影响芯片能力。5nm、4nm这些数字越小晶体管密度越高同功耗下性能越强。但也要注意先进制程的边际成本在快速增长所以近两年Chiplet设计特别火思路是把芯片拆成多个小芯粒用先进封装拼起来。这种设计的逻辑说穿了就是省钱和提良率。一个大芯片在晶圆上只要一个缺陷就可能报废但拆成四个小芯粒之后坏一个换一个整体成本反而可控。AMD的MI300系列、Intel的Ponte Vecchio都是典型的多芯粒方案。功耗这块容易被忽略的是热设计功耗TDP和实际功耗的差距。有些芯片标称TDP 700W但跑满负载的时候瞬时功耗可能冲到800W往上。数据中心配套的供电和散热不只是买几个高功率电源那么简单配电链路、机柜级别散热方案全都得跟着升级。我调研的时候专门查了一整圈发现很多集群项目栽在功耗规划上——芯片买得起电费和改造费才是后面真正的隐形账单。3. 主流AI芯片阵营哪条路线更值得押注3.1 NVIDIA从CUDA帝国到系统级碾压聊AI芯片不谈NVIDIA不太现实。自大模型爆发以来NVIDIA几乎成了AI算力的代名词A100、H100、H200、B200这一连串产品迭代节奏快得让人喘不过气。NVIDIA的核心壁垒不只是硬件更是CUDA生态。CUDA发展了十几年沉淀了庞大的开发者社区、现成的算法库、各种兼容的工具链。很多团队换不了卡就是因为代码已经深度绑在CUDA上了换平台等于所有工程都重来一遍。这是典型的“生态锁死”不是单靠硬件性能就能撼动的。从产品上看N卡在互联、显存、算子效率、分布式框架兼容性上都做得均衡综合体验确实好。但它的缺点也明显贵、交期长、功耗高。如果不是非CUDA不可或者预算吃紧完全有理由认真看看其他方案。由于众所周知的各种原因国内能拿到的NVIDIA产品线并不齐全这也给国产AI芯片留下了很大的市场空间。3.2 AMDROCm生态下最值得关注的追赶者AMD的MI300系列是这两年挑战NVIDIA最积极的方案。MI300X主打大显存路线192GB HBM3带宽高单卡跑大模型显存比N卡更宽裕这对超长上下文的推理场景特别有吸引力。但制肘仍然在软件。AMD的ROCm经过多轮迭代如今已经能跑PyTorch和主流框架了只是论顺手程度和CUDA仍有明显差距。网上大量现成代码和工具都是按CUDA写的迁移到ROCm平台可能碰到各种兼容性坑得靠团队自己填。我的建议是如果团队有比较强的工程能力愿意掏时间做底层适配MI300系列是性价比很不错的选项如果团队整体经验偏应用层、不太想折腾底层基础设施那还是要认真评估迁移成本。3.3 Google TPU自用和云上的一招鲜Google的TPU是一朵奇葩性能很强而且给到第三代TPU v3、第四代TPU v4、特别是TPU v5p之后纸面算力、互联带宽、能效比都很有竞争力。但它不对外销售裸卡只能通过Google Cloud以云服务的形式租用。如果你想在自建机房部署TPU基本上没戏。这种模式注定了TPU的生态是封闭的只对特定人群有意义——比如本来就在Google Cloud上跑业务的团队或者想要一个极度成熟的全托管AI训练平台的团队。在调研各家芯片的时候我看了一个有意思的数据Google很多内部最强的模型就是跑在TPU上的这说明TPU的上限绝对不算低。它的问题不是能力而是获取难度和生态锁定。3.4 国产AI芯片技术发力与生态补课国产AI芯片在近几年的迭代速度非常快尤其是面向AI训练和推理的高端产品已经有不少能和高阶方案对标。华为昇腾系列是比较有代表性的国产AI训练芯片基于达芬奇架构算力指标和国际一线产品差距越来越小更重要的是昇腾有自己的CANN软件栈和MindSpore框架整个体系非常完整。寒武纪、燧原、海光等厂商也有各自的AI芯片产品和软件方案面向训练、推理、智算中心等不同场景。不过国产AI芯片目前最需要补的还是生态。软件工具链、算子库、开发者社区的丰富度和成熟度以及和各主流深度学习框架的深度适配都在加速构建中但相比发展了多年的CUDA体系仍有差距。毕竟AI芯片的竞争从来不是芯片本身的竞争而是“芯片编译器框架社区”的生态战争。对一个企业用户来说国产AI芯片最直观的优势是响应快、交付灵活、本地化支持强遇到技术问题可以随时对接工程师。预算允许的情况下拿小规模算力先跑通技术栈再逐步扩大规模是一条比较稳妥的路。4. 软件生态决定“能用”和“好用”的那条关键分界线4.1 CUDA为什么能成为事实标准很多新入行的朋友不理解为什么GPU卡都这么贵了大家还非NVIDIA不可答案就在CUDA这套东西里。CUDA不只是编程模型它周边还围绕着一整层库cuBLAS矩阵运算、cuDNN深度神经网络、NCCL多卡通信往上又接着PyTorch、TensorFlow这些框架。因为这个生态太成熟全球数不清的工程师、研究者、企业都在围绕它开发和积累代码代码和生态彼此强化螺旋上升后来者想打破这个循环是非常艰难的。用个不严谨但贴切的比喻CUDA之于AI就像Windows之于PC。你当然可以选择Linux甚至也可以用macOS但当你需要一份文件、一个软件时最先想到的往往是Windows版。4.2 各家软件栈的真实水平为了这次调研我认真看过几套主流软件栈。Intel有oneAPI目标是跨厂商、跨架构的统一编程模型想法很好但实际渗透率还不高。AMD的ROCm这几年进步明显HIP可以用起来比较平滑地把CUDA代码迁移过来社区也在逐渐壮大。Google的XLA编译器配合TPU和GPU使用体验属于“天作之合”但只限自家环境。国产芯片的软件栈每家都在快速迭代。昇腾CANN的算子库覆盖度、编译器性能优化方面都投入很大和MindSpore的咬合也比较紧密。寒武纪则有自己的一套Neuware平台。整体来说国产软件栈正在从“能跑”往“好跑”的方向走但生态积累不是一朝一夕能突破的作为用户要有清醒预期。4.3 从框架接驳角度评估生态成熟度一个特别实用的评估方法是看“芯片和主流框架的兼容深度”。以PyTorch为例某芯片只要会跑一个简单CNN这不叫兼容要能原生支持torch.compile、自动混合精度、分布式数据并行、自定义算子注册这些才叫深度兼容。我调研时通常会拉一个清单它能否直接pip安装框架能否无需魔改代码跑通经典模型如LLaMA系列、Stable Diffusion分布式训练脚本是否要额外改参数多卡通信库能否自动选路如果这些问题的答案都是“能”那这套芯片的软件生态基本就算合格了。这个调研方法分享给大家省得到时芯片买回来模型跑不起来才发现全是工程债。5. 不同应用场景的芯片选型逻辑5.1 大模型训练集群扩展能力是命门大模型训练对芯片的要求是最苛刻的。它不是一张卡能解决的事而是一个集群的事。模型动辄几千亿参数内存放不下就得做模型并行、流水并行、数据并行这些分布式策略。这些策略落地都依赖芯片间高速互联。比如千亿级模型训练卡间通信的带宽太差整个集群的利用率会被拖到惨不忍睹算力冲高但效率极低。所以训练场景选型第一优先级看互联和显存第二看FP16/BF16算力第三看框架分布式工具的深度集成能力。至于单卡算力是必要条件但不是充分条件。我看到很多调研报告把单卡算力排第一位这是个典型的本末倒置。PowerPoint worshi。训练集群的供电、散热、机房网络改造都需要提前规划。一台高密度AI服务器单机功耗轻松过万瓦风冷基本撑不住液冷方案要提前上。这笔账如果不算清后面就难了。5.2 大模型推理延迟与吞吐的极致博弈推理场景的核心矛盾是延迟和吞吐。在线对话类应用用户等不起单次推理时延要控制在几百毫秒以内离线批量推理则更看重吞吐即单位时间内能处理多少请求。这就要用到张量并行、KV Cache、连续批处理这些优化手段。这些手段对芯片的要求很不一样KV Cache要吃显存容量和带宽连续批处理考验算子的稳定性和调度能力张量并行要求卡间低时延通信。选推理芯片时别贪峰值算力要实测真实并发下每Token生成成本。量化精度也是推理芯片的重要考量。好芯片对INT8、FP8这类低精度推理支持得越好单位成本能压得越低。选型时我会专门看官方白皮书里的量化支持表格能覆盖的主流模型越多越好。5.3 自动驾驶和端侧能效比压倒一切到了端侧芯片的玩法又变了。车上、手机上、摄像机里系统对芯片的功耗和面积非常敏感续航和散热都是硬约束。端侧芯片现在拼的是每瓦算力TOPS/W和内存带宽效率而不是绝对算力。一个号称1000 TOPS的车载芯片如果功耗压不下来在车里根本待不住早晚要降级使用。同时端侧AI芯片越来越强调“软硬一体”芯片要和算法模型、编译器、量化工具一起交付。很多算法团队会针对特定芯片做模型剪枝和量化对齐把精度损失压到最低。这方面做得好的厂商往往不是单纯卖芯片而是卖一整套端侧AI解决方案。5.4 成本和交付周期选型里无法回避的现实最后说一个技术之外但极其关键的因素钱和货期。AI芯片市场供需波动很大。某些时期高端训练卡一卡难求交期排到几个月之后对有紧急上线需求的团队来说就是致命风险。我调研中就听到过一个案例某团队因为芯片迟迟不发货最后只能高价租云GPU顶着预算直接超了几倍。所以选型不能只看性能还要评估多家供应链风险、可替代性、云上是否有同规格算力可以弹性支撑。成熟的团队通常会做“主用方案备用方案”双轨规划以防单一供应出问题。6. 调研中踩过的坑和排查经验6.1 规格书噱头太多实测才是硬道理整个调研下来我最想提醒的就是规格书全是数字游戏只有实测数据才会讲真话。我们专门做过一组对照实验把NVIDIA、AMD、国产几款芯片放在同一个模型、同一批数据、同一个框架版本下跑分。结果很有趣纸面算力最高的不是跑得最快的因为各自编译器对不同模型的优化程度不一样。有的芯片跑CNN很强一碰到注意力机制多的模型算子库不友好性能就掉得很厉害。所以强烈建议选型阶段就申请测试机拿自己真实业务里的模型跑一遍跑完看算子耗时、内存占用、吞吐曲线用这些数据选型预算下来满嘴都是泪。6.2 参数对齐数字一定要站在同一条起跑线上对比不同芯片时最容易出的偏差是精度不对齐。A芯片标称1000 TOPS是INT8稀疏算力B芯片标称800 TFLOPS是FP16稠密算力两者根本没法直接比。要把所有厂家拉到同一精度、同一稠密稀疏口径下出来的对比才成立。显存也是同样问题。有的厂商把容量、带宽、类型都写得清清楚楚有的则只给一个“XX GB HBM”对带宽、容量连锁反应避而不谈。技术选型的人要是只看容量选芯片后续模型跑不动时就会很被动。6.3 集群环境模拟单卡容易组网不易如果目标是部署一个集群测试就不能停留在单卡。我在调研中发现单卡跑分再稳组网以后完全变样的情况很常见。多卡通信时延、集合通信库的调优程度、IB或者RoCE网络配置每一样都会影响集群真实效率。组网压测建议直接用Megatron-LM或DeepSpeed这类真实的分布式训练框架跑一次百亿到千亿级模型而不是跑那种简单的单机多卡benchmark。真实模型才能暴露真实瓶颈例如多机多卡通信是否吞吐塌陷、负载是否均衡、断点续训是否可靠。6.4 调研资料从哪儿来很多人问我去哪儿找高质量的AI芯片资料。我的顺序是首选官方白皮书和性能评测文档那里有最权威的定义和参数其次看MLPerf这类第三方基准测试结果竞品间对比相对公平再参考大厂公开的落地案例和工程博客那些往往藏着真实的坑和细节。社区讨论和短视频帮助不大顶多当线索用。看完资料之后最好自己拉一张多维对比表把算力、显存、带宽、互联、功耗、软件栈、价格、货期这些维度全放进去逐项打分。这张表才是选型讨论的基石不然开会时你一句我一句全是感觉没法拍板。结尾一次调研后的几点心里话这轮AI芯片调研做下来我最大的体会是没有最好的芯片只有最适合自己场景和预算的方案。技术指标只是一个维度生态、成本、供应链、交付周期每个变量都可能改变最终结论。别迷信单一指标也别迷信单家厂商的roadmap——用自己真实的模型去跑用自己真实的规划去做预算最后得出的答案才是靠谱的。最后再分享一个小技巧如果时间紧可以按“先看互联和显存再看软件生态最后比算力”的顺序来筛选候选芯片。这个顺序能淘汰掉九成不合适的选项剩下的再做深度实测效率会高很多。希望这份调研记录能帮你们省掉一些弯路也欢迎有实战经验的同行来交换看法。