
1. 项目全景1014万到底买的是什么东西先别急着算账我拿到这个数字的时候第一反应也是“又一个大饼”还是“真能做下来”后来认真拆完需求才确认这个预算对应的是一个非常典型的城市级视图智能应用项目——把全市分散的视频监控、物联感知、网格上报图片、无人机巡逻画面统一汇到一个系统里用多模态大模型去做内容理解、事件发现、线索检索和研判分析。说白了它不是传统意义上的人脸抓拍或者车牌识别而是要把“看视频”这件事升级成“看懂视频”。这类项目落地的靶心通常在城市运行管理。你看今天的城市治理摄像头已经铺得非常密但绝大多数视频资源还在被动使用状态出了事之后人工倒查平时靠人盯着大屏看几十路画面。真正有价值的异常事件、安全隐患、市容问题往往是发现滞后、漏报率高。多模态大模型进来之后解决的就是这个问题——用视觉语言模型去理解画面里的物体、行为、场景再用自然语言去做检索和分析比如“找出最近三天所有积水点”“统计早上七点到九点出店经营的店铺”。这在传统CV时代几乎要写几十个独立算法现在靠一个基础模型加提示词就能覆盖一大片。这个项目适合谁参考如果你正在做智慧城市、城市运行“一网统管”、公安或者综治类的平台建设或者你所在的公司准备切入视图AI赛道这篇内容能帮你把预算、技术、交付、验收整个链条捋清楚。尤其适合售前、项目经理和后端算法团队一起看因为这里面有大量商务和技术的交叉点不是单纯写代码的事。2. 预算拆解1014万的资金构成与商务逻辑2.1 硬件算力与软件平台的资金分配比例很多人对千万级项目的理解是“大部分钱都花在硬件上”其实拿到这类项目你会发现硬件占比虽然在但没你想的那么夸张。按我经历过的项目做经验拆解1014万的金额大致可以切成几块模块预算区间说明AI算力服务器与配套硬件约320万4台8卡推理服务器加部分国产化加速卡备机存储、网络与安全设备约150万视图存储、交换、防火墙、堡垒机多模态算法平台软件许可约180万模型底座、推理框架、算法仓库、模型管理平台视图接入与数据治理开发约120万多种视频协议适配、数据标准化、脱敏处理样本标注与模型微调约100万场景化样本采集、清洗、标注、微调训练业务应用与集成开发约80万工单、GIS、移动端、大屏对接事件闭环处置测评、培训、运维与不可预见费约64万第三方测试、等保、驻场运维、首年质保这一刀切下来你会发现软性投入加起来其实超过一半。为什么因为传统项目交付的是“机器”这个项目交付的是“能力”。如果只买一堆GPU回去没有模型微调、没有数据治理、没有业务系统对接那它就是一个昂贵的摆设。甲方要的是能跑起来的系统不是硬件清单。2.2 预算报价中容易被低估的隐性成本报价的时候有一块特别容易漏多模态大模型不是装上就能用的。城市视图的数据很脏不同摄像头的角度、光线、分辨率千差万别有的还是二十年前的老球机。你要先把视频流接进来抽帧清洗选样本然后做人工标注标到足够量才能微调。这中间的人工成本、服务器调试成本、与现有平台对接的开发成本全都要算进去。另一个隐性成本是接口对接。城市里现有系统通常已经有视频共享平台、网格化平台、GIS平台、移动端App接口协议有的是GB/T 28181有的是RTSP有的是厂商私有SDK。真正去联调的时候你会发现有些系统厂商根本不开放完整接口需要你反推协议或者做前置网关。这个工作量在售前阶段很难量化但如果你不预留预算后期就是项目组集体熬夜。还有运行成本。模型推理对显存要求比传统CV算法高一个量级。同样一百路视频接入传统算法一台8卡服务器基本能扛住换成多模态大模型做高频率抽帧分析你可能要加两倍的卡。所以在设计预算时我一定会留出一部分算力冗余而不是恰好卡着最低需求去报不然后续扩容方案写出来都没人签字。2.3 招投标阶段的合规要点与工期设计千万级项目基本都是要走正规采购流程的。这里有几个关键点第一招投标文件里写“多云厂商适配”或者“国产化适配”的时候一定要在技术方案里写清楚我们用的是哪一层的兼容是昇思还是另一套生态是CUDA生态还是国产加速卡这个差异在实施阶段非常致命。第二工期设计不要拍脑袋。这类项目我建议至少分四期启动调研、POC验证、开发集成、测试验收每一期之间留缓冲。特别是POC阶段一定要预留真实视频接入的时间否则后面模型效果达不到指标整个工期都会崩。商务上还有一个容易被忽略的地方知识产权归属。有的招标文件会要求“系统源代码与模型权重归属甲方”这个时候你要判断模型权重是不是全部给基础模型本身是开源的话问题不大但如果是你们公司积累的微调权重给了甲方等于你们后续的项目失去差异化。我当时处理的办法是做平台层和模型层的切割平台源码可以交付模型层按服务授权交付这样两边都能接受。3. 系统总体架构与核心技术选型3.1 视图数据接入层怎么搭城市视图的数据类型非常杂固定点位监控、移动车载、无人机、执法记录仪、网格员手机拍照。这些东西不能直接丢给大模型你需要先做标准化。我的经验是先建一个统一的视图接入网关对外兼容GB/T 28181、RTSP、Onvif、HTTP拉流这些常规协议对内统一输出为视频流或图片消息再通过消息队列分发到推理服务和存储集群。在这一层有两个细节非常关键。第一个是抽帧策略。你不可能把每路视频每一帧都送去大模型推理显存和算力都不允许。常见的做法是按场景配置抽帧频率重点区域每秒一帧普通区域两秒甚至三秒一帧关键事件触发时临时拉高到每秒五帧。抽帧策略直接影响算力成本和检出效果必须配合业务方一起定。第二个是存储策略。原始视频留多久、抽帧图片留多久、告警事件关联的视频段留多久这三个时间要分开设。我的习惯是原始视频留7天抽帧图片留30天告警切片留90天这样控制存储成本的同时还能保证事件倒查的可用性。3.2 多模态模型选型开源底座与私有化部署政务场景有一个绕不开的约束数据不出域。所以闭源API基本不用考虑都得做私有化部署。选型的时候就集中在开源方案上我当时比较过两类底座一类是视觉语言模型路线把视觉编码器和语言模型接在一起直接输出描述或者是回答另一类是对比学习路线把图片和文本同时映射到同一个向量空间做跨模态检索和匹配。说来也简单后者像个“搜索引擎”你给它一张图它帮你找最像的文本或图片前者像个“分析员”你给它一段视频它告诉你发生了什么。实际做下来你最好两个都要反查、聚类、以图搜图用对比学习模型事件描述、报告生成、问答对话用视觉语言模型。两个模型共享一套算力池通过模型管理平台统一调度。这样做的成本会比只部署一个大模型高但业务覆盖度完全不一样。另外要注意模型参数量的选择。动辄几百B的千亿模型在效果上确实强但推理成本和硬件要求在城市项目里基本不现实。我当时选的是7B到13B参数量级别的底座再配合量化部署单卡就能跑起来均衡效果和成本。别被厂商宣传带偏“参数越大越强”在业务侧未必成立很多时候场景化微调比参数量的提升更重要。3.3 知识库与应用的结合方式向量检索加提示词工程多模态大模型在城市业务里用起来不能只靠模型本身的“记忆力”你还得给它喂业务知识。比如一个城市管理部门的工作人员问“这个占道经营的处置时限是多少”模型得知道标准是什么、流程是什么、责任部门是谁。这里就要用上检索增强生成先把政策法规、处置预案、历史工单、案例知识做成知识库按向量索引存起来。模型回答之前先从向量库里检索相关片段再作为上下文输入到大模型生成答案。这套方案在视图场景里还有一个变体视图记忆库。把历史事件的关键帧、事件描述、处置结果都向量化用户提问“以前有没有类似的高空抛物事件”模型就能检索出相似图像和处置案例形成闭环。这个能力在传统视频平台里几乎做不到但却是甲方领导最认可的功能之一演示的时候一打一个准。提示词工程在这里的作用也不容小觑。同一个模型提示词写得好不好输出质量差距很大。我会给每个业务场景单独写一套系统提示词把角色、任务、输出格式、判定标准全部定义死。比如识别垃圾堆积事件提示词里就要写清楚什么叫堆积、面积阈值大概多少、判定依据是几秒内的连续画面。模型有了明确的“作业规范”误报率才能降下来。4. 实操过程从需求调研到上线交付的完整流程4.1 第一阶段需求调研与POC验证三周很多团队死在这个阶段还没搞清甲方要什么就急着上算法。我做项目的一贯原则是前两周不做任何开发就做需求调研和现场踩点。你要搞清楚几个问题甲方现有的视频资源有多少路、分布在哪些区域、清晰度如何他们最关心的城市事件类型有哪些现行业务流程怎么走现有平台有哪些接口开放出来。调研方式不要只看文档一定要拉着甲方业务骨干坐在一起把历史工单翻出来看。哪种事件最多哪种事件最耗时哪种事件经常被投诉这些都是模型优先训练的目标场景。我当时调研完列出来的优先级是垃圾堆积、出店经营、游摊小贩、车辆违停、积水检测、井盖缺失。就按这个优先级做场景清单不要贪多。POC验证阶段我建议用真实数据至少接十路以上不同场景的视频跑一周。纯粹用网图测试没有任何说服力因为城市真实场景的光线、遮挡、运动模糊都会让模型效果大打折扣。POC的验收指标也要提前定好比如检出率、误报率、漏报率各达到多少算通过。我当时定的是检出率不低于85%、误报率不高于15%这个指标不高但结合真实场景来说已经很有挑战。4.2 第二阶段数据工程与模型微调六到八周模型微调之前最核心的工作是数据工程。你要针对每个目标场景收集样本来源包括历史告警图片、视频抽帧、网格员拍照、无人机拍摄等。样本量我建议每个场景至少两千张正样本负样本是正样本的三倍以上。这一步特别累因为城市场景的正样本非常稀有垃圾堆积、积水这些事件不是天天有你得靠翻历史视频去“挖”。样本收集齐了标注标准要单独写一份文档。什么叫出店经营卷帘门以外摆货多少米算什么叫违规停车是压线还是占用人行横道这些判定标准没有定清楚标注员的理解偏差直接带崩模型。我的做法是先出一个标注规范拿一百张样本做试标命中率统一到95%以上再大规模铺开。微调的时候不要一上来就全参数微调风险太高。我的习惯是先做视觉编码器的轻量适配再做语言模型的指令微调分步进行。训练的过程中要设置明确的验证集每一版实验都拿验证集跑一遍看检出率和误报率的变化曲线防止模型过拟合到训练集的偏置上。这个阶段最耗GPU尽早跟算力调度平台打好招呼提前预约训练资源。4.3 第三阶段平台开发与集成联调六周算法跑通了接下来是把它变成一个能被用户日常使用的系统。这部分的开发工作量比想象中大。核心模块包括事件管理生成告警、推图片、附带时间地点、工单联动一键派发到网格系统不这里可以直接生成初步工单信息流转到现有综合处置平台、检索研判以文搜图、以图搜图、条件组合查询、大屏展示和统计分析。集成联调是项目里最磨人的环节。现有业务平台配合度高的三周能搞定不配合的三星期都未必。建议在商务阶段就要求数据对接方提供明确的技术接口文档并且约定联调时间表避免到开发后期才发现接口没有开放。移动端方面建议采用H5方式快速嵌入现有政务App而不是单独开发新App否则又要过一轮应用商店审核很耽误事。效果上线的策略也很关键不要第一天就全量放开建议灰度运行。先接少量重点场景视频算法产生的告警先和人工巡查结果做对比准确率稳定提升之后再逐步扩大接入路数。灰度期也是调阈值的最佳时段甲方一句“告警太多了看不过来”你就可以把置信度阈值往上调直到找到让他们舒服的平衡点。4.4 第四阶段测评验收与移交培训这一阶段有三个测评跑不掉第三方软件测评通常测功能、性能、兼容性、信息安全等级保护测评、以及甲方组织的项目验收测试。测评要求最好在方案阶段就弄清楚否则临时按照标准化要求去补齐代码、文档会非常被动。比如等保如果要求三级的那日志留存、数据加密、权限管理这些功能在开发期就要做好后面补比登天还难。验收测试的指标一般包括视图接入路数、系统并发处理能力、单路分析时延、算法准确率、系统可用性等。我建议你在测试方案里设计一个基准数据集包含一定数量的正样本和负样本用脚本统一跑避免验收时人工一张一张看。脚本测试时间和结果都有记录双方签字确认起来也顺畅。验收之后的培训也不能敷衍。我见过太多系统交付完没人会用的案例。培训要分层给领导看场景演示强调决策支撑能力给业务人员做上机培训讲日常操作和工单处理给运维人员做技术交底讲部署架构、日志查看、模型更新流程。最后一定要留下一个可执行的手册其他文档可以凑合运维手册必须写到“照着敲命令就能恢复服务”的程度。5. 常见问题与避坑指南5.1 效果验收口径不一致这是所有视图AI项目里最大的坑。你辛辛苦苦把检出率做到90%甲方拿十张截图一测觉得“就这”问题出在双方对“检出率”的定义不同。算法这边可能说“只要有告警就算检出”甲方认为“只有精确圈出目标且预警信息完整的才算”。解决方案是提前把指标定义写进合同附件配一个联合标注的测试集双方一起确认。我还遇到过一个更微妙的情况业务方嘴上说“误报率高”实际意思是“这个时间段我不想收告警”。比如深夜两点的渣土车算法识别得再准值班人员也不愿意处理。后来我们在规则引擎里加了时间策略深夜告警自动进入待办而不是即时推送矛盾马上缓解。很多“误报”本质上是“不想要”技术指标解决不了业务规则问题。5.2 算力配置与性价比报价阶段最常见的争议就是“为什么这么贵”。你要能从物理层面解释算力消耗多模态推理加载模型就要占十几个G显存单卡并发处理不了几路视频百路接入意味着推理实例要部署几十个还要预留GPU给模型更新和批处理任务。用一张监控平台截图把显存占用、卡口时延摆出来甲方自己就能算出这笔账。如果甲方预算确实卡得紧有几个省成本的技巧第一降低抽帧率把非重点区域从每秒一帧改成每三秒一帧第二模型量化从FP16降到INT8精度显存占用直接对半第三削峰场景改成离线批处理夜间统一跑分析任务白天只跑实时预警。这三个策略叠加算力成本大概能压下来四成但需要对业务场景有清晰判断不然就是拿着效果做交换。5.3 数据合规与隐私脱敏城市视频涉及个人信息和公共安全这块如果不提前处理项目可能直接死在测评阶段。画面里出现人脸、车牌、行人轨迹都要做脱敏处理。我当时的方案是建立分级数据管控原始视频流不落盘仅在推理内存中处理完就释放需要保存的事件切片统一做模糊化处理之后再入库数据访问全部走权限管理审计日志留存不少于六个月。模型训练层面也要防止越界。从真实视频流里采集的样本在标注前就要做合规审查凡是带明显可识别个人信息的图片直接过滤。如果无法过滤比如要继续做车辆检测那就做地域标签模糊化让模型在学习特征的同时不记忆具体个体。这事不是一个合规专员能扛下来的技术侧要主动把这套机制写进系统设计从架构层面避免不小心踩线。6. 项目复盘与我的个人体会多次踩坑之后我对这类千万级多模态项目的看法简单了很多预算再高最后拼的还是需求理解、数据治理和执行节奏。印象最深的一个教训是前期数据摸底不够细。有一个子场景甲方希望识别“暴露垃圾”但实际很多垃圾点位被绿化带和车辆遮挡摄像头视角根本拍不全。模型怎么调都到不了指标后来带着甲方去现场看了三天才把场景定义改成“可见区域内的垃圾堆积”指标重新对齐后一切顺理成章。所以我现在做这类项目都会强制要求需求阶段看现场不是看图纸不是看平面图是实实在在到点位走一圈。另外一点团队配置上不能只堆算法工程师。数据标注管理员、可视化开发、甚至文档工程师都很关键。多模态项目的文档量远超普通项目光测评要准备的资料就是厚厚一沓。没有专人管文档到验收前一周你会发现到处找材料那种感觉极其痛苦。文档这件事真的要从第一天就开始同步写而不是后期补。这个项目做完之后我最大的经验剩下一条别把多模态大模型想得太玄它本质上是一个更通用的理解引擎。比功能更重要的是你怎么定义好业务边界怎么把数据喂准怎么设计闭环流程。模型强不强那是底座的事系统好不好用才是你的项目能不能验收的核心。如果你手头也有类似项目正在落地建议把注意力放回到那三件事上算法效果先过POC数据合规早评审验收指标写进合同。这三关过了项目基本就稳了。