多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

System 1 与 System 2 之争烧到开源圈:先判断再思考真的更省算力吗

System 1 与 System 2 之争烧到开源圈:先判断再思考真的更省算力吗 System 1 与 System 2 之争烧到开源圈先判断再思考真的更省算力吗【免费下载链接】laya-coremlLocal Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.项目地址: https://gitcode.com/gh_mirrors/la/laya-coreml诺贝尔经济学奖得主卡尼曼提出的双系统理论本意是描述人类心智的两种决策模式System 1 快而直觉System 2 慢而审慎。2026 年秋天这场争论以另一种形态烧进了开源圈——当 Laya 把System 1 决策模型做成开源项目以 421M 参数、33ms 级推理速度对标闭源 API 时社区真正在争辩的问题是把判断从思考中拆出来单独训练一个不做生成、只做判定的模型到底省不省算力这个问题不能靠口号回答只能靠实测。laya-coreml 仓库在 M3 Max 上给出了目前最完整的一份证据链单问题短决策 P50 4.98ms、相对编译版 MLX FP16 快 1.39 倍、整机能耗每决策低 2.78 倍——但同样诚实地记录了它 96 token 的上下文上限、91.7ms 级别的长输入表现以及快判断无法覆盖全部决策场景的边界。本文基于社区情报与仓库源码把这份账算清楚。从心理学概念到开源模型System 1 为什么值得单独造一个模型先看 Laya 到底做了什么。它不是把通用大模型变小而是改变了任务的数学形态把决策建模为单次前向传播的分类问题而不是生成一段文本的自回归问题。在 决策原语定义 中所有任务被收敛为三类choice从若干选项中选择、score打分评级、noul是非判断。输入不是自由的提示词而是按固定模板拼装的序列——[CLS] 类型 指令 [SEP] [MASK] 选项0 [MASK] 选项1 ... [SEP] 状态 [SEP]见 序列构造。模型只需要对每个[MASK]位置输出一个 logit经过校准温度缩放和 softmax 变成概率再交给一个轻量 action head 输出动作概率。整个推理路径在 结果装配 中完成返回结构里output_tokens恒为 0——这是它与一切生成式模型最本质的区别没有解码就没有逐 token 的 KV cache 增长也没有生成错了要重新生成的纠错回路。为什么值得专门造一个这样的模型社区文章Jev 火了但真正值得写的是一文点破了要害System 1 决策的护城河不在速度而在RLCD 训练带来的置信度校准能力ECE 指标。通用模型被 Prompt 逼着做判定时输出的是文字概率要经过一层不可控的转换而 Laya 训练时直接优化判定对了没有、判定有多确定输出本身就是校准后的概率。这个差异在工程上直接表现为能否把模型的概率当数用。先判断再思考的算力账5ms 决策背后的能耗结构laya-coreml 仓库的核心贡献是把 Laya 移植到 Apple Core ML 与 Neural Engine并给出了可复现的速度与能耗基准。在 Neural Engine 实测报告 中同一多语言 checkpoint、同一组 91 token 的发票判定问题填充到 96三种后端在 M3 Max 上各跑六个 20 秒交替块共 65,598 次稳定调用结果如下指标编译版 MLX FP16Core ML ANE FP16Core ML ANE W8P50 / P95 延迟6.94 / 7.39 ms4.98 / 5.31 ms4.88 / 5.23 ms平均整机功率估计61.39 W30.75 W27.39 W整机能耗 / 决策0.4288 J0.1540 J0.1344 J速度增益1×1.39×1.42×能耗增益1×2.78×3.19×这份数据最有价值的地方在于它的测量纪律用 SMC PSTR 传感器直接读数而非 IOReport 组件计数器、梯形积分、相邻空闲功率平均扣除、异常样本整轮拒绝而不是删点详见 能耗测量说明。它还特意纠正了一个常见的算账错误——速度增益 × 平均功率下降比 能耗增益把能耗比再乘一次速度就是重复计算时间。先判断再思考省算力在数字层面的答案是省且省在结构上。非自回归意味着计算量与输入长度近似线性而非随生成长度二次累积无解码意味着峰值功率低30.75W 对 61.39W不需要维护 KV cache 意味着 421M 参数的模型在 96 token 的固定图里就能把全部工作压进神经引擎。社区流传的Laya-MLX 在 Apple Silicon 上 7.4ms 极速决策与这里的 4.98ms 互相印证——这不是个别跑分的巧合而是架构使然。快思考与深理解的边界哪些决策不需要深度推理省下的算力不是免费的它有明确的代价边界。仓库在 端口保真与限制 中写得非常克制短决策的 4.98ms 不能外推为长上下文优势——单独导出的 ANE L1024 图能通过完整 63/63 校验但一次真实的 1024 token 请求要约 91.7ms。双向编码器不缓存跨问题的上下文状态API 说明每个问题都是一次独立的前向传播。这说明 System 1 模型的适用域是有明确形状的短输入、固定选项、低延迟、高频、需要概率可用的判定。哪些任务属于这个形状社区案例和仓库代码给出了同一份清单意图识别与工单分流CSDN 实战文章验证了邮件分类、退款判定、部门路由内容审核与 Guardrails垃圾邮件检测、钓鱼识别、安全护栏选项集合固定且可枚举路由与工具选择多语言路由、Agent 动作选择实时控制laya-coreml 自带的贪吃蛇演示把这一场景可视化到了极致——模型每帧从四个方向中选择一个同时回答是否有安全路线食物是否可达两个是非问题见 决策策略。在 Snake 基准 中ANE FP16 版本在三个 600 步不间断对局里维持了49.1–50.0 decisions/s的完整游戏循环吞吐零死亡、仅两次安全干预。实测画面见仓库自带的演示而需要深度推理的场景——长文档研判、多步规划、开放性回答——社区文章决策模型选型从 Jev、Kev、Laya 分层给出的判断与之完全一致按决策成本分层能用枚举判定解决的就不要动用生成式推理。System 1 的价值不是取代 System 2而是把 System 2 从大量低价值判断里解放出来。Laya 与 BERT/生成式模型在中文场景的实测差异社区头条文章当「快思考」遇上「深理解」Laya 和 BERT 到底有什么区别问出了一个关键问题Laya 基于 ModernBERT 架构它和 BERT 差在哪仓库源码给出了三层答案。第一训练目标不同BERT 学的是掩码语言建模Laya 用 RLCD 对比决策训练学的是给定状态这个选项比那个选项更合理第二输出形态不同Laya 除了分类头还有 action head动作概率与按选项数量分桶的校准温度见 校准温度读取第三置信度定义不同Laya 的置信度不是简单的 top-1 概率而是归一化香农熵1 - H(p)/log(k)置信度计算衡量的是概率分布有多集中这对多选项判定比单一概率更有信息量。中文场景的实测差异在仓库的验证夹具里可复现。benchmarks/cases.py的 parity 用例直接用发票4411被重复扣款请今天退款。这类真实中文消息构造状态与英、德、法、西、印地、日、俄八种语言同组测试。在 多语言枚举校验结果 中中文用例的probability_max_abs_error为 0.0001149三个问题的 argmax 判定与上游参考全部一致完整 63 题夹具含中文在 CPUGPU 与 CPUNE 两个计算单元下均通过最大概率绝对误差 0.0016。这说明 FP16 Core ML 移植对中文判定的保真度是数字级的不是差不多就行。与生成式模型的差异则在社区实践中被反复验证一篇中文实战记录用 Laya 做智能家居意图解析在仅 740 条中文家电语料上微调将准确率从 0.36 提升到 0.837单次推理约 207ms且输出自带置信度分布——显著优于通用大模型 Prompt 工程方案。中文场景的代价也在同一批文章中被反复提及置信度可能系统性偏高开源模型在小样本、少选项问句上的已知现象、是非题需要额外适配模板、首次推理需要预热。仓库在 端口保真 里同样提示这些校验证明的是转换保真度而非通用任务准确率。对开发者判断力分配的建议什么时候该用哪套系统把情报与源码合在一起可以给出一份可执行的分诊建议第一先用选项是否可枚举做第一刀。判定目标能写成 2–32 个离散选项、且判定标准能文字化时是否退款、哪个部门、危不危急、合不合法才是 System 1 的领地。仓库的 ANE 运行时强制 B1/K32 签名ANE 运行时校验超过 32 个选项或 96 token 直接拒绝——这个限制本身就是设计意图的说明书。第二微调是最后手段不是默认手段。社区文章总结的触发信号只有三类格式强制、领域术语适配、私有决策偏好。在这之前应优先验证提示词、RAG 与链路升级。这不只是方法论洁癖——Laya 的训练管线是私有数据与持续标定堆出来的开源复刻能兼容接口范式却难以复制高精度校准48 小时复刻潮一文的核心论点把稀缺的校准能力浪费在格式问题上不划算。第三概率可以信但先查温度。这是仓库给我们最值得记住的一课上游 checkpoint 的choice:11桶校准温度原始值为0.1006直接使用会把 logits 放大约 10 倍让一个 0.24 的 top 概率被发布成 0.99——抛硬币被报告成确定。仓库因此在 温度钳制逻辑 中把所有温度钳制到 [0.5, 5.0]保留原始值供检查并发出 RuntimeWarning。任何把置信度当作决策门槛的管线都应该把这段逻辑抄进自己的部署层。第四把 4.98ms 放回它的坐标系。它是单问题、91 token、预热后、同进程内的端到端数字包含了提示构造、分词、数组、同步推理、校准与格式化测量口径但不包含模型加载、首次编译、跨问题状态和长输入。Snake 的三问题串行调用实测是 16–26ms P50这才是完整游戏帧的真相。宣称先判断再思考更省算力没有问题但必须同时声明省的是什么——省的是解码、KV cache 与峰值功率不省上下文长度更不省把任务定义成枚举问题的设计成本。结论先判断再思考更省算力在开源圈不是营销话术而是一个被 65,598 次调用和 PSTR 传感器数据验证过的工程事实判定型任务走 System 1 单次前向路径在 M3 Max 上以 4.98ms 和 0.154J 的代价完成一次带校准概率的决策比编译版 MLX FP16 快 1.39 倍、省 2.78 倍整机能耗。但它同时是一个有严格边界的真命题96 token 的容量上限、91.7ms 的长输入现实、以及必须人工钳制的校准温度共同提醒我们——System 1 省下的是算力System 2 该花在哪儿仍然是你来定。当开源项目把这两者的边界用可复现的基准测量出来这场争论才算真正有了论据而不是只有立场。【免费下载链接】laya-coremlLocal Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.项目地址: https://gitcode.com/gh_mirrors/la/laya-coreml创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表