多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

RLHF 之父下海创业做“判断模型“:前 OpenAI 研究员的明星效应正在给 RLCD 生态加热

RLHF 之父下海创业做“判断模型“:前 OpenAI 研究员的明星效应正在给 RLCD 生态加热 RLHF 之父下海创业做判断模型前 OpenAI 研究员的明星效应正在给 RLCD 生态加热【免费下载链接】Qwen-2.5-1B-RLCD项目地址: https://ai.gitcode.com/hf_mirrors/harshatheg/Qwen-2.5-1B-RLCD2026 年的大模型叙事里最反直觉的一件事发生了一个不会写代码、不会写作文的模型拿下 4000 万美元融资一家把生成能力从模型里彻底删掉的创业公司被媒体称为AI 世界此前是个悲剧而它的作者是顶着RLHF 之父头衔的前 OpenAI 研究员 Diogo Almeida。这位亲手定义了大模型对齐范式的人转身创立 TypeSafe AI发布了一款名叫 Jev 的System One 模型——只做多选项概率化判断不做任何文本生成。三个月之内从 Cloudflare 开源的 Clef、三天内复刻的 Laya、基于 Qwen 微调的 Nimble 与 JevLite到本仓库所代表的 Qwen 并行约束解码路线一个围绕判断模型与 RLCDReinforcement Learning for Calibrated Decisions校准决策强化学习的生态正在快速成型。这篇文章将以社区公开情报为事实底座以 Qwen-2.5-1B-RLCD 仓库源码为工程切片拆解放弃生成、专攻概率判断的产品逻辑以及名人效应如何给这条技术路线持续加热。从 RLHF 到 RLCDDiogo Almeida 与 Jev 的出场Diogo Almeida 的履历决定了这件事的传播起点他是 OpenAI 早期核心研究员深度参与了 InstructGPT 与 ChatGPT 背后 RLHF基于人类反馈的强化学习范式的构建RLHF 之父的称号让他成为对齐技术路线的代表人物。2026 年他离开 OpenAI 创立 TypeSafe AI并发布 Jev——一款完全放弃自回归文本生成、只输出结构化概率判断的模型。Jev 的公开数据相当激进端到端响应 70–500 毫秒相比传统生成式调用宣称提速最高 193.6 倍输入成本低至每百万 Token 0.042 美元输出 Token 永久免费。它支持并行判断、LLM 验收与模型路由被定位为 Agent 架构中的System 1快速判断层与 GPT 类慢思考推理模型形成快慢思考解耦的分工。更值得注意的不是数字本身而是训练范式的更名TypeSafe AI 将其对齐方法命名为 RLCD。与 RLHF 依赖人类偏好反馈不同RLCD 直接针对概率输出是否可信进行强化学习目标是让模型输出的置信度具备统计意义上的校准性——即当模型说某选项有 90% 概率时该事件在真实世界中确实以约 90% 的频率发生。不生成只判断的产品逻辑把决策从语言里剥离出来Jev 的产品逻辑可以被一句话概括分类、路由、风控这类高频决策本来就不需要说话。传统 LLM 处理一个四字段的 JSON 抽取任务需要逐 token 自回归解码 150 到 500 步期间还可能发生语法错误、字段遗漏和幻觉键而判断模型把问题域收敛为在给定的选项集合上输出一个概率分布任务复杂度从生成一段文本坍缩为做一个选择。这就是判断模型与生成模型的本质分野输入侧判断模型接受的是上下文与候选选项schema而不是开放式指令计算侧判断模型只在候选 token 的 logit 切片上做归一化打分不需要生成循环输出侧判断模型输出的是结构化 JSON——每个字段的值、置信度以及完整 top_choices 概率分布而不是自然语言字符串。开源轻量版 Nimble 给出了这条路线在小模型上的可行性基于 Qwen3.5-9B 微调在判断任务上准确率达 90.12%。而 Cloudflare 的开源决策模型 Clef 则展示了工程化的另一极——冻结 Qwen 骨干网络、联合 schema 头、仅执行 prefill 前向传播并并行打分专用于工单路由与内容安全等有界决策上下文窗口 64k权重以 Apache 2.0 协议开放且 API 直接兼容 Jev。头部云厂商下场兼容 Jev 的接口说明这套判断模型的产品形态正在成为事实标准。为什么判断模型必须校准RLCD 的核心命题如果说不做生成解决了延迟与成本那么 RLCD 解决的是可信度问题。纯分类模型给出的 argmax 结果并不携带可靠的不确定性信息一个训练不足的分类器可能对错误答案给出 0.99 的置信度。RLCD 的强化学习目标函数直接惩罚这种过度自信让模型的概率输出趋向校准calibrated。社区对开源复刻项目的横向评测也印证了这一点在 S1Bench 与 JevBench 基准上各模型的差距首先体现在 ECE期望校准误差与 Brier 分数上而不是原始准确率上概率校准、高基数选项泛化与跨任务基准统一性被明确列为当前开源方案与 Jev 之间的核心差距。换句话说生态竞争的第二阶段拼的不是谁更准而是谁更知道自己不知道什么。名人背书如何加热复刻生态Laya、Nimble、JevLite 与 Qwen 化Diogo Almeida 的明星效应直接缩短了这条技术路线的验证周期。Jev 发布三天后基于 ModernBERT-large 编码器的开源平替 Laya 即上线单次前向传播输出多选项概率分布实测延迟 32.8 毫秒比 Jev 快约 8 倍采用 RLCD 训练Apache 2.0 全权重开源——适用于意图路由、安全护栏等 25 类以内的决策场景但在 77 类的 Banking77 高基数分类上表现受限。紧随其后的还有基于 Qwen3-4B LoRA 的 JevLite仅读取 A/B 标签 logit单次前向 64.5 毫秒AUROC 0.974ECE 0.052、基于 Qwen 的 Nimble以及社区系统盘点出的 8 个开源复刻项目SemIf、Simple Jev、Laya、Von、Verdict、Kev、Nimble、OpenJev 等覆盖冻结大模型读 logits、专用编码器决策模型、校准优化小模型、Qwen 改造微调、离散扩散生成五类技术路线。一个清晰的信号是复刻生态正在集体Qwen 化。无论是 JevLite 选择 Qwen3-4B、Nimble 选择 Qwen3.5-9B还是 Clef 冻结 Qwen 骨干乃至本仓库直接基于 Qwen2.5 系列搭建并行约束解码引擎Qwen 的开源权重 Apache 2.0 授权 端侧友好尺寸使它成为判断模型复刻实验最便宜的底座。这正是本文要深挖的仓库所在的生态位。源码切片Qwen-2.5-1B-RLCD 如何把判断工程化本仓库Qwen-2.5-1B-RLCD提供的正是一套完整的判断模型推理实现。它默认加载mlx-community/Qwen2.5-1.5B-Instruct-4bit见 core/engine_mlx.py在 Apple Silicon 上通过 MLX 实现并行约束解码不再逐 token 生成 JSON而是把 schema 中所有字段同时当作独立的概率判断问题来求解。核心一字段即选项集在 core/schema.py 中FieldDefinition定义了判断模型的最小单元布尔字段只有true/false两个选项枚举字段支持最多 255 个选项的候选集compile_candidate_tokens在初始化阶段就把每个选项预编码为候选 token ID 并缓存——让推理运行在微秒级的前提是候选集的预索引。StructuredSchema则负责把用户声明的 JSON schema 编译成并行判断所需的元数据schema_definition { fraud_risk: { type: enum, choices: [LOW, ELEVATED, SUSPICIOUS, CRITICAL], description: Risk assessment tier for incoming transaction }, block_account: { type: boolean, description: Whether immediate account restriction is required } } schema StructuredSchema(schema_definition)核心二KV-Cache 广播与单次前向并行打分传统自回归路径在 core/engine_mlx.py 的run_naive_generation中逐 token 循环而run_parallel_generation则执行六步流水线单次 Prefix Prefill → KV-Cache 广播到全部 M 个字段 → 对每个字段只保留合法候选 token 的子词表 Logit 切片 → 在候选切片上做温度缩放 Softmax 得到校准概率 → 对共享前缀的候选做 Token 树消歧 → 程序化组装 100% 合法的 JSON。关键的一步是广播# Broadcast KV cache across batch dimension M with fused Metal evaluation for c in cache: nc copy.copy(c) nc.keys mx.repeat(c.keys, M, axis0) nc.values mx.repeat(c.values, M, axis0) ... # SINGLE BATCHED FORWARD PASS for all M suffixes suffix_out model(suffixes_batch, cacheb_cache)这意味着一个 28 字段的工单分诊任务自回归基线需要 312 次顺序前向传递而并行约束解码只需1 次批处理前向传递。核心三字段级置信度与 top_choices判断模型的可信度最终落在概率上。core/schema.py 的extract_calibrated_probabilities给出了校准打分的数学形式——在候选切片上做温度缩放 softmax$$P(c_i) \frac{\exp(z_i / T)}{\sum_{j1}^{C} \exp(z_j / T)}$$引擎为每个字段返回值、置信度、候选基数与 top_choices 完整分布{ fraud_risk: { value: CRITICAL, prob: 0.9942 }, block_account: { value: true, prob: 0.9881 }, recommended_action: { value: TEMPORARY_HOLD, prob: 0.9715 } }这种每个字段都带置信度的输出正是风控、工单分派等需要人工复核边界的高可靠场景的刚需——也让判断模型天然适配 Agent 的置信度闸门编排。性能与场景落地仓库在 Apple Silicon M4 Max 上的基准数据README.md与社区端侧优化实践MLX 4bit 量化 KV Cache 紧凑化将 JSON 生成延迟从 1669ms 压至 295ms互相印证场景字段数自回归基线并行约束解码提速金融欺诈路由4 字段420 ms75 ms5.6x代码安全审计4 字段380 ms68 ms5.6x高基数关税分类1 字段255 选项500 ms89 ms5.6x企业工单分诊28 字段1,900 ms270 ms7.0x配套的 presets/ 目录提供了四个可直接运行的企业级场景fintech_fraud.json28 字段的欺诈检测与 AML 合规决策、code_security.jsonPR 漏洞分诊、support_triage.json企业事故工单路由、high_cardinality_255.json255 选项的 HS 海关税则分类。而 core/engine.py 与 server/app.py 实现了 MLX / PyTorch 双后端自动适配与 FastAPI 端点/api/run-parallel、/api/stream-naive、SSE 流式输出意味着这套判断引擎既能在 Apple Silicon 上跑也能在 Linux 容器、CUDA 与 Hugging Face Spaces 上跑——这正是判断模型从论文走向生产环境所需的最后一公里。生态观察System 1 分层与仍在拉开的差距把社区情报与本仓库放在一起可以得出三个判断第一判断模型不是新分类器而是新的模型品类。它把决策从语言生成中剥离用概率分布替代文本输出在延迟、成本、可解释性三个维度同时做减法。Cloudflare 的 Clef 直接兼容 Jev API、TypeSafe 将 RLCD 作为训练范式对外输出都说明这条路线已经具备商业闭环。第二名人效应在生态早期阶段承担了信任加速器的角色。Diogo Almeida 的 RLHF 履历让放弃生成这个激进选择获得了叙事合法性进而吸引 Laya、Nimble、JevLite 等复刻项目在数日内跟进Qwen 权重则提供了低门槛底座。本仓库基于 Qwen2.5 的并行约束解码实现正是这场生态扩散在端侧推理上的一个注脚。第三校准仍是最后的护城河。开源方案在结构化决策接口上已经高度复现 Jev但 RLCD 式概率校准、高基数选项泛化与跨任务基准统一性仍是最明显的差距JevLite 在 A/B 场景下做到 ECE 0.052而 255 选项高基数场景如本仓库的关税分类预设对校准能力的要求截然不同。判断模型赛道的下半场比的不是谁更会判断而是谁的判断可信到可以交给自动化系统直接执行——从 RLHF 到 RLCDDiogo Almeida 只是把同一个问题的答案从让模型更符合人类偏好改写成了让模型更符合概率公理。【免费下载链接】Qwen-2.5-1B-RLCD项目地址: https://ai.gitcode.com/hf_mirrors/harshatheg/Qwen-2.5-1B-RLCD创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表