
2026年9月的某一天如果你打开一个叫Jev的AI模型问它一个非黑即白的问题比如这枚硬币正面朝上的概率是多少它会干净利落地给你一个数字。这就是Jev的卖点它不像ChatGPT那样啰啰嗦嗦地跟你解释半天而是直接返回一个结构化的概率分布速度快成本低。这听起来挺美好对吧。但有一个问题一直悬在那里没人回答这些概率真的准吗当一个模型说这件事发生的概率是70%的时候它说的70%真的意味着如果你把一百个类似的场景摆在一起会有70次发生吗还是说这个70%只是它随手编的一个听起来还算靠谱的数字这篇论文的作者Riccardo Porcedda发现答案可能会让你意外Jev在不同的提问方式下给出的概率完全不一样。同一个问题换一种问法答案就变了。更诡异的是这种变化不是随机的噪音而是一种有规律的、系统性的偏移仿佛这个模型心里藏着一个不肯说出口的秘密。**问题出在哪里过去的校准测试根本没测到点上**要理解这篇论文的价值得先搞清楚一件事AI圈子里说的概率校准长期以来测的都不是这个东西。传统的置信度校准confidence calibration只检查模型给出的最可能答案的那个概率数字是否可信比如模型说我有90%的把握这是一只猫那实际检验时看看这类判断里到底有多少次真的是猫。这套方法有个致命的盲点它只盯着模型选中的那一个答案的概率完全不管模型给错误答案分配的概率是不是也说得通。举个例子如果一个二分类问题里正确答案的真实概率是30%模型却给出了55%并且55%这个数字碰巧因为超过50%被判定为正确决策传统校准指标可能会稀里糊涂地给这次预测打上正确的标签压根不会去检查那个55%本身有没有问题。这就好比一个体温计你只关心它有没有正确判断出病人发烧了还是没发烧这个二元结果却从来没检查过它显示的具体温度数字——38.5度——到底准不准。如果体温计每次都把37.8度显示成39度只要39度依然落在发烧这个区间里你的二元判断就是对的可这台体温计的每一个具体读数其实都是错的。如果不去检查具体数字你永远发现不了这个体温计坏了直到有一天它把38.9度误判成36.9度让你误以为病人退烧了。这就是本文作者要解决的问题他要检查的不是模型选对了没有而是模型给出的每一个具体概率数字本身有没有正确的数值含义。为此他造了一个数据集叫Sys1Cal-v1。Sys1Cal-v1一个专门用来测试概率校准的基准数据集特点是每道题里命题A的真实概率P(A)是通过数学方式人为构造出来的因此完全已知不存在任何模糊空间。这个设计的巧妙之处在于市面上大多数基准测试用的都是真实世界的数据标签只有对或错没有这件事发生的真实概率是多少这种精确数值。而Sys1Cal-v1里的每一道题答案的概率分布是造出来的作者自己知道P(A)精确等于0.6538还是0.1052。这样一来模型返回的概率能不能对得上这个精确数值就变成了一件可以严格量化的事情。数据集一共构造了92个基础问题衍生出365道具体题目覆盖六种难度直接给出的概率、通过计数换算的频率、复合概率、条件概率、贝叶斯定理、还有连续贝叶斯更新。同一个问题还会用不同的方式表达出来比如直接说数字、用比例、用表格、用大白话叙述甚至加入一些干扰信息目的是测试模型是否会因为问法不同而给出不同答案。**三张嘴三种说法Jev的三个问答接口不一致**Jev提供了三种回答方式作者管它们叫原语primitives。Noul最简单的二元判断接口直接返回P(A)和P(?A)两个数两者相加等于1。Choice分类选择接口把问题包装成这个命题的真实状态是什么选项是真或假模型给每个选项分配一个概率。Score打分接口用十档量表表示命题为真的程度从完全为假到完全为真模型对这十个等级分别给出概率。按理说这三种接口问的其实是同一件事命题A有多大概率是真的。既然问的是同一个东西理应返回同样的答案就好像你问一个人你几岁了无论是用中文问还是用英文问答案都该是同一个数字。结果呢作者把同一批365道题喂给这三个接口发现Noul和Score表现得相当不错平均软准确率也就是概率分布与真实分布的重合度1减去两者的绝对差值分别达到0.918和0.886。但Choice接口的表现明显拖后腿只有0.764。软准确率(OVL)也叫分布重叠系数衡量模型给出的概率和真实概率之间的接近程度数值越接近1说明越准。它和总变差距离TV两个概率的绝对差值是一对镜像指标TV越小OVL越大。更细看图表会发现一个很规律的模式当真实概率P(A)大于等于0.5的时候Choice给出的概率会异常地偏高几乎一股劲往非常确定是真的那个方向冲而当真实概率小于0.5时它反而变得含糊犹豫。这不是随机噪音造成的偏差这是一种系统性的形变。对照组SemIf一个开源的Choice式基线模型表现更差平均软准确率只有0.629且看起来是整体性地失准没有Jev这种规律性的形变模式。这个发现让人挠头如果三个接口问的是同一件事为什么Choice会单独跑偏而且跑偏的方式还这么规律**破案关键Score居然能预测Choice的变形轨迹**作者接下来做了一件很聪明的事。他把Score接口返回的十档分布通过加权平均压缩成一个单一的数值叫Score期望值。Score期望值(μS)把Score接口返回的十个等级概率分别乘以对应的数值0/9、1/9……9/9加总起来得到一个介于0到1之间的综合分数代表模型认为命题为真的整体倾向强度。这个μS和Noul的答案高度吻合几乎是一条直线的关系。这说明Score接口内部藏着的真实想法和Noul接口暴露出来的想法其实是一致的都比较接近真实概率。但当作者把μS拿去和Choice的答案对比时图形不再是一条直线了而是呈现出一种S形的、扭曲的曲线。这意味着Score和Choice之间存在一种非线性的映射关系好像有什么东西在中间施加了变形把原本诚实的μS扭曲成了偏向极端的Choice概率。这就好比你测量一个人说话的真实音量是60分贝但通过一个坏掉的麦克风传出来60分贝以下的声音全被压得更小声60分贝以上的又被放得更大声最后你听到的声音完全不是原来那个人说话的样子可是麦克风背后确实有一套规律可循的处理逻辑不是随便乱来的。如果这个麦克风是完全随机地乱调音量你根本没办法从输出反推出说话者原本的音量但正因为它是按照某种固定规律在扭曲你反而有机会通过分析这套规律把原始声音还原出来。正是这个有规律的扭曲让作者想到了一个大胆的假设。**藏起来的第三种答案不是真不是假是我不确定**作者提出了一个理论Jev在内部其实计算的不是一个二元的真假判断而是一个三元的判断包含真、假、还有第三种状态不确定Uncertain简称U。三元潜变量模型假设模型内部真实的概率分布由三部分组成πT真、πU不确定、πF假三者相加等于1。而Choice接口在展示答案时强行把U这部分概率抹掉只把剩下的T和F重新归一化成一个二元分布展示出来。这就像开会投票的时候本来有三个选项赞成、反对、弃权但会议主持人非要说这次只能二选一弃权的票我们按比例分给赞成和反对。如果原本弃权票很少这么分配影响不大。但如果弃权票占了三成那么这套强行分配的规则就会让最终的赞成或反对票数看起来比实际情况更夸张因为那些真正犹豫不决的人的意见被硬塞进了一个他们本来没有明确表态的方向。如果不设这个弃权票选项你永远没办法从最终的投票结果里看出这个会议室里到底有多少人其实是拿不定主意的。那这个πU具体怎么估计呢作者用了一个数学模型πU的估计公式是μS的α次方乘以(1减μS)的β次方再乘以一个缩放系数λ。这个函数形状保证了当μS接近0或接近1模型非常确定是假或非常确定是真时不确定性趋近于0而当μS在中间区域徘徊模型自己也说不清时不确定性达到峰值。这套公式拟合出来的参数是α等于0.530β等于1.011拟合优度R?高达0.834意味着这个简单的三元模型解释了83%以上的Score到Choice之间那种扭曲变形。而且检验λ是否显著大于0的统计检验p值小到2.94乘以10的负44次方这基本可以排除这只是巧合的可能性。**修复之后软准确率从0.771飙到0.978**理论有了接下来就是验证它有没有用。作者用这个拟合出来的函数对Choice的原始答案做了一次反向校正也就是把被扭曲后的答案通过数学上的逆运算还原回它扭曲之前应该是的样子。结果相当亮眼原始Choice的平均软准确率是0.764中位数0.771经过反向校正后平均值涨到0.880中位数涨到0.903。而如果换一种评价方式不是强行还原成一个二元数字而是保留那个不确定区间把答案表示为一个概率区间而不是单一数字效果更加惊艶平均软准确率能达到0.931中位数达到0.978。这个提升幅度不是小修小补。中位数从0.771涨到0.978意味着这个模型原本因为强行二选一而丢掉的信息一旦被找回来几乎能让它的表现逼近完美。**一个价值百万的决策案例三种方案给出三个截然不同的建议**光看数字提升可能还不够有画面感作者举了一个很实际的例子来说明这套理论到底有什么用。设想一个自动化系统要决定是否批准一笔交易或者是否把一封邮件标记为垃圾邮件。系统有三个选择直接认定为真、直接认定为假、或者交给人工审核。判断错了要付出代价100交给人工审核要付出代价45比出错的代价小很多但也不是零成本。假设Jev的原始Choice输出是0.632也就是模型认为这件事有63.2%的概率是真的。用这个数字直接算期望损失认定为真的期望损失是36.8明显低于认定为假的63.2和交给人工的45于是系统会选择直接认定为真。但如果用前面说的反向校正公式把0.632还原回去得到的真实概率其实只有0.400。这时候期望损失变成了认定为真60.0认定为假40.0交给人工45.0系统的最优选择反而变成了认定为假。同一个原始数字两种处理方式得出的是完全相反的决策。如果保留三元表示法模型给出的答案是πT等于0.400πU等于0.367πF等于0.233意味着这件事真实概率落在0.400到0.767这个区间之内跨度相当宽。这时候用一种更保守的决策准则叫Γ-最小最大准则专门用来应对这种不确定性区间很宽的情形计算认定为真的最坏情况损失是60.0认定为假的最坏情况损失是76.7交给人工的损失是45.0这时候最优策略变成了交给人工审核。三种处理同一个原始数字的方式给出了三个不同的行动建议直接认定为真、直接认定为假、交给人工。这个案例赤裸裸地展示出如果你误以为模型给出的那个概率数字是干净、可靠的你可能会在一个高风险决策里做出错误的判断而错误的方向和错误的代价取决于你到底信不信这个数字背后藏着一个没说出口的不知道。**换个问法答案就变Choice接口连自己都说服不了自己**除了不同接口之间的不一致作者还发现了另一个问题同一个接口换一种问法答案也会飘。代表性敏感度(representation sensitivity)指的是同一个潜在概率问题用不同的表达形式比如直接陈述数字、用比例表示、用大白话叙述、用表格呈现、加一些无关的干扰信息问出来模型给出的答案理应保持一致如果不一致就说明模型对文字表达形式这件事本身产生了不该有的敏感反应。作者构造的92个基础问题每个都被渲染成多种等价形式然后测量这些等价形式两两之间的概率差异。结果显示Noul接口最稳定平均两两差异只有0.044Score期望值稍差一点0.066Choice接口的差异是Noul的两倍多达到0.0998SemIf是最不稳定的差异达到0.117。这意味着如果你问Jev这个事件发生的概率是多少用直接陈述的方式问一次用讲故事的方式问一次答案居然会不一样尽管这两次问的其实是完全相同的数学问题。这就好比你去问同一个医生同一份体检报告的诊断结果只是把报告用中文打印一次、用英文打印一次医生给出的诊断居然不一样这显然说明医生的判断里混入了一些和病情本身无关的、和报告呈现方式有关的干扰因素。如果这种敏感性一直存在而没被发现你可能会以为模型的判断很稳固实际上它对措辞的敏感程度远远超出了应该有的范围。**这不是Jev一个人的问题SemIf更糟**值得一提的是作者也测试了一个叫SemIf的开源模型作为对照。SemIf只有Choice这一种问答方式没有Noul和Score可以互相印证结果它的表现全面落后平均软准确率只有0.629而且看图会发现它的失准是全局性的、没有规律的乱来不像Jev那样带着某种可以被数学建模的系统性。这从侧面说明Jev至少还有一套可被理解的内在逻辑虽然它选择不把这套逻辑透明地展示出来。而SemIf的问题可能更接近于纯粹的训练不足或者架构缺陷没有一个清晰的、值得深挖的内部机制。**这项研究没有说死的地方**作者自己也坦白承认了几个局限。首先这套三元不确定性模型只是一种观察性的解释作者反复强调他们证明的是Choice的行为看起来像是把一个更丰富的内部状态强行压缩成了二元输出但这不等于证明Jev内部真的存储着一个明确的第三个概率值。这是一种行为层面的推断不是对模型内部工程实现的确凿证据。其次Score接口的分析只用到了一个简化的统计量十档分布的加权期望值。这个投影方式对于真假程度这种排序型的问题来说是合理的但完整的十档分布里可能还藏着更丰富的信息被这个简化的期望值给平均掉了。再者Sys1Cal-v1目前主要是靠模板化的方式生成句子虽然已经覆盖了直接陈述、比例、叙述、表格、干扰信息等好几种形式但离真实世界里五花八门的自然语言表达还有距离未来的版本理应加入更多语言变体和对抗性的改写。写在后面读完这篇论文最让我意外的一点其实是那个投票分配的类比背后隐藏的逻辑一个模型完全可以在没有明确声明我不知道这个选项的前提下把不确定性悄悄编码进它给出的每一个具体数字里而这种编码方式甚至是有数学规律可循的不是纯粹的噪音。这让我想起一个完全不搭边的场景考试的时候老师说这道题只能选A或B但学生心里明明是我不确定但如果非要选我倾向A多一点。学生最终填的答案和老师后来统计出来的全班选A的比例中间就隔着一层被强行抹去的犹豫。如果老师从来不设不确定这个选项他统计出来的数据看起来会很干净A有60%B有40%可这背后完全可能藏着大量本来想选不确定的学生被强行塞进了A或B里让最终的统计结果比真实情况更极端。作者说的这句话我印象很深Jev心里想的是我不知道但它嘴上不会说它只会用一个偏向某一端的数字来代替这句没说出口的话。这个洞察挺有意思的地方在于它把模型的不透明性这个抽象话题变成了一个可以被具体测量、具体校正、具体量化影响多大的工程问题。你不需要打开模型的黑箱去看它的神经元只需要设计一套巧妙的对照实验让模型自己在不同的问法之间露出马脚。这套方法能不能推广到别的System One模型上或者推广到别的具有多种输出接口的AI系统上这是个值得继续追问的问题。如果一个模型同时提供好几种回答方式它们之间的分歧本身也许就是发现模型内部隐藏结构的一把钥匙。QAQ1Sys1Cal-v1数据集是用来做什么的A它是一个专门测试AI模型概率校准的基准数据集特点是每道题的真实概率是人为构造出来的、完全已知的可以精确检验模型返回的概率数字是否真的准确而不是只看模型选对了没有。Q2Jev的Choice接口为什么表现比Noul和Score差A研究发现Jev可能在内部存在一个被隐藏的第三种状态不确定Choice接口在展示答案时把这部分不确定性强行摊派到真和假两个选项上导致概率被系统性地扭曲夸大尤其在真实概率本就偏高或偏低时更明显。Q3找回Jev隐藏的不确定性之后效果如何A把这部分被抹掉的不确定性还原出来后Choice答案的软准确率中位数从0.771提升到0.978大幅改善了概率校准的准确性说明模型确实存在被压制的第三种判断。