RLCD:用于校准决策的强化学习
大多数现代AI模型被训练得更擅长生成有用的响应。
你问ChatGPT一个问题,它生成一个答案。你向编码模型要Python,它生成代码。你让AI助手总结文档,它生成摘要。
但Jev AI是围绕一个不同的问题设计的。
Jev不是用来生成段落,而是用来进行带有概率的结构化决策。
这需要一个不同的训练目标。这就是 RLCD(校准决策的强化学习)的用武之地。
Jev背后的公司TypeSafe将RLCD描述为用来使Jev的决策不仅有用,而且校准的训练方法。核心思想是附加到决策上的概率应该对应于该决策在许多类似情况下实际正确的频率。
为了理解为什么这很重要,我们首先需要理解RLHF是如何工作的。
1、什么是RLHF?
RLHF代表来自人类反馈的强化学习。
它成为现代对话AI背后最重要的技术之一,因为它帮助将原始语言模型转变为人们真正想要使用的助手。
预训练的语言模型已经知道如何预测下一个token。例如,给定:
法国的首都是
模型可能会给以下内容分配高概率:
巴黎
但仅靠下一个token预测并不能教会模型如何表现得像助手。它不能直接教模型:
乐于助人
遵循指令
不要不必要的冗长
拒绝某些请求
清晰地解释事情
遵循用户的意图
RLHF试图使用人类偏好来改善这些行为。
2、RLHF如何工作
一个简化的RLHF流程如下所示:
预训练的LLM
|
v
监督微调
|
v
生成多个答案
|
v
人类评估者比较答案
|
v
偏好/奖励模型
|
v
强化学习
|
v
对齐的LLM
让我们分解一下。
步骤1:从预训练模型开始
过程从正常的预训练语言模型开始。
该模型通过处理大量文本并学习token之间的模式学会了语言。
然而,在这一点上,它主要是一个下一个token预测机器。
步骤2:监督微调
然后在指令和理想响应的示例上训练模型。
例如:
用户:
向初学者解释光合作用。
助手:
光合作用是植物用来将光能转化为化学能的过程...
模型学会了助手响应的一般结构。
步骤3:生成多个响应
给模型相同的提示并生成几个可能的答案。
例如:
响应A
响应B
响应C
响应D
人类评估者可以比较它们。也许评估者决定:
B > A > D > C
这意味着评估者更喜欢B而不是A,A而不是D,D而不是C。重要的是人类正在提供偏好信号。
步骤4:训练奖励模型
人类偏好用于训练一个单独的模型,称为奖励模型。
它的工作本质上是估计:
"人类会有多喜欢这个响应?"
概念上:
提示
+
响应
|
v
奖励模型
|
v
奖励分数
人类通常喜欢的响应会获得更高的奖励。
人类不喜欢的响应会获得更低的奖励。
步骤5:优化LLM
然后优化语言模型以产生获得更高奖励的响应。
这创建了熟悉的RLHF循环:
生成
↓
评估
↓
奖励
↓
更新
↓
再次生成
随着时间的推移,模型变得更擅长产生人类倾向于喜欢的响应。
这是现代聊天模型通常比原始预训练语言模型更好的对话者的一个原因。
3、但是RLHF有一个问题
RLHF围绕一个重要问题进行优化:
"人类更喜欢哪个答案?"
当输出将被人类阅读时,这非常有用。但当输出不是为人类设计的时会发生什么?想象你正在构建一个需要分类支持票的AI系统。
你不需要:
这似乎是一个计费相关的问题,因为
客户提到了意外费用...
你的软件可能只需要:
{
"category": "billing"
}
更好的是,它可能需要:
billing = 0.94
现在问题改变了。问题不再是:
"哪个答案听起来更好?"
它变成了:
"这个决策有多可靠,概率实际上有意义吗?"
这就是Jev的RLCD方法旨在解决的问题。
4、什么是RLCD?
RLCD 表示:
Reinforcement Learning for Calibrated Decisions,中文:用于校准决策的强化学习。
TypeSafe将RLCD描述为Jev决策导向行为背后的训练方法。目标不是主要优化人类偏好的语言,而是产生伴随校准概率的决策。
校准(Calibrated)这个词是关键。
4.1 "校准"是什么意思?
让我们使用一个简单的天气示例。假设一个天气模型说:
降雨概率 = 80%
这个80%应该意味着什么?
如果我们收集大量模型预测约80%的情况,我们理想情况下应该在大约80%的情况下观察到降雨。
这就是校准。例如:
预测 实际结果
80% 下雨
82% 下雨
78% 不下雨
81% 下雨
79% 下雨
83% 下雨
在足够大且具有代表性的集合中,实际频率应与预测概率近似匹配。
所以:
预测概率 ≈ 观察到的频率
这与简单地问以下问题非常不同:
"模型这次预测对了吗?"
4.2 准确性与校准
这个区别非常重要。想象两个模型。
模型A
准确率 = 90%
置信度 = 99%
它很多预测都是对的,但它过度自信了。
模型B
准确率 = 85%
置信度 = 合理校准
模型B对于自动化系统可能实际上更有用,因为它的概率提供了更有意义的不确定性指示。因此,校准和准确性是不同的属性。
一个模型可以是准确的但校准不良。
一个模型也可以在不高度准确的情况下校准。
这就是为什么Jev的RLCD想法很有趣。目标不仅仅是:
得到正确的答案。
它更接近于:
做出正确的决策
+
正确估计不确定性。
这个区别也很重要,因为模型的概率输出并不自动意味着概率是校准的。对Jev的外部分析指出,截至2026年9月,TypeSafe尚未公开完整的RLCD算法、奖励函数或独立可重现的校准评估。
5、RLHF与RLCD:核心区别
理解区别的最简单方法是:
RLHF
"人类会更喜欢哪个答案?"
versus:
RLCD
"模型应该如何做决策,
它的置信度与现实匹配程度如何?"
因此优化目标是不同的。
重要的一点不是RLCD只是"更好的RLHF"。
它们解决不同的问题。
5.1 RLHF优化响应
考虑这个提示:
解释为什么天空是蓝色的。
可能有许多有效的响应。一个答案可能是:
天空看起来是蓝色的,因为大气中的分子
更强烈地散射较短波长的阳光...
另一个可以用不同的风格解释相同的概念。人类可能更喜欢一个,因为它是:
更清晰
更短
更吸引人
结构更好
RLHF很有用,因为人类可以判断这些质量。奖励基于响应的质量和偏好。
5.2 RLCD优化决策
现在考虑一个完全不同的问题。你收到这个支持票:
"我这个月被扣了两次订阅费。
请退还多扣的付款。"
应用程序问Jev:
票类别是什么?
billing
technical
refund
account
other
模型可能返回概念上像这样的内容:
refund = 0.94
billing = 0.05
technical = 0.01
account = 0.00
other = 0.00
应用程序现在可以使用该信息。例如:
if refund_probability > 0.90:
route_to_refund_workflow()
elif refund_probability > 0.60:
request_human_review()
else:
route_to_general_support()
模型不是因为写出漂亮的解释而获得奖励。
它被优化用于做出有用的决策并提供有意义的概率。
5.3 为什么置信度如此重要
这就是RLCD对AI智能体特别有趣的地方。假设一个AI智能体需要在三个工具之间选择:
搜索
数据库
Python
模型可能返回:
搜索 = 0.96
数据库 = 0.03
Python = 0.01
应用程序可能会自信地将任务路由到搜索。但考虑另一个请求:
搜索 = 0.39
数据库 = 0.35
Python = 0.26
现在系统知道决策是不确定的。
它可以询问另一个模型。
它可以询问用户。
它可以将请求发送给人类。
或者它可以运行多个工具。
这创建了一个强大的模式:
高置信度
↓
自动化
中等置信度
↓
验证
低置信度
↓
人类/更强的模型
如果你的模型只是返回自由文本,这很难可靠地实现。
6、为什么常规LLM概率不够
有人可能会问:
"但LLM已经计算概率了。为什么我们需要RLCD?"
这是一个非常重要的问题。正常的语言模型内部产生token概率。
例如:
法国的首都是
巴黎 0.98
伦敦 0.01
柏林 0.005
罗马 0.005
但这些是下一个token的概率。它们不是应用程序业务决策的自动校准概率。
模型也可能产生:
客户可能是在要求退款。
可能这个词没有提供软件可以直接使用的可靠概率。相反,Jev的架构使决策本身成为一等输出。
TypeSafe将Jev描述为接受非结构化状态加上类型化问题,并返回带有校准概率的结构化决策。
7、Jev改变输出格式
正常的LLM大致这样工作:
输入
↓
Token预测
↓
Token预测
↓
Token预测
↓
Token预测
↓
文本
然后应用程序需要提取有用的信息。
Jev采取不同的方法:
状态
↓
类型化问题
↓
决策
+
概率
例如:
状态:
"客户说他们的付款被扣了两次。"
问题:
这是计费问题吗?
输出:
true
probability = 0.96
或者:
问题:
紧急程度是什么?
输出:
4 / 5
confidence = 0.91
Jev当前的文档描述了三种基本决策类型:Choice、Score和Noul,允许应用程序在模型回答之前定义输出结构。
8、RLCD不仅仅是"更多置信度"
有一个重要的误解需要避免。
RLCD不意味着:
"让模型更自信。"
那实际上会很危险。
目标更接近于:
让置信度与现实对应。
考虑两个预测。
预测A
答案:YES
置信度:99%
和:
预测B
答案:YES
置信度:62%
如果两者都错了,仅仅让第一个模型更自信并不能改进系统。校准的模型应该学会何时有强有力的证据,何时没有。
换句话说:
高置信度 → 强有力的证据
低置信度 → 不确定性
目标不是最大置信度。目标是有意义的置信度。
9、RLCD和Brier分数
如果你想了解校准的技术方面,一个重要的概念是Brier分数。
Brier分数通常用于评估概率预测。对于二元预测,一个简化的版本是:
Brier分数 = (预测概率 - 实际结果)²
假设模型预测:
P(下雨) = 0.90
而实际上下雨了:
实际 = 1
那么:
(0.90 - 1)²
= 0.01
这是一个小错误。现在假设模型预测:
P(下雨) = 0.90
但没有下雨:
实际 = 0
那么:
(0.90 - 0)²
= 0.81
这是一个大得多的错误。
这很有用,因为它不仅关心模型是对是错。它还关心模型有多自信。
一些对RLCD的外部描述将其与适当的评分规则(如Brier分数)联系起来,但TypeSafe尚未公开足够的技术细节来独立确定用于训练Jev的确切奖励函数。
因此,区分校准的一般数学和Jev的RLCD系统的具体实现非常重要。
10、RLHF与RLCD的简单示例
假设我们给AI以下任务:
客户:
"我被扣了两次订单费。
请修复这个问题。"
10.1 RLHF风格的输出
模型可能会生成:
很抱歉您被扣了两次。
这似乎是一个重复的计费问题。我建议
检查您的付款历史并联系支持,以便
退还重复的费用。
人类可以阅读并决定:
有帮助
清晰
礼貌
相关
这正是偏好优化有意义的环境。
10.2 RLCD风格的输出
Jev可能会被问到:
意图:
billing
refund
technical
account
other
紧急程度:
1–5
需要人类:
true / false
概念上:
意图:
refund
P = 0.94
紧急程度:
4
P = 0.87
需要人类:
false
P = 0.91
现在输出不是为人类阅读设计的。它是为软件执行设计的。
RLHF关于人类偏好
RLHF回答诸如以下问题:
哪个答案更有帮助?
哪个答案更清晰?
哪个响应更好地遵循指令?
哪个响应听起来更自然?
用户会更喜欢哪个响应?
这使得RLHF特别适用于:
聊天机器人
写作助手
编码助手
AI导师
面向客户的AI
创意AI
人类是评估循环的一部分。
11、RLCD关于决策可靠性
RLCD针对诸如以下问题:
这个分类有多可能正确?
系统应该有多自信?
这个请求应该自动路由吗?
这个交易应该审查吗?
这个AI响应应该阻止吗?
应该调用另一个模型吗?
应该由人类接管吗?
这使得这个概念特别相关于:
AI智能体
工作流自动化
欺诈检测
内容审核
路由
排名
验证
安全系统
实时应用
Jev本身明确定位用于工作流路由、实时系统、特征提取和AI安全/防护栏。
12、RLCD与RLHF与RLVR
实际上有第三个值得理解的概念。
它叫做RLVR(带可验证奖励的强化学习)。
这三个可以简化为:
RLHF
人类说:
"这个答案更好。"
RLVR
验证器说:
"这个答案是正确的。"
RLCD
结果说:
"你的80%概率应该对应
大约80%的实际正确性。"
所以:
RLHF → 偏好
RLVR → 可验证的正确性
RLCD → 校准的决策
13、为什么RLVR不能解决一切
当正确性可以自动验证时,RLVR工作得非常好。
例如:
2 + 2 = 4
容易验证。
或者:
这段代码通过测试套件了吗?
同样,容易验证。
但考虑:
这个客户生气了吗?
或者:
这个支持票应该升级吗?
或者:
这个响应有风险吗?
可能没有一个简单的编程验证器给你一个客观正确的答案。
这就是校准决策变得有趣的地方。
系统不需要完美的自动验证器,而是可以专注于产生概率上有意义的决策。
14、为什么RLCD对AI智能体很重要
随着AI智能体变得更加自主,这变得更加重要。想象一个有十个可用工具的智能体。
对于每个任务,它必须决定:
哪个工具?
什么行动?
我应该继续吗?
我应该停止吗?
我应该询问用户吗?
我应该升级吗?
如果每个小决策都需要一个巨大的推理模型,系统可能会变得:
缓慢
昂贵
复杂
难以控制
快速的决策模型可以潜在地处理较小的决策。架构变成:
用户
|
v
生成式LLM
|
v
复杂推理
|
v
Jev
|
┌────────┼────────┐
v v v
工具A 工具B 人类
LLM处理语言和复杂推理。Jev处理快速结构化判断。传统软件执行操作。
15、最大的区别:谁消费输出?
这可能是记住RLHF与RLCD的最简单方法。
如果输出主要被人类消费,那么优化人类偏好非常有意义。
如果输出主要被软件消费,那么结构化决策和校准概率变得更加重要。
因此区别可以总结为:
RLHF
AI → 人类
RLCD
AI → 软件
当然,这是一个简化。真实的生产系统可以结合两种方法。
16、RLCD不会使Jev万无一失
这是一个重要的观点。校准的概率不意味着每个预测都是正确的。假设模型输出:
refund = 90%
这并不意味着:
"这个特定的预测保证是正确的。"
校准通常在预测组上进行评估。
如果一个模型在90%左右正确校准,那么在许多约90%置信度做出的预测中,观察到的正确率应该约为90%。这是一个统计属性,不是对单个决策的保证。
17、另一个重要限制
关于Jev的RLCD训练的确切内部,我们仍然有很多不知道的。
TypeSafe已经描述了RLCD的目标和定位,但截至2026年9月,独立消息来源指出,该公司尚未发布完整的技术论文,详细说明架构、奖励函数、训练过程和完整的校准方法。
这意味着我们应该区分:
TypeSafe声称的内容
和:
独立重现的内容
校准的概念本身在机器学习中已经确立。Jev的RLCD的确切实现基本上仍然是专有的。
18、为什么RLCD可能很重要
AI行业花费了大量精力使模型更擅长生成。但现实世界的软件并不总是需要生成。
有时它需要一个决策。
路由这张票。
批准这个请求。
拒绝这个请求。
调用这个工具。
升级这个案例。
这个内容安全吗?
这个交易可疑吗?
应该调用另一个模型吗?
这些与写文章根本不同。
Jev的方法基于这样一个理念:AI模型应该专门为这些决策工作负载训练,而不是强迫通用语言模型生成文本,然后让软件解释它。
19、未来:生成模型 + 决策模型
最有趣的可能不是:
RLCD取代RLHF。
它是:
RLHF + RLCD
未来的AI应用可能看起来像这样:
用户
|
v
┌─────────────────┐
│ 生成式 │
│ LLM │
└────────┬────────┘
|
复杂推理
|
v
┌─────────────────┐
│ Jev │
│ RLCD │
└────────┬────────┘
|
结构化决策
|
┌───────────┼───────────┐
v v v
工具 数据库 人类
生成模型处理语言。
决策模型处理快速判断。
应用程序处理确定性业务逻辑。
这是一个与以下内容非常不同的架构:
一切 → 一个巨大的LLM
20、最后的思考
RLHF和RLCD围绕不同的目标构建。
RLHF问:
人类更喜欢什么响应?
RLCD问:
系统应该做什么决策,它的置信度是否对应其实际表现?
这个区别在纸面上看起来可能很小,但它改变了AI可以如何集成到软件中。
使用RLHF,模型被优化成为更好的助手。
使用RLCD,Jev被定位为更好的决策引擎。
当AI不再是人类简单聊天的东西,而是开始成为自动做出成千上万或数百万决策的基础设施时,这个区别变得极其重要。
有趣的未来可能不是一个AI模型做所有事情。
它可能是专门模型的组合:
LLM
→ 生成和推理
RAG
→ 检索知识
RLCD模型
→ 做出校准的决策
传统代码
→ 执行确定性规则
这也许是Jev背后最有趣的想法。
AI的未来可能不是让每个模型说更多话。它可能是教一些模型何时简单地做出决定。
汇智网翻译整理,转载请标明出处