Jev:不说话的语言模型

Jev不是一个写文章、生成代码或解释自身的模型,它返回的是一组决策和概率,普通代码无需解析任何内容即可使用。

Jev:不说话的语言模型
梯形图转SCL | 需求文本转SCL | 梯形图在线查看 | 博途编程文档MCP | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace

Jev 的有趣之处不在于价格,尽管那有望成为游戏规则的改变者。有趣之处在于,生成语言可能是模型与必须对其采取行动的软件之间的错误接口。我认为这已经是 2026 年 AI 领域最有趣的发展之一。

TypeSafe 构建了一个无法写文章、生成代码或解释自身的模型。输出是无限量的,因为几乎没有什么输出。返回的是一组决策和概率,普通代码无需解析任何内容即可使用。

这就是卖点;他们正在出售这种局限性。

这个模型叫做 Jev。TypeSafe 称其为"一号系统"模型,使用他们称之为"校准决策强化学习"(RLCD)的方法进行训练。你给它一个共享状态和几个类型化的问题。它返回选择、分数和概率分布。没有对话式答案需要解释,也没有需要在应用根据结果分支之前剥离的理由。

显而易见的标题是更便宜、更快的 AI,发布邀请了这一点。更重要的是关于架构的理念。也许可靠的自动化需要构建在软件内部做出有界判断的模型,而不是包裹在模型开放式对话周围的软件。目前处于选择性早期访问阶段。他们的页面上有等待名单和 Discord。

1、字符串的隐性税

作为软件工程师,我一直对字符串有着爱恨交加的关系,但这次略有不同。以一个需要知道客户是否在要求退款的支持系统为例。使用生成式模型时,应用提出一个问题,返回文本或 JSON,验证它,然后将其转化为程序中的一个分支。结构化输出使这种安排不那么痛苦,但底层的接口仍然是生成式的。应用需要一个决策。模型产生代表决策的令牌,应用必须信任这个表示。

Jev 从决策空间开始。API 暴露了三个原语:Choice 从声明的替代方案中选择,返回它们的概率加置信度值。Score 评估有序的描述性级别,返回连续分数、分布和置信度。Noul 评估一个二元命题,返回其为真的概率。你可以在一个请求中针对同一状态组合这三个原语。

因此,一个支持工作流可能会询问客户的意图、他们的挫败程度以及是否要求退款。然后代码应用退款政策、路由工单或升级它。模型提供语义判断但不拥有政策。

TypeSafe 表示这些问题独立并行评估,随着问题数量增加几乎没有额外延迟。我希望由 TypeSafe 以外的人来衡量这一点,但如果成立,它将改变编程模型。你将一个宽泛的任务分解为狭窄的判断,然后在可读的代码中显式组合结果。不是要求模型"处理这个客户",而是指定必须理解什么以及之后发生什么。决策、阈值和后果成为应用的可见部分。

2、谁与什么

提出这个论点的人是 Diogo Almeida,他有着极高的信誉。他帮助构建了在使对话助手更加对齐和有用方面发挥基础性作用的训练方法。

这位 TypeSafe 创始人是 InstructGPT 论文的平等贡献主要作者,并为 GPT-4 做出了贡献。这比该公司在 X 上一些炒作材料中的"ChatGPT 联合发明者"定位更准确,这给了他的批评以分量,而没有将集体努力坍缩为一个人。

他的论点区分了三个目标:

  • 基于人类反馈的强化学习(RLHF)针对人类偏好进行优化。
  • 基于可验证奖励的强化学习(RLVR)针对可检查的结果进行优化。
  • (新!)RLCD 应该优化决策,使其概率与正确发生的频率相匹配。

这种区分是实际的,我原本以为它是学术性的。助手可以给出人们喜欢的答案,而不给软件任何可靠的决策基础来决定何时采取行动。自动化需要能够指导行为的不确定性,而令人安心的语言并非如此。这一直是使用 LLM 的"乐趣"之一。然而,Almeida 的发布前论点是,不同的训练目标应该产生不同的 API,而 Jev 就是这个论点作为产品的样子。

"一号系统"是 TypeSafe 的类别,换句话说,这是一个新想法。我会将其描述为一个学习的语义分支指令,一个处理模糊判断的组件,而确定性代码保持对执行的控制。很酷。

3、什么是校准?

校准(Calibration)在此上下文中有特定含义。在许多预测中,模型分配 80% 的概率为正确,大约 80% 应该是正确的。

这是关键点:它描述的是预测群体。它不告诉你某个特定答案是否正确。

你可能在想它也没有建立有用性。你是对的。一个总是预测基准率的模型可以完美校准,但对任何个体决策都没有贡献。准确性仍然重要,区分简单情况和困难情况的能力也是如此。

Jev 增加了一个曲折。对于 Choice 和 Score,单独的置信度值源自返回分布的形状。集中的分布意味着更高的置信度。TypeSafe 没有说使用哪个统计量。仅凭集中度并不能证明预测在你的特定部署中值得信任。

我知道这有点复杂,但我正在根据二手资料工作,并试图运用我的领域知识将其平滑成一个不过度宣称的预览。截至 2026 年 9 月 15 日,TypeSafe 已经描述了 RLCD 的目标,但没有发布足够内容供任何人将其作为算法进行评估。奖励函数、架构、训练过程和校准方法都未公开。没有发布的校准曲线,也没有独立可复现的论文。

值得澄清的是:用于校准的强化学习也不是新的。像"Rewarding Doubt"这样的工作已经在探索奖励模型的校准置信度。可能使 Jev 脱颖而出的是整个包装:没有开放式生成、类型化分布作为原生输出,以及围绕并行决策组织的产品。

我并非暗示这削弱了 Jev,将实验和研究从实验室转化为人们愿意付费的产品,在这个领域对许多人来说一直是一个挑战。即使是大公司也在与"代币经济学"和计算基础设施短缺作斗争,使许多 AI 事业无利可图或受制于延迟问题。我亲身经历过这一点。Jev 似乎将这些改变了几个数量级。说真的。

4、数字说明什么

TypeSafe 的内部评估涵盖四个工作流:安全事件响应、代理跟踪可观察性、发票处理和客户服务。

在这四个中,Jev 平均与参考答案的一致率为 67.8%,据报道每个案例 0.0004 美元和 0.4 秒。标记为 GPT "Terra" 的比较达到了 67.9%,价格为 0.0304 美元和 10.1 秒。Claude Sonnet 5 也达到了 67.8%,但报告的成本和延迟明显更高。

这些是实验中令人惊讶的数字。它们并非 Jev 在每个决策任务上都匹配最强模型的证据,因为它没有。GPT "Sol" 达到了 74.1% 的总一致率,Claude Opus 5 达到了 73.1%。发票处理的差距最大,Jev 为 61.8%,而 Sol 为 79.1%。如果错误代价高昂,这种质量差异可能比推理账单重要得多。

方法论也限制了"一致"在此处的含义。参考标签来自在高推理设置下对 GPT-6 Astra 和 Claude Fable 5.1 的平均,而不是来自独立的操作地面真相。TypeSafe 设计了工作流并承认可能存在设计偏差。其最大的宣传速度和成本优势被描述为可能接近你在现实世界中看到的上限。

站得住脚的结论虽然狭窄但真实。Jev 在选定的决策工作流上以低得多的测量价格和延迟表现具有竞争力。评估并未建立概率校准、一般智能或生产可靠性。

还有一个结果值得关注。在四项任务中平均而言,每个比较模型在被置于显式工作流中而不是通过一个提示执行整个策略时,都变得更快、更便宜、更准确。在实验证明 Jev 之前,它首先证明了分解的论点。

一个有效的答案仍然可能是错误的。TypeSafe 关于 Jev "不会产生幻觉"的说法需要严格限定。

当可能的输出预先声明时,模型无法发明未声明的字段或产生格式错误的输出。这消除了真实的一类集成故障。但它无法阻止模型选择错误的选项、误读证据或将不合理的高概率分配给错误答案。Jev 约束了输出的形状。它不约束判断。

设计不良的模式会使情况更糟。当正确答案不在选项中时,概率仍然必须落在剩余选项中的某个地方。开发人员需要真正的"未知"、"以上都不是"和"证据不足"路径,而不是假设不确定性总是会宣布问题。

校准还取决于部署分布。更改的政策、不熟悉的客户、新的欺诈模式或对抗性输入可能会悄悄破坏上个月可靠的概率。单个校准的判断在通过阈值、权重和分支运行后,不会自动组合成校准的工作流。相关错误在组合中存活。

所以业务问题是你在特定操作的有用自主覆盖级别上留下多少错误率。路由帮助请求和授权不可逆转的交易不应共享置信度阈值。

5、工具变得更重要,而不是更少

对于代理工程,Jev 最强的预期角色是代理周围的控制层:选择工具、评估跟踪、检测循环、检查完成以及决定何时升级。

这意味着分工。生成式模型起草、计划或解释。Jev 提供有界的语义判断。代码处理状态、算术、策略、权限和副作用。人类处理模糊或高风险的案例。智能分散在整个系统中,而不是信任一个对话循环。

经济学可以使这在更多地方变得可行。TypeSafe 公布的早期访问价格是每百万输入令牌 0.042 美元,输出不限量。发布材料报告响应时间在 70 到 500 毫秒范围内。两者都是提供商报告的,销售价格对可持续服务成本或在生产负载下的行为没有任何说明。

尽管如此,设计含义是真实的。当语义检查足够便宜和快速时,应用可以负担得起很多:在每次工具调用周围、每个跟踪中、每个重要操作之前。这个名称是对杰文斯悖论的致敬,即提高资源效率会增加其总使用量。TypeSafe 押注于更多的机器判断,而不是更便宜的聊天机器人调用。

权衡不会消失。仅概率接口不提供解释。需要证据、申诉或调试的系统必须保留支持信息或附加解释层。阈值可能最终与一个模型版本的分布耦合。工具具有更明确的责任,这与"只调用模型"的人所希望的相反。

6、举证责任

Jev 需要在决策质量、分布偏移下的校准以及随问题数量增长的延迟方面进行独立测试。评估者应该测量整个工作流,包括后备模型和人工审查,而不是将一个廉价的 API 调用视为成本单位。

在此之前,Jev 最强的案例是架构性的而非算法性的。它提出语言生成不再是智能与软件之间每次遭遇的默认接口。有些任务需要一段话。其他任务需要一个有界决策、可用的不确定性以及接下来发生什么的明确说明。

RLCD 是否能实现这一点尚未得到证明。产品提出的问题仍然是一个好问题:如果我们不要求每个智能组件都说话,AI 能变得多么可靠?


原文链接:  Jev: The Language Model That Won't Talk

汇智网翻译整理,转载请标明出处