Laya:Jev AI 开源平替
Jev展示了专业化决策模型的理念。Laya正在采取类似的方向,同时提供开源实现、多个检查点、多语言支持、类型化决策和专门的RLCD训练方法。
梯形图转SCL | 自然语言生成梯形图 | 自然语言生成SCL | 梯形图在线查看 | 博途编程文档MCP | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace
LLM非常强大,但并非每个AI问题都需要一个生成段落文本的模型。考虑一个简单的客户支持工作流程。
客户发送一封电子邮件,我们需要回答三个问题:
应该由哪个部门处理?
问题有多紧急?
客户取消订阅的概率是多少?
传统LLM可以通过生成如下文本来解决这个问题:
Department: Billing
Urgency: High
Churn Risk: 0.82
但这里有一个根本性问题。
系统必须先生成文本,然后另一层软件必须将该文本解析为结构化数据。
Laya采用了完全不同的方法。
Laya是一个多语言、非自回归的系统1决策模型,专门设计用于结构化决策。它不生成文本,而是接受文本、电子邮件、支持工单或JSON等状态,并返回带有概率的类型化答案。
根据其模型卡,Laya可以在单次前向传播中执行这些决策,在Tesla T4上单个问题的延迟约为33毫秒。
这使它直接进入了与TypeSafe Jev相同的对话领域,后者围绕快速、结构化的AI决策设计,而非传统文本生成。
1、什么是Laya?
Laya是Convai Innovations开发的开源决策模型。关键思想很简单:
当你只需要一个决策时,不要使用生成式LLM。
Laya不请求LLM生成答案,而是接收状态和一组类型化问题。例如,想象一个支持工单:
{
"subject": "Duplicate charge on invoice 4411",
"body": "We were billed twice for March. Please refund the duplicate."
}
然后你可以定义如下问题:
{
"department": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "invoices, payments, refunds",
"technical": "bugs and outages",
"sales": "pricing"
}
},
"urgency": {
"type": "score",
"instructions": "How urgent is this?",
"criteria": [
"not urgent",
"soon",
"blocking"
]
},
"churn_risk": {
"type": "noul",
"instructions": "Does the user threaten to cancel?"
}
}
模型然后返回结构化答案,而不是生成自然语言响应。
这使得Laya对AI代理、路由系统、审核管道、支持自动化和其他输出需要直接被软件消费的应用特别有趣。
2、Laya不生成文本
这可能是理解Laya最重要的事情。Laya不是另一个ChatGPT风格的LLM。
它不尝试生成解释、写电子邮件或产生段落。相反,它执行决策。
模型卡将其描述为非自回归系统1决策模型。它在单次前向传播中返回类型化答案和概率。由于它不生成文本,因此也没有需要事后解析的生成文本。
当应用程序已经知道它需要什么样的答案时,这种架构非常有用。例如:
Input
↓
Customer ticket
↓
Laya
↓
Department = Billing
Urgency = Soon
Churn Risk = 0.12
与生成式LLM比较:
Input
↓
Customer ticket
↓
LLM
↓
Generated explanation
↓
Parser
↓
Validation
↓
Structured JSON
第二种方法可以工作得非常好,但它引入了额外的生成和解析开销。Laya旨在移除这一层。
3、三种决策类型
Laya目前暴露三种重要的问题类型。第一种是选择。当系统需要从预定义集合中选择一个选项时可以使用。
例如:
Which team should handle this?
Billing
Technical
Sales
Laya返回选定的选项以及概率和置信度。第二种是评分。当答案存在于序数尺度上时可以使用。例如:
How urgent is this?
Not urgent
Soon
Blocking
第三种是noul,它代表陈述是否为真的校准概率。例如:
Is this customer threatening to cancel?
Probability = 0.82
这三个原语使Laya更像一个决策引擎,而不是聊天机器人。
4、Laya背后的架构
基础Laya模型使用ModernBERT-large作为其骨干。该架构总共包含约4.21亿参数。
模型卡描述架构为:
- ModernBERT-large骨干,3.95亿参数
- 从头训练的决策头
- 2个Transformer层
- 选项标记评分器
- 激活/升级头
- 总计4.21亿参数
与具有固定类别集合的传统分类模型不同,Laya在请求时定义答案空间。这是一个重要的设计选择。
对于选择问题,每个选项都有自己的标记并被独立评分。然后对结果分数进行跨选项归一化。这意味着你可以定义新的决策模式,而无需为每组新标签重新训练模型。
5、Laya有多个检查点
Laya实际上是一个检查点家族,而不仅仅是一个模型。主要检查点是:
convaiinnovations/laya
它使用ModernBERT-large,专为英语设计。还有:
convaiinnovations/laya-multilingual
它使用mmBERT-base,专为100+种语言设计。第三个检查点是:
convaiinnovations/laya-typed-decisions
它基于ModernBERT-large,专门用于类型化决策工作流。你可以直接使用Python加载它们:
import laya
laya.load("convaiinnovations/laya")
对于多语言应用:
laya.load(
"convaiinnovations/laya",
subfolder="multilingual"
)
对于类型化决策工作流:
laya.load(
"convaiinnovations/laya",
subfolder="typed-decisions"
)
6、Laya可以自动路由请求
一个有趣的功能是路由器。
路由器可以自动选择适当的检查点来处理每个请求,而不是手动决定。
from laya import Router
router = Router()
router.predict(
{"body": "I was charged twice"},
questions
)
对于英语请求,它可以使用英语检查点。
例如:
"I was charged twice"
↓
Router
↓
Laya
非英语请求可以路由到多语言检查点。
"मुझसे दो बार शुल्क लिया गया"
↓
Router
↓
Laya Multilingual
路由器也可以在需要时显式选择类型化决策模型。这对于接收混合语言流量的生产系统非常有用。
7、为什么Laya如此快速?
Laya与传统生成模型之间最大的区别是Laya是非自回归的。生成式LLM通常顺序产生token。
例如:
Token 1 → Token 2 → Token 3 → Token 4 → ...
每个生成的token都成为产生下一个token过程的一部分。Laya不需要逐个token生成段落。相反,模型在单次前向传播中处理输入和决策问题。
已发布的T4基准测试报告:
1 question → 39.5 ms
10 questions → 158.6 ms
50 questions → 771 ms
对于多语言检查点,报告的数字甚至更低:
1 question → 32.8 ms
10 questions → 72.3 ms
50 questions → 337 ms
多语言模型在批处理时可达到约每秒103-332个问题。这就是该模型对高容量AI基础设施特别有趣的地方。
8、Laya vs TypeSafe Jev
Laya模型卡直接将该系统与TypeSafe Jev进行了比较。
根据已发布的比较,Jev 1.13.0的单个问题p50延迟约为236-276毫秒,而路由Laya在引用的基准测试中报告32.8毫秒。
相同的比较报告:
Jev p50 latency: 236–276 ms
Laya p50 latency: 32.8 ms
因此Laya模型卡在此次比较中报告了大约7.8倍更低的延迟。然而,有一个重要的限定条件。
Laya作者表示,Jev数字是第三方发布的测量结果,不是Laya团队直接测量的。他们还指出样本大小和提示不同。因此这些数字应被视为已发布的比较,而不是完全受控的头对头基准测试。
9、准确性和校准
只有当决策可靠时,速度才有用。这就是Laya围绕概率的设计变得重要的地方。
该模型使用RLCD,校准决策强化学习。
RLCD不是简单地奖励最终类别是否正确,而是围绕概率质量设计的。模型基于严格适当的评分规则获得奖励,包括对数分数和球形分数,对于序数问题使用排序概率评分。
基本思想是:
Correct prediction + honest probability
↓
Higher reward
如果模型有80%的置信度,训练目标鼓励该概率实际上在相关分布上对应约80%的正确性。
训练使用带组均值基线的REINFORCE,作者描述为GRPO风格,多轮对话使用TD(λ=1.0)在前缀切片上。
10、Laya发布的基准测试结果
类型化决策检查点在400个用例上进行了评估,包含四个工作流中的2000个决策。laya-typed-decisions报告的准确性为:
Overall accuracy: 0.766
Soft accuracy: 0.471
Brier score: 0.062
ECE: 0.213
Score MAE: 0.242
四个工作流包括:
发票处理
安全事件
客户服务
代理跟踪可观察性
模型卡报告工作流准确性分别为0.804、0.766、0.764和0.730。有趣的是,作者还报告微调后的检查点在此基准测试中清除了规定的教师上限。
但这里有一个重要的细节。
基础Laya检查点在此特定类型化决策基准测试上的表现明显较差。作者明确表示能力来自微调,Laya应被视为快速专业化基础,而不是通用的强零样本决策引擎。
11、Laya不是完美的零样本模型
这可能是开发者应该理解的最重要的限制。模型卡报告基础Laya模型在其类型化决策基准测试上的准确性为0.362,而多数类别基线为0.461。
微调后的检查点达到0.766。这是一个巨大的差异。换句话说,下载基础模型并立即期望它执行专家级结构化决策不是作者推荐的。
预期的工作流更接近:
Laya base model
↓
Your domain data
↓
Fine-tuning
↓
Specialized decision model
↓
Production
这使得Laya作为构建小型专业化决策模型的基础特别有趣,而不是作为LLM的通用替代品。
12、校准仍需改进
另一个重要的限制是校准。模型卡报告温度重新拟合可以将平均ECE从约0.466降低到0.081。
这意味着开发者不应该盲目信任模型返回的原始概率。如果你的应用基于概率阈值做出决策,使用自己的数据进行校准变得很重要。
例如,欺诈系统可能有这样的规则:
Risk > 0.90
↓
Manual investigation
如果模型的概率校准不良,该阈值可能不是你认为的意思。
因此Laya提供概率输出,但生产系统仍应根据自己的真实世界数据验证这些概率。
13、多语言支持有趣但不完美
Laya提供了一个覆盖100+种语言的多语言检查点,但基准测试结果显示多语言性能差异显著。在跨51种语言的MASSIVE意图基准测试上,模型卡报告宏平均准确性为0.227,宏ECE为0.733。
对于某些语言,性能要弱得多。作者特别报告高棉语在引用的评估中达到0.000准确性,0.952置信度。
这是一个重要的警告。模型说:
Confidence = 95%
并不自动意味着预测在每种语言和领域都可靠。
14、还有实际约束
Laya的选择问题理想情况下应保持在约20个选项以下。模型使用固定的选项预算,非常大的标签空间会减少每个选项的可用信息量。对于更大的决策空间,作者建议将决策分解为多个阶段。
例如:
Step 1
Which category?
Billing
Technical
Sales
Other
↓
Step 2
Which billing issue?
Refund
Duplicate charge
Payment failure
Invoice problem
这种分层方法可以使大型分类问题对模型更容易。根据报告的基准测试,评分原语目前也是三个原语中最弱的。
15、Laya vs 传统LLM
差异可以概念性地总结。传统LLM主要设计用于回答:
"What should I say?"
Laya设计用于回答:
"What decision should the application make?"
这种区别很重要。如果你想写博客文章、总结文档或生成Python代码,LLM仍然是适当的系统类型。
但如果你需要处理数百万工单并确定:
department
priority
risk
intent
escalation
confidence
专业化决策模型可以是一个非常不同的架构。
你不需要为token生成付费、解析生成的文本和运行大型模型,而是可以使用更小的专业化模型作为决策层。
16、Laya是开源的
与TypeSafe Jev的另一个主要区别是许可。Laya仓库在Apache 2.0许可下发布。
模型卡列出了主仓库、PyPI包和Hugging Face演示作为访问项目的主要方式。与现代生成模型相比,模型本身也相对较小。Hugging Face列表报告主模型约4亿参数。
这使得该项目对希望在本地试验专业化决策模型或将其集成到自己基础设施中的开发者特别有趣。
17、如何安装Laya
入门很简单。安装Python包:
pip install laya
然后加载模型:
import laya
agent = laya.load("convaiinnovations/laya")
然后你可以将应用程序状态和决策模式传递给predict()。
result = agent.predict(
{
"subject": "Duplicate charge on invoice 4411",
"body": "We were billed twice for March. Please refund the duplicate."
},
{
"department": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "invoices, payments, refunds",
"technical": "bugs and outages",
"sales": "pricing"
}
}
}
)
输出可以直接被应用程序消费,而不是解析生成的自然语言文本。
18、Laya可以用在哪里?
Laya的架构使其对几个生产工作负载非常有趣。
客户支持是一个明显的例子。每个传入的工单在到达人工代理之前都可以进行部门、紧急程度和升级风险分类。
它也可以用于路由AI代理请求。轻量级决策模型可以确定哪个代理、模型或工作流应该处理请求,而不是将每个请求发送到昂贵的大型模型。
其他潜在应用包括:
- 客户支持路由
- 工单分类
- 欺诈和风险决策
- 安全事件分类
- 内容审核
- 提示注入检测
- AI代理路由
- 工作流自动化
- 升级决策
- 结构化业务决策
共同模式很简单:应用程序需要决策,而不是段落。
19、Laya可能代表AI的不同方向
Laya有趣的部分不仅仅是它是另一个4亿参数模型。更大的思想是架构性的。AI行业投入了大量精力让模型生成越来越好的文本。
但许多企业AI应用实际上不需要更多文本。
它们需要:
Classification
Routing
Scoring
Confidence
Risk
Escalation
Decision
对于这些工作负载,小型非自回归决策模型可能比大型生成模型更高效。这就是与TypeSafe Jev的竞争变得有趣的地方。
Jev展示了专业化决策模型的理念。Laya正在采取类似的方向,同时提供开源实现、多个检查点、多语言支持、类型化决策和专门的RLCD训练方法。
已发布的Laya基准测试也报告了比引用的第三方Jev测量低得多的延迟,尽管作者自己指出比较不是受控的同类评估。
20、最后的思考
Laya并不试图成为另一个ChatGPT。而这正是它有趣的地方。
它是一个小型、专业化、非自回归的决策模型,旨在位于应用程序工作流中并快速做出结构化决策。
该架构特别有趣,因为它将决策与语言生成分离。
不是问:
"Generate a response telling me what to do."
你可以问:
"Choose the department."
"Score the urgency."
"Estimate the probability."
"Should this be escalated?"
并直接获得结构化输出。
同时,当前的基准测试显示Laya不应被视为通用的强零样本模型。其最强大的已发布类型化决策结果来自微调,而多语言校准和一些决策原语仍然有重大限制。
然而,这个更大的思想值得关注。
也许AI应用的未来并不总是更大的LLM。有时,它是一个更小的模型,只是做出正确的决策
原文链接:Laya : Bye Bye TypeScript Jev AI
汇智网翻译整理,转载请标明出处