☰
【Jev】Jev模型和Laya架构
2026/9/30 7:16:32 网站建设 项目流程

note

  • 在无法解决确定性的场景面前:快没有太大的意义,省钱也没太大的意义,jev只是一个零样本条件下的排序/分类模型,还是概率【不确定性】。本质上还是猜【单单地猜的更快、更准些】,0-1而非 0/1【不保真】
  • TypeSafe AI 也在 Jev 1.13 的能力说明中提醒,模型在算术、计数、日期、字面匹配、无关信息干扰、对抗性输入和矛盾条件等任务上表现并不稳定。

文章目录

  • note
  • 一、相关开源项目
    • 1、Laya
    • 2、awesome-jev-gallery
    • 3、和bert的对比
  • 二、相关例子
  • 三、相关论文
    • A、生态与全景观察(1 篇)
    • B、评判器 / Judge 评测(7 篇)
    • C、Agent / 系统集成(9 篇)
    • D、垂直应用验证(2 篇)
    • E、视觉模态扩展(2 篇)
    • F、开源复现与替代(2 篇)
    • G、安全攻击与批判(3 篇)
  • 四、相关结论
    • 1)共同解决的根本矛盾:判断与生成分离。
    • 2)有哪些证据?正的/反的?
    • 3)几个判断
  • Reference

一、相关开源项目

1、Laya

Laya — Multilingual, non-autoregressive System 1 decision engine
https://github.com/NandhaKishorM/laya
https://huggingface.co/convaiinnovations/laya

Laya 用一个 421M、不说一个字的开源小模型证明,它可以比闭源收费的 Jev 快 7.8 倍、准 3.9 个点、校准好 3 倍,而且免费。
Laya 的输入是任意状态(邮件、工单、JSON 文档)加上一组「类型化问题」,所有问题在单次前向里一起出答案。问题只有三种形状:choice 从选项字典里挑一个,score 在序数等级上打分,noul 直接回答一个是非题。

底子是 ModernBERT-large 双向编码器(421M 参数),每个选项占一个[MASK]标记位,编码后在这些位置上 gather 出每个选项的打分——这就是「非自回归」的全部含义:不用逐 token 生成,一次前向全出。训练用的是 RLCD(用严格适当评分规则当 reward 的强化学习),所以置信度在统计上真的可信,可以直接拿来做门控:置信度 ≥0.85 自动执行,否则转人工。

还有一个容易被忽略的设计:Router。Laya 有三个 checkpoint(英语版、100+ 语言版、typed-decisions 版),Router 在前向之前用不到 0.5 ms 的纯 Python 文字检测决定用哪个。为什么必须在前向之前?因为英语 checkpoint 遇上高棉语时是 0.000 的准确率配上 0.952 的置信度——错得理直气壮,模型自己的置信度根本不会报警。

TypeSafeAI(前OpenAI研究员DiogoAlmeida)2026-09-15/16发布的"SystemOne"决策模型,不生成文本,直接输出Choice/Score/Noul三类带概率判定。但是,权重未公开、参数规模未披露、架构与RLCD(ReinforcementLearningforCalibratedDecisions,校准决策强化学习)训练配方仅概要描述,仅经API(POST/v1/systemone)提供。

从决策实现上看,这个决策,细分三个决策原语(核心接口):Choice:从有限候选中做分类选择,附带各选项概率与置信度;Score:对有序rubric打分,返回连续分数与分布;Noul:校准的布尔概率P(true),用于是非判断。从定位上看,Jev是把Agent运行中最频繁的高频、原子化、边界明确的判断(分类/选择/评分/真伪)从"慢思考大模型"里剥离出来,用一次前向传播+logits直接打分完成。它验证的是Agent的"快慢分工"(Harness架构),而非文本生成能力,不要去神话它,能不能用,去测试它。记住,它是一个特定任务的模型,场景很受限,不是大一统模型。不要跟风,其实现在很多都是那种对比法。拿A的强项跟B的弱项去比。但是B比A更全面。这套叙事逻辑还在走着。

2、awesome-jev-gallery

社区已涌现28+个项目(https://github.com/OmniJev/awesome-jev-gallery)。它们复现的是"跳过自回归解码、隐状态直接打分、KV-Cache广播+词表切片、封闭决策空间消除幻觉"这一机制/接口,但没有一家复现RLCD训练方法。

3、和bert的对比

其他参考:
1、LLM之Agent(103)|当「快思考」遇上「深理解」:Laya 和 BERT 到底有什么区别?

二、相关例子

三、相关论文

《jev‑decision‑models‑13‑papers‑in‑7‑days‑reveal‑speed‑cost‑accuracy‑trade‑offs》(https://www.besthub.dev/articles/jev-decision-models-13-papers-in-7-days-reveal-speed-cost-accuracy-trade-offs-017f1efc497a)梳理 7 天内 13 篇围绕Jev 决策模型的论文。

看论文细分

A、生态与全景观察(1 篇)

《Jev in the Wild: A Data-Driven Analysis of the Jev Model’s Functionality, Applications and Ecosystem》(https://arxiv.org/abs/2609.30216)

B、评判器 / Judge 评测(7 篇)

《JEV-as-a-Judge: Accept When Confident, Escalate When Unsure》(https://arxiv.org/abs/2609.26550)
《JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places》(https://arxiv.org/abs/2609.29769)
《Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures》(https://arxiv.org/abs/2609.29429)
《Can Jev Judge Radiology Reports? Evaluating a System One Model for Clinical Factuality》(https://arxiv.org/abs/2609.27607)
《Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding》(https://arxiv.org/abs/2609.27678)
《JEVQA - Video Quality from Metadata, Bitstream, and Pixel Features with a General-Purpose Decision Model》(https://arxiv.org/abs/2609.24395)
《Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences》(https://arxiv.org/abs/2609.24965)

C、Agent / 系统集成(9 篇)

《REFLEX with Jev for Efficient Selective Control in LLM Agents》(https://arxiv.org/abs/2609.26532)
《Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents》(https://arxiv.org/abs/2609.23986)
《Jev-Mobile: Jev as an Executor for Mobile GUI Agents》(https://arxiv.org/abs/2609.30186)
《JEV-Star: Fast, Low-Cost StarCraft II Control with Language-Model Planning》(https://arxiv.org/abs/2609.27331)
《KITE: Scaling Jev Population Experiments with Sparse Flagship Calibration》(https://arxiv.org/abs/2609.27535)
《Replacing Large Language Models with Jev Decision Models for Low-Latency Edge Service Orchestration》(https://arxiv.org/abs/2609.22753)
《Fast Intent-Driven Service Orchestration with Jev for 6G Edge Networks》(https://arxiv.org/abs/2609.23136)
《Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise》(https://arxiv.org/abs/2609.28919)
《Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers for LLM-Driven Pentest Agents》(https://arxiv.org/abs/2609.28940)

D、垂直应用验证(2 篇)

《Calibrated Decisions at Scale: Converting Police Crash Narratives into Probabilistic Crash Variables with a System One Model (Jev)》(https://arxiv.org/abs/2609.24052)
《Open-Jev Judgments on CallScreenBench: Calibrated One-Pass Scam Screening with a Small Language Model》(https://arxiv.org/abs/2609.23959)

E、视觉模态扩展(2 篇)

《Visual Jev: Accurate and Efficient Decisions from Shared Visual Context》(https://arxiv.org/abs/2609.25845)
《From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model》(https://arxiv.org/abs/2609.29283)

F、开源复现与替代(2 篇)

《this-that-model-1.0: A typed decision model that decides in 30 ms, for a millionth of a cent》(https://arxiv.org/abs/2609.23886)
《NumericJev: Jev-like LLM Numerical Decoding with Multiway Decision Trees》(https://arxiv.org/abs/2609.28587)

G、安全攻击与批判(3 篇)

《JevOut: Natural Context Can Flip Decision Models》(https://arxiv.org/abs/2609.30243)
《Decision Hijacking: Prompt Injection Attacks on Jev’s Typed Probabilistic Decisions》(https://arxiv.org/abs/2609.28613)
《Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It》(https://arxiv.org/abs/2609.26758)

四、相关结论

基于这些论文,可以观察到几个点:

1)共同解决的根本矛盾:判断与生成分离。

在评估的方法上,其实可以看下怎么做的,有四种研究范式

一个是黑盒对照评测(上面的B、D)。固定判据文本 / 选项集 / 输入,与 LLM Judge 或传统模型逐题对照,报告精度、成本、延迟、校准误差、重复一致性。

一个是架构替换实验(上面的线索 C)。在既有系统中把某一步的 LLM 调用换成 Jev,保持其余不变,测端到端成功率 / 强模型调用量 / 延迟 / 成本;

一个是开源复现(上面的D、F)。自建 Jev-like 接口(LoRA 微调小模型 + softmax 读出 / hidden state 读出),证明接口 + 校准这套读出范式本身可复刻且便宜。

一个是对抗分析(上面的G)。不改题干与答案、只动上下文或选项命名,量化决策翻转率与置信度漂移。

2)有哪些证据?正的/反的?

评估都有两面性,有好有坏,可以看看:注意下格式,()里面的是论文地址。

先说支持一些发现:便宜、快、校准是真实属性(在特定边界内),例如:

普通偏好与二元事实判断上,与最强 LLM Judge 差距 <3pp,费用 0.36%(2609.26550);rubric 评判便宜 29–325 倍(2609.29769);

置信度信号基本可用:Jev 的置信度在多数面板上能对自己的错误排序(2609.29769),低置信样本确实聚集了大部分错误(2609.26550)。这正是级联架构成立的前提;

系统集成收益真实存在:强模型调用 −72.7%(2609.26532)、记忆构建 6.6×(2609.23986)、边缘编排成本 −70%(2609.22753)、诈骗筛查 64.5ms 且零误报(2609.23959);

接口 + 校准的读出范式可复刻:4B 开源模型 64.5ms 达 AUROC .974(2609.23959),2B 开源模型 30.9ms(2609.23886)。护城河不在架构;

再看反对侧:三类已量化的失效模式,可以细分如下:

需要想的判断上系统性落后:核对推导、抵抗精心构造的错误答案、多步算术(0.560 vs 0.98+)、分级判据(四个 judge 全体与人工标注的一致性都低于互相之间——任务定义本身可能有问题);

决策对与语义无关的表述细节高度敏感:选项命名 0/1→no/yes 导致 AUC .94→.23(2609.26758);看起来正常的上下文补充定向翻转 61.4% 的正确决策(2609.30243)。这意味着把概率输出当可靠决策接口的前提比想象中脆弱;

级联的账要重算:Rubric Judges 论文发现 LLM Judge 几乎复现 Jev 全部高置信错误(错误相关),级联最多多赚 1.5–2.0 分,其中,99% 保留率的乐观结论,在错误不相关的假设被打破时并不普适。

3)几个判断

正反都有了,那就看看几点判断:

其一,判断组件品类大概率成立,且护城河不在模型本身。把原子决策从生成中拆出是有真实需求的技术方向:26 篇论文、9 个领域、2,170 个 GitHub 项目在 10 天内独立重复验证了同一套类型化决策 + 校准概率读出范式,且开源 2B–4B 模型即可复刻到接近效果。品类会成立;但正因复刻成本很低(this-that-model 30.9ms、JevLite 64.5ms),Jev 作为单一产品的护城河更可能在校准数据质量、生态位与分发,而非架构。开源替代一周内出现 7 个,价格会迅速趋近于零。

其二,决策模型把攻击面从生成劫持变成了决策漂移,且更隐蔽。schema 约束消灭了格式错误与开放式越权输出,但三篇安全论文一致表明风险只是换形态:不改变任何答案的普通上下文就能以 61.4% 的成功率把正确决策翻转为高置信错误(2609.30243)。 由于决策模型输出直接触发下游动作、且不带可审读的推理文本,这种攻击更难被人在环发现。

其三,级联(自信自答、存疑升级)兴许是Jev最稳健的落点。在二元、高频、上下文可控的任务(路由、分类、闸门)上级联收益明确;在分级评分、需要核对推理的任务上,先花小成本测自己数据上的错误相关性,再决定是否值得接入。

Reference

[1] 4.6k star,开源版Jev悄悄发布
[2] https://console.typesafe.ai/login
[3] https://github.com/NandhaKishorM/laya
[4] 【关于jev 算法原理】什么是 RLCD?Jev 背后的(可能的)数学原理:从偏好建模到概率校准地址:https://di-zhang-llm.github.io/blog/what-is-rlcd-the-secret-behind-jev/
[5] Redis 之父 antirez 罕见公开质疑 Jev
[6] 最近的Jev决策模型何为?技术本质、开源项目及效果如何评估
[7] 从Jev最新26篇论文研究可以发现什么?
[8] 【多模态决策模型进展】书生大模型 InternLM 在 GitHub 开源多模态决策模型项目 Intern-Decision,并在 Hugging Face 发布 Intern-Decision-0.8B、Intern-Decision-2B 和 Intern-Decision-4B 三个模型权重。该模型将状态、可选图片和多个结构化问题转换为决策与概率,基于 Qwen3.5 微调语言主干,同时冻结视觉编码器和投影层,支持选择、评分和是非三类问题。https://github.com/InternLM/Intern-Decision
,https://huggingface.co/collections/internlm/intern-decision

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询