一个纯文本、无视觉的商业 API,正在被人接进控制回路。它凭什么接上、接在哪一层、错了会怎样——这三个问题恰好落在计算、信息、误差三种结构上。而机器人界已经提前三年把答案的草稿写好了,写在 VLA(Vision-Language-Action)的论文、蒸馏实验和一次次真机事故里。本文以"接入硬件的三问"为轴,Jev 是线索,VLA 是第二主角。
开篇:一周之内长出身体
2026 年 9 月 15 日,TypeSafe AI 发布了 Jev:一个不提供权重下载、只暴露托管 API 的"System One 模型"。它不收图像、不收音频,输入文本或结构化程序状态,输出三种类型化的判断——Choice(在最多 255 个候选中选一个)、Score(打分)、Noul(是/否概率)。它不生成任何字符串。官方在发布材料中说明:类型错误率为 0% 源于结构保证而非实测——答案空间由调用方声明,非法取值在结构上不存在。(官方另有实测数据的是速度与成本,口径下文另述。)
这不是一个为机器人准备的产品。但发布后的十天之内(按各项目仓库创建时间核验:9 月 16–22 日),社区自己干了这件事:
一架 Skydio X2 四旋翼(MuJoCo Menagerie 里的真机模型)在仿真里仅靠机载相机飞完五站障碍赛道,一个"判断模型"以约 2.5Hz 的频率坐在战术层上,决定当前局面的含义——爬过去、等转门、穿缝隙——而所有时间敏感的控制留在普通代码里。一条 Franka 机械臂在 ManiSkill 仿真里听懂零样本英文指令("pick up the red cube"),靠同一个 API 在约 30 个硬编码基元之间选路。一个智能体在《我的世界》原版服务器上打完了末影龙,全程 131 次 Jev 决策、35 次大模型规划调用。另一个项目在 PyBoy 模拟器里用真卡带打《宝可梦 红》,每个战斗回合让模型对"本回合是否会濒死"给出 Noul 概率,再用 Brier 分数对着模拟器 RAM 里实际发生的事校验——作者特意没有发布校准结论,因为标注样本只有 5 个,"一个基于这种样本的 Brier 分数只是装饰"。
这些项目没有一个等待官方做具身功能。一个为软件路由设计的判断模型,被社区自行接进了物理回路。这个抽象比它的设计目标更通用。
提示:下文引用的所有社区项目数字均为作者自报,且全部运行在仿真或模拟器内,没有真实硬件闭环;厂商(TypeSafe)数字只在对照的语境中出现,并标注口径;凡属本文的架构推断,一律明确标注"推断"。
第一幕:计算结构——云端回路的频率预算
一个被迫穿 JSON 外壳的分类器
先看一个被忽视的事实:当你让一个普通的自回归大语言模型做分类——比如"这个工单该进哪个队列"——它被迫生成一段 JSON 或一个单词来交出答案。它的延迟结构是:
T= prefill + n_decode × step
prefill 是输入的一次前向;n_decode 是解码步数,每步以序列方式依赖上一步。对于"输出一个枚举值"这种任务,n_decode 通常在 10–30 步之间,且步数取决于答案内容——模型要输出{"queue": "refund"}还是更长的结构、中途是否啰嗦、是否要复核,都会改变延迟。更糟的是 JSON 外壳本身:解析可能失败,校验可能拒绝,重试加倍方差。
这里值得给"内容方差"一个具象的量级。发布博客的对照表里,前沿模型的端到端响应被写成 3 到 329 秒(厂商整理的口径,涵盖不同推理档位)——同一个问题,模型"想多说几句"和"直接给答案"之间,隔着两个数量级。即使用结构化输出约束、函数调用模式把长尾砍掉,解码步数仍由答案的措辞而非答案的语义决定。对软件集成来说,一个延迟有方差的组件是不可签约的——你无法围绕它设计时序保证,就像你无法围绕一个"有时三秒有时三分钟"的函数设计实时系统。
这就是"LLM 慢"这句话真正应该有的精确形式:问题不在均值,而在延迟是答案内容的函数。
Jev 的算法本质(此处有厂商口径与推断的混合):官方博客描述为"parallel sampler,所有输出在单次查询内并行算出";第三方与社区普遍认为(推断)其实现是一个骨干网络加声明空间上的小 softmax——答案空间由调用方在请求时声明,模型对声明集合内的每个候选算一次前向得分。无论内部细节如何(TypeSafe 尚未发布架构论文),其延迟结构清晰:一次前向,答案长短不影响步数,方差坍缩。
这不是"把 LLM 优化得更快",而是把串行依赖从延迟公式里删掉——删掉的是答案内容对延迟的依赖,网络依赖原封不动,抖动仍在账上。这个区别是下一节频率预算的存在理由:
图①:两条路径的延迟结构对比。
频率预算:能闭合的回路上限是个位数 Hz
现在算硬件回路这笔账。Jev 是云端 API。把一个云端 API 放进控制回路,延迟预算是:
T_loop = T_api +T_network(往返)+ T_jitter
厂商宣称的端到端响应是 70–500ms(厂商口径:官方博客自述其评测"一般跑在我们西海岸的笔记本上",即不含跨洲公网);Laya 发布方 Convai 的对比表测得 Jev 单题 p50 为 236–276ms(竞争方口径);宝可梦项目经 Vercel AI Gateway 自报中位 621ms(n=6)。加上网络往返与尾延迟,一个云端判断回路能稳定闭合的频率上限,是个位数 Hz。
由此推出一个比"快不快"重要得多的结论:split-rate 是唯一合法架构。jev-drone 的分工是教科书式的——HUD 上写着control 500Hz jev 3Hz(README 口径约 2.5Hz):判断模型坐 2–5Hz 的战术层,负责"这个局面意味着什么";姿态、避障的硬约束留在数百 Hz 的确定性代码里。jev-drone 的 2.5Hz 不是随意选择的风格,而是上面那笔频率预算的产物。换个 API、换个网络,这个数会变;预算公式不会。
这笔预算在 jev-drone 的消融实验里能看到全部含义(自报仿真)。同一套系统关掉 Jev、退化为"朝宽敞一侧飞"的贪心启发式:永远不撞,也永远过不了第二关——因为"从障碍上方爬过去"不在它能表达的语义里,三次运行全部停在 17.7 米处。接入判断之后:全程 77.5 米约 47 秒飞完,极速 3.6 m/s,目标保持视野率从约 19% 升到 82%,被反射逻辑钉死的时长从 65–71% 降到 9%,碰撞为零。注意这组数字的结构:判断模型贡献的是语义("这个情况意味着该爬过去"),代码贡献的是可靠(爬的执行、不翻机的姿态)。频率预算决定了两者不能合并成一层。
仿真还逼作者写下了两条控制器教训,值得单独引用。四旋翼无法向下推、硬指令下降时控制器会忠实地命令一个倒置姿态,修法是钳制期望加速度的 z 分量;侧向控制需要位置回路而非速度保持,否则飞机会一本正经地横穿走廊撞进对面墙。这两条教训里没有任何 AI——它们说明物理层面的正确性永远属于代码,判断模型无论多聪明,都坐在一个"先把 a_des[2] 钳正"的世界里。
还要补一刀:无线链路下抖动失控,云端回路在真实飞行硬件上基本出局——jev-drone 自己也承认这是仿真。仿真与有线工作站,是云端判断回路的合法疆域;出了这个疆域,结构就变了。
与 VLA 同构:用结构换串行
机器人界早就面对同一个问题。VLA 的两代关键工作,本质都是"用结构换串行":
- RT-2(2023)把机器人动作离散化成 256 个 token,嫁接在 PaLI-X / PaLM-E 的视觉语言骨干上——动作空间被压进词表,才谈得上用预训练模型直接出动作;
- OpenVLA(2024,7B)沿用动作 token 化,并用投机解码把 wall-clock 吞吐拉高数倍——用一个小草稿模型预测动作 token、大模型并行验证,用架构技巧绕开解码串行性;
- 更新的FAST动作分词器、π0的 flow-matching 解码器,则是在另一侧做同样的事:把连续动作的表达改写到推理更便宜的坐标系里。
Jev 把这条路推到极端:不只动作 token 化,而是答案空间整体由调用方声明。VLA 界换的是串行的步数,Jev 换的是串行的存在性。
把三件事并排看,结构就清楚了:
换掉的串行 | 代价 | 谁掌握声明权 | |
|---|---|---|---|
投机解码 | 大模型的部分解码步 | 一个小草稿模型 + 额外显存 | 模型方 |
动作 token 化 | 连续动作的表达自由度 | 动作分辨率与词表设计 | 模型方 |
Jev 式声明答案空间 | 解码本身 | 放弃字符串生成 | 调用方 |
最后一行是那个真正的范式转移:历史上是模型方决定"答案能长什么样",Jev 把这份权力上交回代码。这也是它与 VLA 天然互补而非竞争的根因——第三幕会回来讲这个分工。
第二幕:信息结构——没有眼睛的感知
硬事实:Jev 无视觉
Jev 无视觉、无音频,输入只收文本与结构化状态。官方发布博客在 Doom 演示的脚注里留了一句 "not on images (yet…)"——截至发稿(2026 年 9 月 23 日),这个省略号没有产品化下文:无图像模型、无接口、无时间表。CEO 在市政厅会议中提到过图像模型,但早期访问的公开 API 仍然是文本进、类型化判断出。
这不是小遗憾,而是信息结构上的根本定位:Jev 只负责判断,不负责感知。
社区的标准解:VLM 做前端,Jev 做判断,代码做动作
社区给出的模板高度一致,而且和 VLA 界的分层不谋而合:
像素 → VLM/CV 压成结构化状态 → Jev 判断 → 代码执行动作
两个代表性项目:
- 皇室战争(clashroyale-jev,自报仿真):Qwen 看战场画面给出局势描述,本地 OpenCV 读手牌与圣水数值,二者压成结构化状态后交给 Jev 选牌与落点。VLM 与 Jev 是上下游,不是替代关系。
- OmniJev(自报仿真):双相机图像加文本直接喂给一个自托管的多模态模型,以 Jev 式有限选择接口输出下一个预设技能,驱动 MuJoCo 机械臂完成搬运、堆叠、越障任务。它最有趣的数字不是成功率,而是拒答:对不可观测的输入,系统返回 "insufficient evidence" 而不是猜——发布方报告 208/208 个非音频探测请求回答正确,并在四个公开基准试点上保持准确率不降、决策延迟降 6.8–13.6 倍、总 token 降 51–86%。
这个"拒答"的分量值得单独掂量。一个会说自己"证据不足"的回路组件,比一个永远给出答案的组件,在安全结构上的价值高得多——这是第三幕的伏笔,也是校准问题的前奏。
更激进的路线:原生多模态复现
还有一条更激进的路线已经开花:决策模型的"视觉版"率先出现在开源侧,而不是 TypeSafe 官方。三个项目值得记住:
- Visual-JEV:基于 Qwen3.5-4B 的原生多模态 Jev,图像直接进,不需要模态转换;
- Dohnuts:Qwen3.5-0.8B,图文单前向,发布权重、训练代码与评测(权重限非商业研究);
- Qwen3.5-OneForward这类接口实验:不做训练,直接从 Qwen3.5-2B 的 logits 读出 Jev 式类型化选择,一次前向、零解码、零微调——同时坦承候选概率"未经校准"。
这个分叉本身值得一段分析。官方产品选择"先校准后多模态"(闭源 API 要卖的是概率可信度),开源社区选择"先多模态后校准"(复现者先证明形态可行,校准是后补的工程)。谁对谁错没有答案,但它说明:"判断"与"感知"的解耦是市场的选择,不是某家公司的设计。
这个解耦还有一层更深的含义:感知压缩这一层,恰好是整个系统里误差最容易失控的地方。Qwen 看战场会漏看一条炮线,OpenCV 读圣水会读错一位数,而 Jev 拿到的是已经定型的状态——它甚至不知道自己不知道。判断层的校准做得再好,也只是"给定输入下的诚实";输入本身错了,诚实的概率照样通向错误的动作。这正是三前提定理把"感知已压缩"列为第一条的原因,也是 OmniJev 把"证据不足就拒答"看得比准确率数字更重的原因——拒答是信息结构里唯一能对感知失效做出反应的机制。
顺带澄清一个流行的误读:Jev 不是 YOLO 式的固定标签分类器——答案空间不是训练时写死的类别表,而是调用方在每次请求里动态声明的候选集合,"动态标签空间"才是准确的说法。它与"抽掉语言模态的 VLA 模型"反而共享更深的结构:RT-2 与 OpenVLA 的骨架本来就是"视觉 → 离散动作 token",把语言部分拿掉,剩下的正是"感知压缩状态 → 声明空间内的类型化单选"。Visual-JEV 与 Dohnuts 实际上就长在这条缝里——这个类比点到为止,展开是另一篇文章的事。
概率合约的拷问:softmax 的三种语义
现在进入本幕最硬的部分。当 Jev 卖出"带校准概率的类型化判断",它卖的到底是什么?
softmax 输出的概率有三种常被混用的语义:
- 策略似然:在模仿学习坐标系下,概率是"专家这么做的相对可能性";
- 置信感:模型内部几何给出的锐度,是隐空间的副产品,没有外部含义;
- 校准概率:频率主义含义——模型说 70%,长期看在可比情形下就应命中约 70%。
三者的差别不是学术洁癖。策略似然适合行为克隆,置信感适合排序检索,只有校准概率能进阈值逻辑:"p > 0.85 就自动执行"这个 if 语句,只有当 0.85 是第三种语义时才成立。Jev 宣称卖的就是第三种,训练方法 RLCD(Reinforcement Learning for Calibrated Decisions)的名字就是承诺。但反方证据同样公开:
- Laya 的自测表给出 ECE(期望校准误差)0.081 对 0.246(Laya 是 Jev 的开源竞争者,整表是竞争方口径,不可当作中立评测)。逐数字拆开看测量方与对象:0.246 是 Laya 一方测 Jev 的原始口径;0.081 是 Laya 自测、经按问题类型×选项数温度重拟合之后的数字——两者并非同一测量条件下的对比。第三方综述给出同口径的原始数字:Laya 基础检查点原始 ECE 0.213,Jev 原始 ECE 0.144,结论反转。同一组数据,两种口径,结论反转——这就是"校准"这个词在商品页上的实际处境。
- 一个独立项目在合成锦标赛任务上实测
jev-1.13.0(31 场比赛,自报):ECE 0.197,且明确标注"过度自信(gap +0.174)",Brier 还输给了 Elo 基线。作者的态度是:测出错误校准"是这个项目的意义所在,不是 bug"。
竞争格局里还有两组数字,把"校准战争"的全貌补完。准确率战场上,竞争方口径下 Laya 在 typed-decisions(0.766 对 0.727)、AG News(0.950 对 0.910)、情绪分类(0.595 对 0.480)上领先,而 Jev 在高基数任务 Banking77 上以 0.870 对 0.425 碾压——选项一多,encoder 式架构的打分头就力不从心。能力边界上,Laya 官方坦承其基础检查点零样本"接近随机"(0.362,低于多数类基线 0.461),能力来自微调而非底座。这些互有胜负的数字提醒读者:所有对比表都是某一方在自己选的地形上打的仗。
最精巧的技术回应来自 Verdict 2.0(作者自报,未获任何独立验证,此处仅作方向性参考):它把概率拆成两个通道——分布头去拟合人类专家面板的软标签(Brier 0.0636),另训一个置信头专门预测"这次对不对"(ECE 0.0144,AUROC 0.7664)。这实际上承认了"软分布匹配"和"二值正确率校准"在数学上互相冲突:一个模型没法同时最优地服务两种语义。把两种语义拆开卖,大概率是这类产品下一步的标准做法——Jev 的单通道置信度届时会显得简陋。
更深一层的问题:校准是分布内性质。ECE 在"和校准集同分布的数据"上测量才有意义;业务一漂移,softmax 的几何被拉伸,昨天的 0.85 阈值今天可能意味着 0.6 的实际命中率。这不是 Jev 的缺陷,是所有判别式模型的数学宿命。
放进学术坐标系,这里有两棵老树。
Selective prediction(El-Yaniv 一脉,2010 年起)研究的核心对象就是"拒判率—风险"曲线:分类器可以拒答,换取被接受样本上的错误率下降,曲线之下的面积刻画的是一个模型的"可自动化程度"。这条线的现代含义是:一个永远给出答案的模型,和一个知道自己何时该闭嘴的模型,在自动化坐标系里是两种东西——Jev 的置信度加代码阈值,本质就是把这条曲线做成了 API,官方博客里"always communicates confidence and uncertainty with every output"翻译成学术语言,就是"暴露了选择性预测的接口"。但它给出的是曲线,不是证明:阈值调到多少、曲线在你的分布上长什么样,是调用方的责任,不是 API 的承诺。
Conformal prediction是另一条路:不假设模型校准,只在"数据可交换"的弱假设下,用校准集的分位数构造预测集合,给出 coverage 的有限样本保证。机器人界的KnowNo(Ren et al., CoRL 2023)是这条路在 embodied 场景的范本:LLM planner 对候选动作给分,conformal 量化出一个预测集合,集合不唯一就向人求助,在保证任务成功率的前提下把人工求助量降低了 10–24%,并上了真 UR5 机械臂。对照之下,KnowNo 与 Jev 的对应关系有多整齐:多选帧对应声明的答案空间,预测集对应"证据不足"的拒答,人工求助对应代码兜底——只是 KnowNo 多了一样东西:一个关于成功率的定理。
这就是判断模型类产品与学术传统之间真实的距离:刻度盘已经有了,保证书还差一层共形预测包装。
一句话收束本幕:Jev 把"何时该说不知道"这个学术老问题工程化了,但工程化不等于解决——它给了你刻度盘,没给你保证书。
图②:校准的分布内性质与漂移失效。
第三幕:误差结构——错了会怎样
误差的可消费性,取决于是否复合
现在回答最尖锐的一问:判断模型错了会怎样?答案不在模型里,在回路结构里。先算一笔复合账:
一条每步成功率 99% 的回路,以 20Hz 跑十秒,即 200 步,累计成功率是 0.99 的 200 次方——约 13%。要让十秒后还剩 87%,单步成功率得达到 0.9993。这就是复合误差的铁律:局部的高可靠,在串行回路里指数蒸发。
而 Jev 的用例恰好是误差不复合的那类:每一次判断都有状态反馈兜底——选错技能,下一步的状态会不同,判断可以重来;选错分支,宝可梦的战斗回合会给出新的 RAM 事实。误差被吸收在回路的反馈里,而不是沿着轨迹累积。这是用例筛选的结果,不是普适能力。
这里要堵住一个容易混淆的追问:jev-drone 的贪心基线也运行在同样的状态反馈里,为什么它的失败像复合误差,而判断层的误差不像?区别在于错误的性质。复合公式管的是高频回路上的单点失败沿着物理轨迹累积;判断层的错误是低频的决策错误,且每帧都能重选,单点错误至多损失一拍。基线的失败不是随机误差的累积,而是系统性语义盲区——它没有"重新选择"这个机制,每一帧都在忠实地重复同一个错误策略,三次运行整齐地停在同一坐标。换言之:是否可恢复,取决于错误进入的是一条只能前向执行的物理链,还是一个每帧重新开盘的决策点。
图③:柱 = 单步 99% 且逐步复合的回路(200 步即十秒时只剩约 13%);线 = 单发判断、误差不复合(每次判断独立接受状态反馈校验)。横轴为步数。
三前提定理
为什么这些项目的误差不复合?拆开看,它们全部满足三个前提:
- 感知已被压缩成结构化状态——Jev 收到的是 xyz 坐标、布尔量、候选清单,不是原始像素;感知误差在进入判断之前已被代码或 VLM 定型;
- 技能库已硬编码——候选集合是 10–30 个互斥、可验证、可由确定性代码执行的原语;模型选择的后果有界;
- 安全回路在确定性代码里——姿态稳定、力矩限制、急停,全部不经网络、不经模型。
"缺一不进回路"是修辞,准确的说法是:缺一,回路的风险结构质变。这条"定理"不是数学定理,是工程排他律:缺了第一条,判断在噪声上拍脑袋;缺了第二条,错误选项本身不可执行或不可控;缺了第三条,任何单点错误直接变成物理事件。三条齐备时误差只是可恢复的判断错误;缺一条,它就变成需要自己背书的系统风险。
这里必须明确排除一个常被混淆的对象:PID。PID 有稳定性保证、跑在 kHz、不依赖网络——它是 Jev 下方的层,不是被 Jev 替代的层。判断模型坐在它上面,像飞行员坐在飞控上面:自动驾驶仪不取消飞控,判断模型也不取消 PID。
图④:四层下放框架。越往上,频率越低、抽象越高、误差越不直接变成物理后果。
生态实证,与一段冷水
生态项目几乎按图索骥:
- jev-askable-arm(自报仿真):ManiSkill 里的 Franka Panda,约 30 个互斥基元,Jev 每步选一个、PD 执行器驱动
pd_ee_delta_pos执行,约 1 秒一次选择。README 里那句"Jev never outputs torques or a trajectory"是三前提定理的白话版。 - quackd(自报):一个给真实机器人用的 CLI,LLM 当飞行员,Jev 是可选购步器(
--jev off为默认,shadow 模式只记录不干预)——它只回答"在机器人已声明技能中选择"这一类轮次,README 里的比喻(意译):它写出关节角的可能性,不会比一支温度计更高。它的仓库创建于 8 月 28 日,比 Jev 发布早九天——这个机器人 CLI 本来就存在,Jev 上线后一周内,作者主动给它装上了可选的判断步器。 - 《我的世界》智能体(自报仿真):前沿模型负责规划,Jev 负责选择每一个玩家动作,131 次 Jev 决策对 35 次规划调用——约 3.7:1 的配比是层级架构优于单体模型的直接证据:便宜的判断做高频选择,贵的推理做低频规划。
- RoboJEV(自报仿真):Franka Panda 抓取/推/堆叠,每次决策重发整个场景 JSON,完成一个任务花了 244 次请求——这个数字本身就是云端路线的隐性成本:状态不缓存、轨迹不复用,调用量随任务长度线性膨胀。
- EmbodiedJev(自报仿真,实测评测):MuJoCo 工作台把每个机器人步骤做成可见的 Jev 决策,有第三方评测记录到一次 gate 中途触发——两个选项停在 0.54 和 0.44,机械臂停下等人,而不是猜。评测者把这列为"无人值守需要刻意调阈值"的注意事项,但从误差结构看,这正是设计目标:回路的最后一道闸在代码里,由概率驱动。
- jev-libero(自报仿真):每个候选动作先在物理引擎的可逆分支里预演,再问 Jev 选——"先预览、后选择"把技能的执行后果也变成了确定性知识,是三前提定理的强化版:不只候选被硬编码,连候选的物理后果都被代码穷举过。
泼冷水段落,集中交代一次:以上项目全部自报、全部仿真、无真实硬件闭环;部分项目的"成功率"是单次种子运行而非统计结论;quackd 面对的甚至是真实机器人,但 Jev 路径尚未见其真实硬件评测。把仿真成绩外推到物理世界,中间隔着本幕说的那堵墙。
VLA 的旧地图
机器人界趟过同一条路,而且留下了更完整的记录。对照着看,Jev 社区现在经历的每个阶段都有草稿:
Jev 社区正在经历的 | VLA 界对应的一页 |
|---|---|
判断模型接入控制回路 | 大模型规划器 + 低层策略的层级架构(SayCan, 2022) |
动作/技能 token 化、候选集合声明 | RT-2 / OpenVLA 的动作离散化与词表化 |
快慢回路分层(500Hz 控制 / 2.5Hz 判断) | 经典机器人学的 split-rate 控制与行为树 |
置信度阈值 + 拒答 | KnowNo 的 conformal 求助与 selective prediction |
云端 API 先进回路做概念验证 | VLA 先在工作站推理,再蒸馏小模型上机 |
差异只有一处,但决定一切:误差代价。VLA 的错误物理复合——抓错一次,杯子碎了;抖动失控,飞机撞了——而且机器人没有"转人工"的退路,求助本身就是任务失败的一种。Jev 的用例误差被反馈吸收、被拒答拦截、被代码兜底,所以它能先卖概率、后补证明;机器人界必须先有证明,才允许概率进入回路。同一张地图,不同的行军纪律。
这张地图对从业者还有一个反直觉的启示:VLA 界花最大力气攻的问题——端到端、单模型、全频带——恰好是判断模型路线不需要攻的问题。层级、解耦、慢思考骑在快控制上,这些被某些人讥为"不够端到端"的结构,正是判断模型一周内被接进物理回路的原因。架构之争里没有洁癖的位置,只有误差结构的账。
第四幕:路线之争——云端接入与边缘复现
独立成幕,因为这是一条岔路,而且是所有从业者真正要站队的岔路。
云端接入硬件:现状与上限
云端路线的可行域,由第一幕的频率预算严格划定:仿真 + 有线低延迟链路 + 个位数 Hz 战术层。它的优点是结构性的:按次计费、零运维、模型静默升级(jev-latest别名会自动指向新版本——这既是便利也是校准噩梦:阈值是按旧版本调的),是概念验证的最短路径。一个周末就能让四旋翼飞起来,这是云端路线真正的竞争力。
它的上限同样结构性。第一是连接:无线真实硬件出局。第二是校准的不可复现性:你测的是服务方的权重,不是你能固定的权重——而jev-latest这个别名会在代码不变的情况下悄悄指向新版本,你在旧版本上调好的 0.85 阈值,可能在新版本上意味着完全不同的实际命中率;官方自己的文档建议"阈值已校准就钉死版本号(如jev-1.13.0)",这句话等于承认版本漂移与校准承诺之间存在张力。第三是成本随调用量线性增长:jev-drone 类项目每小时数百次决策是零花钱,宝可梦项目自报约每小时 0.14 美元(约 725 token/次、每秒 1.3 次决策的口径),Doom 演示那种每秒 10 次查询就是每小时约 7 美元(厂商演示口径)——再往上一个数量级,账单本身就是架构约束,RoboJEV 那一个任务 244 次请求的形状在这种负载下会迅速变得难看。
边缘复现:门槛不是大小,是校准与可审计
Jev 闭源、不能上机(没有机载算力会为一个每次往返数百毫秒的云端依赖买单)。但它的形态足够小,小到一个周末就能复现——复现者们已经达标:
- Laya(421M,ModernBERT-large 骨干,Apache-2.0):T4 单题 32.8ms,支持本地与离线环境;但出厂检查点过自信,须按问题类型×选项数做温度重拟合后才达到其宣称的 ECE 0.081;且官方坦承基础检查点零样本能力"接近随机"(0.362,低于多数类基线 0.461),能力来自微调;
- NanoJev(0.6B):本地决策头,发布训练代码与游戏 demo,面向教学与验证;
- Verdict(151M):encoder 架构,CPU 35ms、浏览器 WebGPU 89ms,带显式
__insufficient_evidence__拒答槽;作者同样诚实地公布短板——337 例 TypeSafe 公开基准上 Verdict 只有 48.1%,远低于 Jev 的 90.8%,原因是 151M 的 encoder 没有世界知识,"对流水线里给昂贵模型看门的廉价模型,这个边界仍然可用"; - Dohnuts(0.8B):原生多模态,图文单前向,权重限非商业研究。
一个反复出现的模式:上机的门槛不是模型大小,是校准质量与可审计性。Laya 与 Jev 互指对方 ECE 难看(0.246 对 0.081 的竞争方口径,原始口径又是 0.144 对 0.213 的反转)——这个互相矛盾的打分数本身就是分水岭所在:没有哪一方握有可信的第三方校准审计,而机载部署恰恰最需要这个。延迟早已不是瓶颈,31 字节的答案和 30 微秒的推理都不是问题;问题是"系统说它 92% 确定时,我该不该信,我拿什么审计"。
Verdict 的浏览器 WebGPU 演示在这个语境下意味深长:推理直接跑在你自己的浏览器里,输入、候选、原始概率全部可见,还能导出可验证的 JSON 推理回执。这未必是性能上的最优解,却是可审计性的一个极端形态——审计的第一步是让每个决策可回放、可复算。开源复现们在这一点上对闭源 API 构成的不对称优势,比任何延迟对比表都致命。
也别把边缘路线浪漫化。它的隐形成本在校准之外:Laya 要按问题类型×选项数做温度重拟合才有可信概率;基础检查点零样本接近随机,垂直场景必须自己微调(官方 Kaggle notebook 一轮约 4–5 小时,看着不贵,但数据标注与评测集建设才是大头);Dohnuts 的权重限非商用;Visual-JEV 们还没有任何公开校准证据。云端路线卖的是即插即用的可信度,边缘路线买的是自己负责的可信度——选哪条,取决于你的团队里有没有人对校准负责。
由此,第四幕真正的分界线可以比"云端 vs 边缘"再往下挖一层:校准优先,还是形态优先。TypeSafe 的排序是先有可卖钱的概率可信度、再谈多模态(闭源 API 的估值锚在校准上);开源社区的排序是先证明"单前向 + 图文输入"的形态成立、再把校准当后补工程(Dohnuts 放训练代码、Verdict 做拒答槽,都是补票动作)。这不是工程约束之争,是安全策略之争:先校准意味着"不证明不进回路",先形态意味着"先进回路再补证明"。两条排序各自有商业逻辑,但请注意它们在 VLA 史上的对照组是谁——机器人界当年整体选择了前者,代价是三年;判断模型界正在同时跑两条路线,谁对谁错,会是这个品类三年内最值钱的答案。
至此,全文的三层二分可以摆齐了:误差是否复合(第三幕)取决于用例,部署路线云端还是边缘(本幕)取决于频率预算与所有权衡,而校准优先还是形态优先是比这两者都更底层的一层二分——它左右你选哪条部署路线,更决定你愿意为"证明"付出多少前置成本。标题说的是路,账本的根子在排序上。
镜像 VLA 史
把 VLA 史叠上来,两条线的重合度高得惊人:OpenVLA 7B 走云端/工作站,蒸馏小模型上机——就是 Jev 与 Laya/NanoJev/Dohnuts 的关系;RT-2 当年也只能在机房推理,两年后才轮到 π0、Octo 这一批讨论机载与边缘。历史给出的预判是:概念验证走云端,生产闭环归边缘,中间隔着一道"安全案例"的墙——对机器人,安全案例是功能安全论证与事故责任;对判断模型,是校准审计与版本冻结。两界谁都没翻过去。
图⑤:云端—边缘谱系图。两条平行线,同一堵墙。
对比表
维度 | 云端接入(Jev API) | 边缘复现(Laya / NanoJev / Dohnuts / Verdict) |
|---|---|---|
回路延迟 | 数百毫秒级 + 网络抖动,闭合上限个位数 Hz | 数十毫秒本地前向,抖动可控 |
成本 | 按次计费(输入 $0.042/百万 token,输出免费),零运维 | 自托管近乎为零,但训练/微调/校准是隐形成本 |
校准 | 出厂宣称已校准(RLCD),但你无法在自己分布上复核 | 自己拟合、自己测,可审计但出厂常过自信 |
可控性 | 权重不可见、版本会漂移( | 权重在手、版本可冻结、可离线 |
代表项目 | jev-drone、askable-arm、宝可梦红、Minecraft 智能体 | Laya、NanoJev、Dohnuts、Verdict、OmniJev |
五行收束本幕:云验证概念,边缘拿生产,分水岭是校准不是延迟。
浮出
回到最初的三问,现在可以给答案了。
凭什么接上?因为判断模型的延迟结构里删掉了串行依赖——快不是本体,是副产品。真正被卖掉的是可签约性:延迟方差坍缩、输出结构保证,代码第一次能围绕一个 AI 组件设计时序。而这条路的尽头站着频率预算:云端 API 只能闭合个位数 Hz 的回路,所以它只配坐战术层,姿态与安全永远留在代码里。
接在哪一层?接在感知与动作之间、被三前提夹住的那一层:状态已被压成结构化文本,技能已被硬编码成候选集合,下面有 kHz 级的确定性回路兜底。这不是 Jev 的设计,是所有"判断即服务"进入物理回路时的共同坐标——VLA 界用三年把它画成了地图。
错了会怎样?在它的合法用例里,误差不复合:反馈吸收它、拒答拦截它、代码兜底它。所以单发 99% 的朴素可靠度足够消费。出了这个域——进了误差物理复合、没有转人工退路的场景——同一组数字立刻变得不可消费。Jev 敢卖概率,是因为它的用例筛过了;这是筛选的结果,不是普适能力。
第四幕补第四句:接入硬件的路有两条。云端验证概念,边缘拿生产,中间隔着校准审计与版本冻结这堵谁都没翻过去的墙。
给从业者的两个意见:
- 云端试回路的频率预算公式——
T_loop = T_api + T_network + T_jitter,能闭合的频率上限取预算的倒数再打折;先算这笔账,再决定判断模型坐哪一层。 - 边缘选型的校准验收清单——在自己的业务分布上测 ECE 与拒判率—风险曲线,而不是引用任何人的对比表(包括本文);按(问题类型 × 选项数)分层拟合温度;冻结版本号,拒绝漂移别名;把"证据不足"的拒答路径当成功能而不是瑕疵来测。
给研究者的三个开放问题:
- 分布偏移下校准的半衰期是多少——业务漂移多快会让出厂校准失效?这决定了"校准即服务"的续费周期;
- 决策 API 的 conformal 化——能否在判断模型输出之上包一层轻量 conformal,给出有条件的 coverage 保证,而不牺牲单前向的延迟结构?
- 机载决策模型的安全案例归谁做——模型方、集成方,还是第三方审计?VLA 界三年没答完,判断模型界还没有人开始答。
最后一个镜头。9 月 15 日发布的是一个"frontier-intelligence function call":无身体的判断。十天之内,社区替它接上了四旋翼、机械臂、卡带与龙。Jev 未必是赢家——校准争议、闭源形态、竞争方口径互撕,都还是进行时——但"判断即服务"这个品类已经站进了物理回路。值得记住的不是它走得多快,而是它走的每一步,都落在机器人界二十年画好的那张地图上。地图上最后一堵墙还立在那里,而墙两面的人,现在是同行。
附:本文引用与口径说明
- 厂商事实均出自 TypeSafe 官方发布博客(2026-09-15)及公开 SDK 文档;厂商性能数字(70–500ms、20–200× 等)为官方自述口径,官方自认评测跑在其西海岸笔记本上,跨洲网络不计入。
- 生态项目(jev-drone、jev-askable-arm、quackd、jev-plays-pokemon-red、clashroyale-jev、OmniJev、rmalde/minecraft-agent 等)数字均为作者自报,全部位于仿真/模拟器环境,引用时已随文标注。
- 项目时间线经 GitHub API 核验仓库创建时间:jev-drone 9 月 16 日、jev-askable-arm 9 月 17 日、jev-plays-pokemon-red 9 月 18 日、clashroyale-jev 与 minecraft-agent 9 月 20 日,均在 Jev 发布(9 月 15 日)之后十天内;quackd 仓库创建于 8 月 28 日,早于 Jev 发布,属既有项目接入,正文已如实区分。
- Laya 对比数字出自 Convai Innovations 发布的对比表(竞争方口径),Jev 侧数字引用自第三方基准;原始口径与拟合口径的差异已随文说明。
- 学术引用:KnowNo(Ren et al., CoRL 2023, arXiv:2307.01928);RT-2(Brohan et al., 2023);OpenVLA(Kim et al., 2024);Octo / π0 / FAST 等见正文。selective prediction 与 conformal prediction 为标准术语,未特指单一文献。
- 文中"单前向 + 声明空间小 softmax"等为社区共识与本文推断,TypeSafe 尚未发布架构论文,已随文标注"推断"。
- 文中图片分别为 jev-drone、MakerMods 机械臂、双调用搬运项目的公开归档截图,版权归原作者所有,仅作评论引用。