来源:TypeSafe · Introducing System One Models & Jev
作者:Diogo Almeida(TypeSafe 创始人,2026-09-15)

本文为对上述官方博文的中文编译,力求忠实于原文事实、结构与引述。
模型做聊天已经超人类好几年了,自动化却还没跟上。
这是 TypeSafe 创始人 Diogo Almeida 过去四年一直在追的问题。他在 OpenAI 参与过让语言模型学会听指令、跟人说话的方法,那套研究后来成了 ChatGPT 背后的工作。当时他以为聊天模型也许能通向 AGI;热闹过后,他觉得缺了一大块。
隐身两年、过了一堆技术关、也做出研究突破之后,TypeSafe 放出第一款 System One 模型:一类新的前沿模型,目标是做出软件能直接用的、又快又结构化的决策。
整套栈都围着自动化转:新的模型架构、追求极致效率的并行采样器,以及他们称为 Reinforcement Learning for Calibrated Decisions(RLCD,面向校准决策的强化学习)的训练方法。
第一款公开模型叫 Jev,即日起可申请早期访问。Almeida 称,在 System One 类任务上,Jev 的智力水平与现有大语言模型相近,速度和效率却高出两个数量级。它放弃了字符串生成,专做结构化输出,并称不会幻觉。
他把 Jev 想成一次前沿智能的函数调用:非结构化状态进,带类型、带概率的决策出。
超常的主张需要超常的证据。收据如下。
旧前沿与新前沿
对照按原文维度展开:先写现有大语言模型,再写 System One + Jev。
优化方法。现有模型用 Reinforcement Learning with Human Feedback(RLHF,人类反馈强化学习)/ Reinforcement Learning with Verifiable Rewards(RLVR,可验证奖励强化学习)。Jev 用 RLCD。
优化目标。现有模型优化人类偏好——评分者更喜欢的成稿与聊天回复——以及可验证奖励:能被程序核对的输出。Jev 优化校准决策:在 System One 任务上给出认识上诚实的概率。
输入。两边都吃非结构化数据(例如文本)。现有模型侧重顺序消息;Jev 侧重结构化程序状态。
输出。现有模型吐字符串 / 生成文本。灵活,可以是聊天、代码、幻觉、拒答,甚至类型安全的结构化值。软件要用,还得解析和校验;模型也始终有跑偏的风险。Jev 吐类型安全的结构化值。可能的输出与结构事先定好。模型不会出类型错误。每个答案都带校准概率和置信分数。
采样。现有模型顺序生成:一次一个 token,每个都以上一个为条件。Jev 并行:一次查询吐出全部输出,极高效,也更贴硬件。
成本。现有模型输入每百万 token 0.20 至 10 美元,输出大约比输入贵 5 倍。Jev 输入每百万 token 0.042 美元(每十亿 token 42 美元),输出免费(便宜到不必计量)。
速度。前沿模型端到端响应约 3 至 329 秒,跟人对话够用,嵌进代码却是大瓶颈。TypeSafe 端到端约 70–500 毫秒;同等智力的 System One 形查询,可快 40 倍到 200 倍。
置信。即便提示现有模型给置信估计,也往往过度自信、前后不一。模型若能做成 95% 的任务,却不说清何时落在那 5%,就无法自动化。Jev 每次输出都交代置信与不确定。经过校准:置信越高,准确率越高。也更稳定:相近输入给出相近答案。
用途。现有模型适合人在环路(聊天机器人、副驾驶、编程 Agent)——通用、强,但自由度意味着可能跑偏,需要人盯;也适合可验证问题(数学证明、内核优化)——正确性可便宜自动核对时,可以生成、测试、迭代;还适合演示——字符串灵活,能很快做出「有时能跑」的原型。Jev 面向 AI 驱动工作流 / 聪明的 if:结构化输出嵌进普通软件,当模糊决策规则,分类、路由、打分、抽取、分支——手写逻辑太脆的地方。外围代码约束自由度,更容易拼成可靠系统。也可对大数据做 map-reduce,把 PB 级数据变成特征和洞见;约 100 毫秒的时延,可用在体验关键的实时产品里;还能核验一切:给大模型的提示、推理轨迹和/或输出打分、评判、核验、设护栏、侦测越狱。
证据与技术结果
他们自称喜欢怀疑者,自己也是怀疑者。
有些主张容易核对:
- 每次调用的速度:确实那么快;公开评测多半是在西海岸自己的笔记本上跑的(服务目前就部署在那里)。
- 每次调用的成本:定价公开。无法证明没有补贴;长期才能证明价格可持续(他们预期价格会往下走,而不是往上)。
- 没有类型错误:只要一个反例就能证伪,但他们称这在数学上不可能。
更大胆的主张,他们主动加了限定。
并排演示
并排演示要说明的关键差别是:Jev 并行输出全部概率,而不是按 token 自回归生成。字符串极强、极通用,但贵。「放弃」字符串,反而换来一堆超能力。
限定:
- 给已有早期访问的人看的真实查询,被高度简化;
questions的键写得可读,方便屏幕上读懂输出。state也是一段短而密的详述,用来突出采样方法差异。相对更短的输入,对他们的模型更有利。 - 录制那一轮里,与 GPT-5.6 Terra 唯一的分歧是「流失可能性等级」(Churn likelihood level)。他们觉得这个答案本身就含糊。
- 这个例子用了默认推理档的 GPT-5.6 Terra,因为他们觉得它在智力上平均最接近 Jev。
- 类似演示,曾说服他们全力押注 System One 模型这条路。
工作流评测
他们做了一种新评测,衡量人工智能嵌在代码里好不好用。不为某个地面真值分类去优化,也不允许套件和模型改来改去(以免靠套件工程过拟合)。假定存在正确的计算图(代码里的「工作流」),再用最大、最聪明、最贵的外部模型的预测,当作参考概率。
换一种说法:每个模型拿到同一套工作流。比的是它们离最聪明模型的平均值有多近(这里是 Astra 与 Fable)。
Almeida 称 Jev 远在图外,几乎两个数量级上都占住帕累托前沿。他们也对比了用生成提示、把全部逻辑放进思维链的做法;后者通常明显差于直接用工作流。
这里的调用,比上面的并排演示复杂得多,因为更接近真正业务自动化所需的生产负载。他们正在公开 4 个工作流,文中展示的是其中最简单的一个。
最可靠的真实工作流,往往有许多彼此独立、已经拆开的问题,细粒度行为依赖概率,而不是离散拍板。最终结果仍是离散分支,但走到终答的过程,需要大量必须高度一致的领域工程。
细节、分歧、完整查询和各个工作流,见他们的 workflow evals 站点。
限定:
- 官网所称「快 193.6 倍、便宜 444.6 倍」,就来自这组评测;他们预期这偏真实世界收益的高端。
- 这些工作流的内容并非故意挑来让自家模型好看,也不在训练分布里。不过是能力团队的人做的,仍可能有偏差。
- 参考答案取 GPT-6 Astra 与 Fable 5.1 的平均,答案会偏向 OpenAI 与 Anthropic 的模型。他们可能低估了自家模型以及 DeepSeek 模型的相对表现。
- 大语言模型用的是他们的 System One LLM 包装器,把大模型约束成与自家 API 兼容的结构化决策。他们觉得这是从大模型拿决策最准的办法,但通常比不带概率的决策更慢、更贵。
幻觉与类型安全
幻觉和类型安全天生绑在一起;他们把后者看成自动化的及格线。智能体里一次幻觉工具调用只是麻烦;若系统有延迟保证,或调用埋在依赖链好几层底下,就是绝对的交易破坏项。现有模型再聪明,仍会幻觉,仍有类型错误。
限定:
- 大语言模型的数字来自 OpenRouter,几乎肯定有偏差:更复杂的查询可能被路由到更好的模型。
- 他们自己的数字不是经验统计。模式匹配有保证,因此图上可以直接标 0%。
好玩的演示
他们觉得最兴奋的是新用例。先拿出团队最喜欢的两个。
Doom
他们喜欢这个演示如何展示实时智力,以及代码加人工智能能做什么。做它的工程师曾担心每秒 10 次查询(大约每小时 7 美元),其余人却觉得比预期还低。他们打算再出一份深入拆解,并办一些黑客活动。
限定:
- 演示用的是带文本的结构化状态,还不是图像。
- 非人工智能的 Doom 机器人可能打得更好;他们想要的是能对不同游戏状态表示做出反应的机器人,更重要的是——能听指令,这点他们觉得极酷。
Wikiracing
游戏目标是从某个维基百科页面出发,只顺着途中遇到的链接,走到指定的另一个页面。每一步都可能在几百到几千个链接里选。这是展示「每秒智力」、以及在高基数选择里不幻觉会如何复利的操场。
限定:
- 据他们所知,第 2、第 3 个挑战都以「Rubber Duck」开头,纯属巧合;作者是被团队点破才注意到。
- 这里的加速通常小于前面的演示。因为对照的是各模型的非推理档(Astra 除外,设到最低推理档)。这也是 Jev 往往用更少步数走完的原因(他们视为智力更高的迹象)。这样设置是为了让演示好看完。打开推理后,大语言模型在这项任务上会好看得多。
- Jev 支持的基数上限是 255。更高基数时,他们先独立打分、再做显式选择,因此偶尔会变慢。
接下来
Jev 仍在早期。管线里还有很多,他们说会继续往外推。
即日起开放早期访问,并尽快把开发者从候补名单上放进来。他们想听:你要自动化哪些决策,Jev 哪里好用,哪里不够。也想听你要造什么样的科幻。
他们创办 TypeSafe,是因为相信人工智能需要一个软件能够依赖的接口。他们等着看新用例在社区和经济里扩散。
他们给出的 FAQ
「System One Models」和「Jev」这两个名字从哪来?
灵感来自丹尼尔·卡尼曼(Daniel Kahneman)的《思考,快与慢》。模型类别名借用了快而直觉的 System 1 思维,与慢而审慎的 System 2 推理之间的区分。
「System 1 思维」也曾带有容易出错的意味。他们说,出于将来会再写的理由,相信 System One 模型可以做得比替代方案更可靠。
Jev 取自威廉·斯坦利·杰文斯(William Stanley Jevons)。他们预期机器智力会走与煤炭相似的路:蒸汽机效率提高之后,需求反而上升。智力成本每降一个数量级,就会解锁数个数量级的新用例。
原文 FAQ 还列了「为何需要新的训练算法」「Jev 擅长哪些用例」「Jev 是否只是更小的大语言模型」「公开基准上表现如何」「训练数据从哪来」「这些结果有点疯狂——怎么可能」等问题;官网页上其余条目为折叠态,本文不补写未见全文。
中文编译,仅供学习交流。文中事实、引述与数字以 TypeSafe 原文 为准;权利归原作者及 TypeSafe。