Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO

Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO

Latent Space•02:22:22•2026-09-21•原始音频
嘉宾
Diogo Almeida

核心摘要

发布次日,Diogo Almeida——GPT-3/3.5 时代的 OpenAI 工程师、InstructGPT 老兵、现为 TypeSafe 联合创始人——做客 Latent Space,核心论点是整个行业一直在为错误的消费者优化错误的模型。预训练 LLM 在补全互联网,RLHF 模型被造出来是为了回复文本;Jev 则是第一个大型可编程模型:一个 System One 模型,由代码消费、按每美元智能优化,名字取自杰文斯悖论——便宜的智能会扩张总用量。发布周的颜色定下基调:一天已服务约一万亿 token、调 API 的是机器不是人、真正的需求信号是限流压力;部署纪律借自数据库——模型出厂即冻结、不承诺长期支持、Jev 1.13.0 可能被临时 LTS。 思想内核是后训练北极星的三分:RLHF 取悦人类,RLVR 优化基准,RLCD 为程序化使用做到可靠。预训练的智能浓缩体本质上是 System One 思考者;RLVR 为 System 2 赢得过真实的敬畏,但结果脆弱而锯齿——数学不只是 spiky,是分形的——对 Jev 的形状,RLVR 的最优量是零。chat 优先训练再加一个 reasoning 模式会逼着智能碎裂:RLHF 天然买来谄媚、过度自信、幻觉和 LM Arena 文风,字符串生成本身就要求失准与丢模式,连身份也是碎裂——建在 API 上的聊天机器人该自称 Chipotle。校准的讨论从 LeCun 那页错误概率幻灯片(数学上显然、经验上错误)一路推进到最硬的反对意见:Jev 不该在技术层拒答,因为智能会更像数据库,而不是同事。 后半段是历史与市场格局:安全派接管 OpenAI 的那场政变、InstructGPT 之战(未发表的算法、50% 的 LLM 份额)、指令遵循的“我们赢了”、Sam Altman 对那份“机器调 API”文档的祝福,以及 ChatGPT 是 Claude 复制品的说法。Claude Code 和 Codex 领先 coding agent,恰恰因为它们围绕单模型世界构建,而 KV 缓存——Diogo 自己文章的主题——在经济上把 agent 锁进那个世界,把持续学习重新定义为内存管理。“给前沿配速”被驳为一场戏法,本可轻松解决的沙箱问题被留而不解;收尾是一段开发者体验控诉:function-calling 接口疯了、拒答阈值只能在 system message 里乞求,而终点预言是一个智能界的 AWS。

章节看点与核心要点

Jev 由消费者和指标定义,而非由能力对话定义:一个机器原生、可编程的 System One 模型,由代码消费、按每美元智能优化——对照组是补全互联网的预训练模型和回复文本的 RLHF 模型。
Jev 这个名字本身就是论点:取自杰文斯悖论,更便宜的每美元智能会扩张总用量,而 Jev 将是 TypeSafe 在那条前沿上的模型之名。
保守的字符串生成对概率分布是毒药:不能明着出错的模型会失准并丢模式,这就是把字符串模型超载用于决策会失败的原因。
安全属于技术层之外:智能会更像数据库而非同事,而数据库的职责不包括审查 CIA 拿它的查询去干什么。
公开基准不可信,因为各实验室在长得像 MMLU 的相似数据上训练——所以 TypeSafe 只跑内部评估,并把不作弊当成最高优先级之一。
发布指标倒转了消费级 AI 的读法:每天约一万亿 token、调 API 的是机器而非人、限流压力(而不是候补名单注册数)才是要紧的需求信号。
部署纪律来自数据库实践:模型部署后不再改动、不承诺长期支持、Jev 1.13.0 可能被临时 LTS,同时 TypeSafe 的交付速度远快于大家习惯的厂商节奏。
所有模型在世界上有经济价值的工作上都大致压在零位——自动化还不到 1%——所以宣言把目标定为 5 年内 TFP 增速读到 3%。
三个北极星:RLHF 取悦人类、RLVR 优化基准、RLCD 为程序化使用做到可靠;预训练的智能浓缩体本质上是 System One 思考者,挖掘范式里行得通的一切都是 System One 式的。
RLVR 为 System 2 赢得过真实的敬畏,但其结果脆弱而锯齿——数学不只是 spiky,是分形的——对 Jev 的形状而言,RLVR 的最优量是零。
多跳性能随跳数增加单调下降,哪怕单跳已是 state-of-the-art——这是主持人对同一脆弱性给出的经验注脚。
后训练碎裂是大敌:chat 优先再加一个 reasoning 模式会把智能切开,同时优化两个目标本身就是“碎裂”这个动作,连身份也是碎裂——建在 API 上的聊天机器人该自称 Chipotle。
OpenAI 岁月被当作内部史复述:ChatGPT 是 Claude 的复制品(后者先在 Slack 上线)、OpenAI 擅长追赶胜过创新、Sam Altman 祝福了那份“机器调 API”的北极星文档——它后来长成了 TypeSafe。
KV 缓存在经济上把 coding agent 锁死在一个模型上——重读自己上下文的暴政——这正是 Claude Code 和 Codex 围绕单模型世界构建、也是 Diogo 为此专文著述的原因。
开发者界面是剩下的一条前沿:function-calling 接口疯了且反开发者、拒答阈值只能在 system message 里乞求、现有 coding agent 过拟合自家 harness 且用不满 MCP。

造给代码的智能:Jev、System One 与每美元智能的赌注

导语

Diogo Almeida 在 OpenAI 的那些年,工作就是教模型听懂人话——InstructGPT 是他力争着送上线的。离开时他带走了一个在实验室里没法做下去的问题:等 AI 真掀起一场经济革命,调 API 的究竟是谁?发布周,他的公司 TypeSafe 拿出了按这个答案造出来的模型 Jev;它刷屏的同一周,他来 Latent Space 和 swyx 长聊了一场——Jev 为什么不拒答,TypeSafe 为什么拒绝打基准,choice、score、nool 三个原语是给谁用的,他为什么不认同前沿实验室的配速共识,以及他最想把 coding agent 从什么东西里解放出来。

一场按 token 计量的发布

问他这几天做他自己是什么感受,他没表演喜悦: 情绪上,从没这么糟过 ——技术型 CEO 在发布周要扑的火太多了。发布本身则完全超出了预案。TypeSafe 判断行业需要一类新模型, 他们想出的最准确名字是 System One 模型 :机器原生、大型、可编程, 目标就是让代码当智能的消费者 ——而不是补全互联网的预训练 LLM,也不是 tuned 来回复人类的 RLHF 模型。他们原本预期的是一次低调的研究预览,用量却说明了一切:平台已经跨过 一天一万亿 token ,深夜仍在持续吞吐——是机器在调,不是人来尝鲜。他承认候补名单算个失误;对开发者平台来说注册数不重要,全人类每人来写几条查询,加起来也只是某个重度用户那条 for 循环的舍入误差。公司里连市场负责人都没有,外界封的“营销天才”,其实是一群人以真诚又没正形的本色拼命放人进来的样子。

他从 OpenAI 带走的那个问题

故事得从 InstructGPT 讲起。当年他极力推动部署——早期版本甚至是用他自己写的、没发表的算法训的,因为清洗 PPO 数据太慢—— 它基本上立刻拿下了当时 LLM 市场份额的 50% 。他们当时真心在问:这是不是 AGI?指令进、指令出,它是超人的。他后来给出的否定答案:它主要被拿去写文案 slop 了。于是他回到画板前,从一场基于 AI 的经济革命倒着往回推——如果 AI 是一个 API, 调用它的是人,还是代码? 他判断是代码,而且是许多个 9 那么高比例的代码,可当时所有优化都砸在“人”这一端。他写成文档,Sam 让他去做;他当时以为这件事明显到 Anthropic 肯定早就在做了。他对老东家的评价说得很直白:OpenAI 擅长追赶胜过擅长创新—— ChatGPT 是 Claude 的复制品 ,内部早就有,只是没发。真正把他推出门的是责任感: 如果 AI 寒冬发生,他会视自己为个人责任人 ——既为 RLHF 拉大了承诺与交付的落差,也为没有全押机器原生这个方向。他现在说,担心的那个寒冬已经解除。

拒答是个类型错误

他不反对安全这个原则,反对的是 safety alignment——在他看来它普遍与用户利益错位, 拒答显然是个类型错误 。人跟聊天机器人对话,被拒答烦人但能对付,他把接受这种情况比作斯德哥尔摩综合征;可拒答要发生在后台跑的依赖里,软件就因为某处一个用户发了条怪消息而随机崩溃,下游的人根本不知道为什么。他要的是别的东西:认知内核, 一个到处都能用的核心内核 ,通用到能撑住没人想到过的未来用例。它能接住人们扔来的各种怪东西并不奇怪,因为 他们训练用的东西更怪 。他划的界线是:capability alignment 是做用户想要的事——模型越可预测,工程师要写的测试越少;safety alignment 是执行别人的指令,对 ChatGPT 这样的产品说得通,放进一个要被人围着编程的 API 就是疯了。就个人而言,他愿意为好的用途把拇指压上天平,但绝不在技术层做:每向一个奇怪限制过拟合一次,智能就被碎裂一次,而现在的模型已经碎裂得够呛。

反基准与最苦的教训

这周的服务条款风波,其实是预览期遗留的基准条款,正在和律师确认后移除。他更深的立场是:公开基准与“对智能的信任”背道而驰,因为它们哪怕无意作弊也极端容易被钻空子—— 早年间每个实验室都有一支队伍,专门收集长得像 MMLU 的数据 ,无非是套了层的基准游戏。信任只能来自氛围,直到你把模型放进自己的工作流里评;TypeSafe 的工作就是不断把可靠性的九往上推。要是想犯傻,一年半前就能发 Jev。他的最苦的教训,riff 于 Sutton:算法胜过算力, 数据远比算力重要 ,而选对任务——找到北极星——是最难的一环。按他的统计,LLM 时代做成这件事大约 2.2 次:RLHF 把任务转向指令遵循,RLCD——程序进环、把人拿出来——是他们的新北极星,RLVR 算 0.2 次。TypeSafe 把自己当数据公司看:数据人才像艺术家,找到认知内核上的毛刺,用外科手术把它磨平。

可靠性,论“九”排

在他那里 reliability 是个兜底词:AI 自动化不了某件事时,缺的总是某种可靠性——类型安全、确定性,或者锯齿。确定性对单元测试有点意思,但属于错误的北极星;真正要紧的属性是 robustness—— 相似的输入,得到相似的输出 ——而 LLM 在这一项上烂得离谱。他们的测法之一是往提示里塞 UUID:语义上是同一个问题,你要的是每组都给出相近的答案。由此引出两个承诺。其一是对量化疑虑的回应: 部署之后,他们不会改模型 ——那是疯了;产品可以为体验折腾,API 不行,尽管他们的迭代速度会快得超出大家习惯。其二是站位:别的模型给的是“更快但更贵”,Jev 占的是“更快且更便宜”那个几乎没人占的象限,同时 把智能保持住——他说这才是难的那部分 。Jev 这个品牌就是每美元智能的前沿——名字来自杰文斯——而他内部反复强调:模型变聪明多少他不在乎,它必须待在前沿之内。

choice、score、nool:给程序用的原语

API 暴露了三个新原语:choice 对应 enum 上的 switch;score 对应排序和阈值判断;nool——连续的、boolish 的——对应 if 语句。名字本身就是那个点: 它是 Bernoulli(伯努利)这个名字的一个子集 ,来自伯努利概率,恰好就是这个东西的本体;他们也想过 peool、pool,还想叫 pool party。三个都刻意做成新概念而不是现成类型,因为 score 不是 int,宁可让人一时觉得没懂,也不要让人轻易以为懂了。更大的设计主张在输入侧:state、instructions、criteria 都可以是结构化 JSON,由程序直接插到正确的位置——不要模板,不要巨型 system message,他把后者叫作还得对着祈祷的恶心全局变量。这个模型就是为深藏在程序内脏里设计的,推荐做法是把一切拆开:问很多很多小问题,而不是一个大问题。回报是工程上的干净——与其问“这里该不该拒答”,不如对每种可以拒答的情形独立设问、按真实样例定阈值、把失败记成永不过期的测试用例。 这就像没有机器学习的机器学习 ,什么都能这么干——只是看到有人拿它做自动化交易,他会有点害怕;那一行,他说,还是留给专业人士,因为市场会变有效。

System One 与被碎裂的智能

一个任务是 System One 还是 System Two,在他看来跟 scaling law 一样是个经验问题——机器人砸了那么多钱还是不真正能用,未必是钱不够,可能就是经验结果不在那儿。他的经验判断是: 预训练出来的智能超浓缩体,本质上是 System One 思考者 ,在那个范式里行得通的一切都会是 System One 式的——所以不会有 reasoning Jev。三个训练时代各追各的北极星:RLHF 是“取悦人类”, RLVR 是“优化基准” ,RLCD 是“为程序化使用做到可靠”。他恨的是 chat 优先的优化把智能切碎:RLHF 天然产出人们抱怨的那些东西——谄媚、过度自信、幻觉、LM Arena 上拿高分的那套加粗斜体 emoji 文风——因为字符串这个介质会重罚跑偏,于是模型只能往过度自信里过拟合。连身份都是一种碎裂: 他不会往模型里写“你是 TypeSafe 的 Jev” ;他要模型代表互联网所想的,因为那才是平滑、可预测智能的来源。做聊天产品的人也不想让模型自称 ChatGPT——他们想让它说自己是 Chipotle。

反驳“给前沿配速”

全期最锋利的一段,是他对前沿实验室配速共识的进攻。技术上的起点:RLVR 其实并不是关于可验证的奖励 ——它关乎一切的形状,包括“任由模型想干什么就干什么”这个隐变量,好让它们尽可能强大。整场配速讨论假设所有人都需要做更多 RLVR;而对 TypeSafe 这种模型形状, 他认为零才是最优量 。吓到所有人的沙箱问题本可以轻松解决而没有解决,因为不受限的模型更强大。他从中看到一种责任扩散:论证内部自洽,起点却是一个存在替代方案的前提,最后得出“危险的路是唯一的路”。另一边,coding agent 的格局正在被重塑——Claude Code 和 Codex 是 围绕单模型世界构建的 ,因为 KV 缓存奖励往一个长上下文里不停追加;而处在近似平位的开源 agent 们,随时可以抄走任何一家找到的杀手级用例。当 swyx 逼他谈政治时,他转述了关门房间里听到的那句话: 这关乎 2028 年大选 ——他真希望自己没听到过。他不反安全,也同意实验室该想清楚监管者是谁;他拒绝的是误导人——哪怕为了更大的善——并且希望 TypeSafe 永远不玩那一套。

把 coding agent 从 KV 缓存里放出来

他自己最想交给别人去做的下一个前沿: 让 coding agent 摆脱 KV 缓存的暴政 ,也就是 他那篇《KV cache rules everything around me》 的主题。缓存解释了一连串怪现象:为什么 routing 难、为什么 sub-agent 看起来不管用、为什么 compaction 伤——它把你锁死在一个模型上,奖励不停追加,于是 agent 做不了正经的软件实践:状态管理、抽象、分解。他的草图:显式给状态打标签;对子任务树做检索,而不是把全部状态传回父任务;把“持续学习”当成它本来就是的内存管理问题;再加只读 agent,给蜂群写摘要。把这些想法抛出来的这个人,自评 创业精神第 0 百分位 ——从没想当 CEO,无法想象谁把这事儿干两遍——如今却前所未有地充电,因为使命终于说得出口了。它指向的终点是 一个智能界的 AWS ,今天的 System One 模型是它的 TCP 层——他说,上面还有七层要造,而 Temporal,他顺便 pitch 了一下,可以当第八层。

访谈精粹5 组核心对谈

主持人与特邀嘉宾原声对谈精选,支持精准时间戳跳转

Qswyx
04:27

Jev 是什么?TypeSafe 做的到底是哪一类模型?

ADiogo Almeida

我们需要一类新模型,目前想到的最准确名字是 System One 模型:机器原生、大型、可编程,消费者是代码。预训练大模型为“补全网上的文本”而生,RLHF 模型为“回复文本”而生,Jev 面向的是被代码直接消费——TypeSafe 这个名字就来自这里。让 AI 尽可能强大的路径是把它与软件整合,所以模型内部深处之外的一切都为软件优化。Jev 是第一个大型可编程模型,按“每美元智能”优化——Jevons 悖论由此得名——以后 Jev 就代表这条前沿上的模型;ML 本质是取舍,我们在这条轴上全力压上。我不打算叫它“决策模型”,System One 不止于决策。这次也不是真正的大发布,后面还有弹药。

Qswyx
08:06

LeCun 那页幻灯片说错误概率随序列长度上升——为什么它数学上显然、经验上却站不住?

ADiogo Almeida

那页幻灯片是我最爱拿来教人的例子:数学上显然,经验上不成立。错位在于:校准、覆盖分布的模型不会因离群被过度惩罚——有时在分布内、有时在外,所以 GAN 之前的模型才生成模糊图片;GAN 则选择丢模式,保高频、弃少数。要在长串输出里不犯错就得极端保守,因为错误一眼可见,而“看着对的细微处”没人看见——这种保守对字符串的概率分布是彻头彻尾的毒药。这就是为什么让字符串模型去做决策是件糟糕的事。

Qswyx
16:21

最难的反例来了——Jev 该不该拒绝帮人杀人?

ADiogo Almeida

这种观点有它务实的容身之处,但通用技术底座不是。我当然希望我们的东西别被用来杀人,也愿意为好用途倾斜资源——但绝不在技术层做,因为每往怪异处过拟合一次,智能就被再割裂一次,而它已经被割裂得够呛。智能会更像数据库而不是同事:没人要求数据库去审查 CIA 拿查询结果干什么。有人在 Slack 上注册、问能不能部署,我的回答是:你是开发者,我们是 API——我们本来就不该知道你下游的任务,因为任务该拆成小块。这种“不知道”恰恰是给软件工程师最大权限的边界。