
Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO
核心摘要
发布次日,Diogo Almeida——GPT-3/3.5 时代的 OpenAI 工程师、InstructGPT 老兵、现为 TypeSafe 联合创始人——做客 Latent Space,核心论点是整个行业一直在为错误的消费者优化错误的模型。预训练 LLM 在补全互联网,RLHF 模型被造出来是为了回复文本;Jev 则是第一个大型可编程模型:一个 System One 模型,由代码消费、按每美元智能优化,名字取自杰文斯悖论——便宜的智能会扩张总用量。发布周的颜色定下基调:一天已服务约一万亿 token、调 API 的是机器不是人、真正的需求信号是限流压力;部署纪律借自数据库——模型出厂即冻结、不承诺长期支持、Jev 1.13.0 可能被临时 LTS。 思想内核是后训练北极星的三分:RLHF 取悦人类,RLVR 优化基准,RLCD 为程序化使用做到可靠。预训练的智能浓缩体本质上是 System One 思考者;RLVR 为 System 2 赢得过真实的敬畏,但结果脆弱而锯齿——数学不只是 spiky,是分形的——对 Jev 的形状,RLVR 的最优量是零。chat 优先训练再加一个 reasoning 模式会逼着智能碎裂:RLHF 天然买来谄媚、过度自信、幻觉和 LM Arena 文风,字符串生成本身就要求失准与丢模式,连身份也是碎裂——建在 API 上的聊天机器人该自称 Chipotle。校准的讨论从 LeCun 那页错误概率幻灯片(数学上显然、经验上错误)一路推进到最硬的反对意见:Jev 不该在技术层拒答,因为智能会更像数据库,而不是同事。 后半段是历史与市场格局:安全派接管 OpenAI 的那场政变、InstructGPT 之战(未发表的算法、50% 的 LLM 份额)、指令遵循的“我们赢了”、Sam Altman 对那份“机器调 API”文档的祝福,以及 ChatGPT 是 Claude 复制品的说法。Claude Code 和 Codex 领先 coding agent,恰恰因为它们围绕单模型世界构建,而 KV 缓存——Diogo 自己文章的主题——在经济上把 agent 锁进那个世界,把持续学习重新定义为内存管理。“给前沿配速”被驳为一场戏法,本可轻松解决的沙箱问题被留而不解;收尾是一段开发者体验控诉:function-calling 接口疯了、拒答阈值只能在 system message 里乞求,而终点预言是一个智能界的 AWS。
章节看点与核心要点
造给代码的智能:Jev、System One 与每美元智能的赌注
导语
Diogo Almeida 在 OpenAI 的那些年,工作就是教模型听懂人话——InstructGPT 是他力争着送上线的。离开时他带走了一个在实验室里没法做下去的问题:等 AI 真掀起一场经济革命,调 API 的究竟是谁?发布周,他的公司 TypeSafe 拿出了按这个答案造出来的模型 Jev;它刷屏的同一周,他来 Latent Space 和 swyx 长聊了一场——Jev 为什么不拒答,TypeSafe 为什么拒绝打基准,choice、score、nool 三个原语是给谁用的,他为什么不认同前沿实验室的配速共识,以及他最想把 coding agent 从什么东西里解放出来。
一场按 token 计量的发布
问他这几天做他自己是什么感受,他没表演喜悦: 情绪上,从没这么糟过 Diogo Almeida 01:45 “Emotionally, um, never been worse.” 原声音频直达锚点 播放原声 01:45 ——技术型 CEO 在发布周要扑的火太多了。发布本身则完全超出了预案。TypeSafe 判断行业需要一类新模型, 他们想出的最准确名字是 System One 模型 Diogo Almeida 04:57 “our most accurate name we've come up with is System One models” 原声音频直达锚点 播放原声 04:57 :机器原生、大型、可编程, 目标就是让代码当智能的消费者 Diogo Almeida 05:32 “the goal is for code to be the consumer” 原声音频直达锚点 播放原声 05:32 ——而不是补全互联网的预训练 LLM,也不是 tuned 来回复人类的 RLHF 模型。他们原本预期的是一次低调的研究预览,用量却说明了一切:平台已经跨过 一天一万亿 token Diogo Almeida 37:10 “A trillion tokens a day is a lot” 原声音频直达锚点 播放原声 37:10 ,深夜仍在持续吞吐——是机器在调,不是人来尝鲜。他承认候补名单算个失误;对开发者平台来说注册数不重要,全人类每人来写几条查询,加起来也只是某个重度用户那条 for 循环的舍入误差。公司里连市场负责人都没有,外界封的“营销天才”,其实是一群人以真诚又没正形的本色拼命放人进来的样子。
他从 OpenAI 带走的那个问题
故事得从 InstructGPT 讲起。当年他极力推动部署——早期版本甚至是用他自己写的、没发表的算法训的,因为清洗 PPO 数据太慢—— 它基本上立刻拿下了当时 LLM 市场份额的 50% Diogo Almeida 01:58:49 “basically immediately it took 50% of the market share of LLMs at the time” 原声音频直达锚点 播放原声 01:58:49 。他们当时真心在问:这是不是 AGI?指令进、指令出,它是超人的。他后来给出的否定答案:它主要被拿去写文案 slop 了。于是他回到画板前,从一场基于 AI 的经济革命倒着往回推——如果 AI 是一个 API, 调用它的是人,还是代码? Diogo Almeida 01:59:52 “Will it be humans or it'll be code? And I figured it was many nines of code” 原声音频直达锚点 播放原声 01:59:52 他判断是代码,而且是许多个 9 那么高比例的代码,可当时所有优化都砸在“人”这一端。他写成文档,Sam 让他去做;他当时以为这件事明显到 Anthropic 肯定早就在做了。他对老东家的评价说得很直白:OpenAI 擅长追赶胜过擅长创新—— ChatGPT 是 Claude 的复制品 Diogo Almeida 02:00:35 “ChatGPT was a copy of Claude” 原声音频直达锚点 播放原声 02:00:35 ,内部早就有,只是没发。真正把他推出门的是责任感: 如果 AI 寒冬发生,他会视自己为个人责任人 Diogo Almeida 35:55 “I would see myself as personally responsible” 原声音频直达锚点 播放原声 35:55 ——既为 RLHF 拉大了承诺与交付的落差,也为没有全押机器原生这个方向。他现在说,担心的那个寒冬已经解除。
拒答是个类型错误
他不反对安全这个原则,反对的是 safety alignment——在他看来它普遍与用户利益错位, 拒答显然是个类型错误 Diogo Almeida 13:30 “refusal is just like obviously a type error” 原声音频直达锚点 播放原声 13:30 。人跟聊天机器人对话,被拒答烦人但能对付,他把接受这种情况比作斯德哥尔摩综合征;可拒答要发生在后台跑的依赖里,软件就因为某处一个用户发了条怪消息而随机崩溃,下游的人根本不知道为什么。他要的是别的东西:认知内核, 一个到处都能用的核心内核 Diogo Almeida 14:34 “Like the cognitive core” 原声音频直达锚点 播放原声 14:34 ,通用到能撑住没人想到过的未来用例。它能接住人们扔来的各种怪东西并不奇怪,因为 他们训练用的东西更怪 Diogo Almeida 14:53 “we trained on weirder stuff” 原声音频直达锚点 播放原声 14:53 。他划的界线是:capability alignment 是做用户想要的事——模型越可预测,工程师要写的测试越少;safety alignment 是执行别人的指令,对 ChatGPT 这样的产品说得通,放进一个要被人围着编程的 API 就是疯了。就个人而言,他愿意为好的用途把拇指压上天平,但绝不在技术层做:每向一个奇怪限制过拟合一次,智能就被碎裂一次,而现在的模型已经碎裂得够呛。
反基准与最苦的教训
这周的服务条款风波,其实是预览期遗留的基准条款,正在和律师确认后移除。他更深的立场是:公开基准与“对智能的信任”背道而驰,因为它们哪怕无意作弊也极端容易被钻空子—— 早年间每个实验室都有一支队伍,专门收集长得像 MMLU 的数据 Diogo Almeida 21:16 “every lab had a team to collect data that looks like MMLU” 原声音频直达锚点 播放原声 21:16 ,无非是套了层的基准游戏。信任只能来自氛围,直到你把模型放进自己的工作流里评;TypeSafe 的工作就是不断把可靠性的九往上推。要是想犯傻,一年半前就能发 Jev。他的最苦的教训,riff 于 Sutton:算法胜过算力, 数据远比算力重要 Diogo Almeida 22:18 “data matters way more than compute” 原声音频直达锚点 播放原声 22:18 ,而选对任务——找到北极星——是最难的一环。按他的统计,LLM 时代做成这件事大约 2.2 次:RLHF 把任务转向指令遵循,RLCD——程序进环、把人拿出来——是他们的新北极星,RLVR 算 0.2 次。TypeSafe 把自己当数据公司看:数据人才像艺术家,找到认知内核上的毛刺,用外科手术把它磨平。
可靠性,论“九”排
在他那里 reliability 是个兜底词:AI 自动化不了某件事时,缺的总是某种可靠性——类型安全、确定性,或者锯齿。确定性对单元测试有点意思,但属于错误的北极星;真正要紧的属性是 robustness—— 相似的输入,得到相似的输出 Diogo Almeida 43:53 “given similar inputs get similar outputs” 原声音频直达锚点 播放原声 43:53 ——而 LLM 在这一项上烂得离谱。他们的测法之一是往提示里塞 UUID:语义上是同一个问题,你要的是每组都给出相近的答案。由此引出两个承诺。其一是对量化疑虑的回应: 部署之后,他们不会改模型 Diogo Almeida 49:40 “we will not change our models when we deploy them. That is insane” 原声音频直达锚点 播放原声 49:40 ——那是疯了;产品可以为体验折腾,API 不行,尽管他们的迭代速度会快得超出大家习惯。其二是站位:别的模型给的是“更快但更贵”,Jev 占的是“更快且更便宜”那个几乎没人占的象限,同时 把智能保持住——他说这才是难的那部分 Diogo Almeida 54:18 “while holding intelligence constant” 原声音频直达锚点 播放原声 54:18 。Jev 这个品牌就是每美元智能的前沿——名字来自杰文斯——而他内部反复强调:模型变聪明多少他不在乎,它必须待在前沿之内。
choice、score、nool:给程序用的原语
API 暴露了三个新原语:choice 对应 enum 上的 switch;score 对应排序和阈值判断;nool——连续的、boolish 的——对应 if 语句。名字本身就是那个点: 它是 Bernoulli(伯努利)这个名字的一个子集 Diogo Almeida 56:11 “a subset of the name Bernoulli” 原声音频直达锚点 播放原声 56:11 ,来自伯努利概率,恰好就是这个东西的本体;他们也想过 peool、pool,还想叫 pool party。三个都刻意做成新概念而不是现成类型,因为 score 不是 int,宁可让人一时觉得没懂,也不要让人轻易以为懂了。更大的设计主张在输入侧:state、instructions、criteria 都可以是结构化 JSON,由程序直接插到正确的位置——不要模板,不要巨型 system message,他把后者叫作还得对着祈祷的恶心全局变量。这个模型就是为深藏在程序内脏里设计的,推荐做法是把一切拆开:问很多很多小问题,而不是一个大问题。回报是工程上的干净——与其问“这里该不该拒答”,不如对每种可以拒答的情形独立设问、按真实样例定阈值、把失败记成永不过期的测试用例。 这就像没有机器学习的机器学习 Diogo Almeida 01:07:46 “ML without the ML” 原声音频直达锚点 播放原声 01:07:46 ,什么都能这么干——只是看到有人拿它做自动化交易,他会有点害怕;那一行,他说,还是留给专业人士,因为市场会变有效。
System One 与被碎裂的智能
一个任务是 System One 还是 System Two,在他看来跟 scaling law 一样是个经验问题——机器人砸了那么多钱还是不真正能用,未必是钱不够,可能就是经验结果不在那儿。他的经验判断是: 预训练出来的智能超浓缩体,本质上是 System One 思考者 Diogo Almeida 01:22:02 “fundamentally System One thinkers” 原声音频直达锚点 播放原声 01:22:02 ,在那个范式里行得通的一切都会是 System One 式的——所以不会有 reasoning Jev。三个训练时代各追各的北极星:RLHF 是“取悦人类”, RLVR 是“优化基准” Diogo Almeida 01:23:17 “RLVR is optimized benchmarks” 原声音频直达锚点 播放原声 01:23:17 ,RLCD 是“为程序化使用做到可靠”。他恨的是 chat 优先的优化把智能切碎:RLHF 天然产出人们抱怨的那些东西——谄媚、过度自信、幻觉、LM Arena 上拿高分的那套加粗斜体 emoji 文风——因为字符串这个介质会重罚跑偏,于是模型只能往过度自信里过拟合。连身份都是一种碎裂: 他不会往模型里写“你是 TypeSafe 的 Jev” Diogo Almeida 01:56:04 “you are Jev from TypeSafe that fractures it” 原声音频直达锚点 播放原声 01:56:04 ;他要模型代表互联网所想的,因为那才是平滑、可预测智能的来源。做聊天产品的人也不想让模型自称 ChatGPT——他们想让它说自己是 Chipotle。
反驳“给前沿配速”
全期最锋利的一段,是他对前沿实验室配速共识的进攻。技术上的起点:RLVR 其实并不是关于可验证的奖励 Diogo Almeida 01:44:05 “RLVR is not actually about verifiable rewards” 原声音频直达锚点 播放原声 01:44:05 ——它关乎一切的形状,包括“任由模型想干什么就干什么”这个隐变量,好让它们尽可能强大。整场配速讨论假设所有人都需要做更多 RLVR;而对 TypeSafe 这种模型形状, 他认为零才是最优量 Diogo Almeida 01:45:36 “I think zero is the optimal amount” 原声音频直达锚点 播放原声 01:45:36 。吓到所有人的沙箱问题本可以轻松解决而没有解决,因为不受限的模型更强大。他从中看到一种责任扩散:论证内部自洽,起点却是一个存在替代方案的前提,最后得出“危险的路是唯一的路”。另一边,coding agent 的格局正在被重塑——Claude Code 和 Codex 是 围绕单模型世界构建的 Diogo Almeida 01:40:26 “built around a single model world” 原声音频直达锚点 播放原声 01:40:26 ,因为 KV 缓存奖励往一个长上下文里不停追加;而处在近似平位的开源 agent 们,随时可以抄走任何一家找到的杀手级用例。当 swyx 逼他谈政治时,他转述了关门房间里听到的那句话: 这关乎 2028 年大选 Diogo Almeida 02:06:42 “this is about the 2028 election” 原声音频直达锚点 播放原声 02:06:42 ——他真希望自己没听到过。他不反安全,也同意实验室该想清楚监管者是谁;他拒绝的是误导人——哪怕为了更大的善——并且希望 TypeSafe 永远不玩那一套。
把 coding agent 从 KV 缓存里放出来
他自己最想交给别人去做的下一个前沿: 让 coding agent 摆脱 KV 缓存的暴政 Diogo Almeida 02:11:09 “That's why I wrote the article KV cache rules everything around me” 原声音频直达锚点 播放原声 02:11:09 ,也就是 他那篇《KV cache rules everything around me》 Diogo (completeskeptic.com) 背景报道 2026-09-09 (KV) Cache Rules Everything Around Me 独立媒体核实报道 阅读原文报道 的主题。缓存解释了一连串怪现象:为什么 routing 难、为什么 sub-agent 看起来不管用、为什么 compaction 伤——它把你锁死在一个模型上,奖励不停追加,于是 agent 做不了正经的软件实践:状态管理、抽象、分解。他的草图:显式给状态打标签;对子任务树做检索,而不是把全部状态传回父任务;把“持续学习”当成它本来就是的内存管理问题;再加只读 agent,给蜂群写摘要。把这些想法抛出来的这个人,自评 创业精神第 0 百分位 Diogo Almeida 02:16:26 “zeroth percentile entrepreneurial” 原声音频直达锚点 播放原声 02:16:26 ——从没想当 CEO,无法想象谁把这事儿干两遍——如今却前所未有地充电,因为使命终于说得出口了。它指向的终点是 一个智能界的 AWS Diogo Almeida 02:21:33 “an AWS of like intelligence” 原声音频直达锚点 播放原声 02:21:33 ,今天的 System One 模型是它的 TCP 层——他说,上面还有七层要造,而 Temporal,他顺便 pitch 了一下,可以当第八层。
访谈精粹5 组核心对谈
主持人与特邀嘉宾原声对谈精选,支持精准时间戳跳转
Jev 是什么?TypeSafe 做的到底是哪一类模型?
我们需要一类新模型,目前想到的最准确名字是 System One 模型:机器原生、大型、可编程,消费者是代码。预训练大模型为“补全网上的文本”而生,RLHF 模型为“回复文本”而生,Jev 面向的是被代码直接消费——TypeSafe 这个名字就来自这里。让 AI 尽可能强大的路径是把它与软件整合,所以模型内部深处之外的一切都为软件优化。Jev 是第一个大型可编程模型,按“每美元智能”优化——Jevons 悖论由此得名——以后 Jev 就代表这条前沿上的模型;ML 本质是取舍,我们在这条轴上全力压上。我不打算叫它“决策模型”,System One 不止于决策。这次也不是真正的大发布,后面还有弹药。
LeCun 那页幻灯片说错误概率随序列长度上升——为什么它数学上显然、经验上却站不住?
那页幻灯片是我最爱拿来教人的例子:数学上显然,经验上不成立。错位在于:校准、覆盖分布的模型不会因离群被过度惩罚——有时在分布内、有时在外,所以 GAN 之前的模型才生成模糊图片;GAN 则选择丢模式,保高频、弃少数。要在长串输出里不犯错就得极端保守,因为错误一眼可见,而“看着对的细微处”没人看见——这种保守对字符串的概率分布是彻头彻尾的毒药。这就是为什么让字符串模型去做决策是件糟糕的事。
最难的反例来了——Jev 该不该拒绝帮人杀人?
这种观点有它务实的容身之处,但通用技术底座不是。我当然希望我们的东西别被用来杀人,也愿意为好用途倾斜资源——但绝不在技术层做,因为每往怪异处过拟合一次,智能就被再割裂一次,而它已经被割裂得够呛。智能会更像数据库而不是同事:没人要求数据库去审查 CIA 拿查询结果干什么。有人在 Slack 上注册、问能不能部署,我的回答是:你是开发者,我们是 API——我们本来就不该知道你下游的任务,因为任务该拆成小块。这种“不知道”恰恰是给软件工程师最大权限的边界。