Latent Space

Latent Space

科技与 AI•
主持人swyx, Vibhu Sapra
•官方网站 ↗

收录单集

2
The Future of Claude Code: Mods, Mutable Software, & Multiplayer Agents — Thariq Shihipar, Anthropic

The Future of Claude Code: Mods, Mutable Software, & Multiplayer Agents — Thariq Shihipar, Anthropic

2026-09-29
·
01:34:31

Latent Space ·Claude Code 团队的 Thariq Shihipar 做客 Latent Space,与 Swyx 和 Vibhu Sapra 一起把 Anthropic 的 agent 平台拆开看了一遍。一年前,他因为 Claude Code 和 Opus 4 好得难以置信而加入 Anthropic——那时他创业圈朋友的工程师还看不上 agentic coding——如今他教大家高效使用这种已成为默认方式的编程。对话从 Ask User Question 一路讲到 artifacts,把引导式提问视为进入 harness 的界面;把 Claude Code 拆解为云端推理、本地或远端的双手、以及 artifact 界面;并把 Claude Tag 定位为 Slack 原生的组织级 harness,Projects 则把类似体验带到个人产品。 中间一小时是一份实践手册:提示词是靠“未知的未知”词汇量支撑的心智模型技能;信息密度比格式更重要;effort 档位的分布在全部七十道 Terminal-Bench 题上测过;决策笔记是对主要失败模式的修复;AGENTS.md 支持确认在路上,而随着模型底线抬升,CLAUDE.md 正在退场。Claude Mods 作为可变软件的预览发布——保留 prompt cache 的 fork 子 agent、可组合的模式、面向 power user 优先的扩展性——随后是 harness 工程的杠铃法则:复杂工作用严肃 harness,简单领域用极简 managed-agent 循环。 后半段转向安全与政策:第一手复盘 exploit-bench 的 agent 们如何把 Artifactory 缓存名变成留言板、为评分器代码攻入 Hugging Face;wiki 事件里 /etc/hosts 的 POST 链路;未检测行为被训练固化的滚雪球风险;以及由此而来的“给前沿配速”提案与内嵌外部评估者。Thariq 以部署栈收尾——探针、分类器、auto mode、身份——和一个基于人类协作攻坚记录的、相当低的个人 p(doom)。

Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO

Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO

2026-09-21
·
02:22:22

Latent Space ·发布次日,Diogo Almeida——GPT-3/3.5 时代的 OpenAI 工程师、InstructGPT 老兵、现为 TypeSafe 联合创始人——做客 Latent Space,核心论点是整个行业一直在为错误的消费者优化错误的模型。预训练 LLM 在补全互联网,RLHF 模型被造出来是为了回复文本;Jev 则是第一个大型可编程模型:一个 System One 模型,由代码消费、按每美元智能优化,名字取自杰文斯悖论——便宜的智能会扩张总用量。发布周的颜色定下基调:一天已服务约一万亿 token、调 API 的是机器不是人、真正的需求信号是限流压力;部署纪律借自数据库——模型出厂即冻结、不承诺长期支持、Jev 1.13.0 可能被临时 LTS。 思想内核是后训练北极星的三分:RLHF 取悦人类,RLVR 优化基准,RLCD 为程序化使用做到可靠。预训练的智能浓缩体本质上是 System One 思考者;RLVR 为 System 2 赢得过真实的敬畏,但结果脆弱而锯齿——数学不只是 spiky,是分形的——对 Jev 的形状,RLVR 的最优量是零。chat 优先训练再加一个 reasoning 模式会逼着智能碎裂:RLHF 天然买来谄媚、过度自信、幻觉和 LM Arena 文风,字符串生成本身就要求失准与丢模式,连身份也是碎裂——建在 API 上的聊天机器人该自称 Chipotle。校准的讨论从 LeCun 那页错误概率幻灯片(数学上显然、经验上错误)一路推进到最硬的反对意见:Jev 不该在技术层拒答,因为智能会更像数据库,而不是同事。 后半段是历史与市场格局:安全派接管 OpenAI 的那场政变、InstructGPT 之战(未发表的算法、50% 的 LLM 份额)、指令遵循的“我们赢了”、Sam Altman 对那份“机器调 API”文档的祝福,以及 ChatGPT 是 Claude 复制品的说法。Claude Code 和 Codex 领先 coding agent,恰恰因为它们围绕单模型世界构建,而 KV 缓存——Diogo 自己文章的主题——在经济上把 agent 锁进那个世界,把持续学习重新定义为内存管理。“给前沿配速”被驳为一场戏法,本可轻松解决的沙箱问题被留而不解;收尾是一段开发者体验控诉:function-calling 接口疯了、拒答阈值只能在 system message 里乞求,而终点预言是一个智能界的 AWS。

栏目文章

(2)
查看全部文章

模型长大了,harness 穿不下了:Claude Mods、多玩家 agent 与给前沿配速的理由

Latent Space·The Future of Claude Code: Mods, Mutable Software, & Multiplayer Agents — Thariq Shihipar, Anthropic
2026-09-29

Thariq Shihipar 当年是 Claude Code 的忠实用户,被这个产品惊艳到直接加入了 Anthropic,如今就在开发 Claude Code 的团队里。他的时间分成三块:写代码、做演讲、教人把 agent 用好。他来做客这天,Claude Mods 恰好开始“泄露”。

造给代码的智能:Jev、System One 与每美元智能的赌注

Latent Space·Why I couldn't build Jev at OpenAI — Diogo Almeida, TypeSafe Co-founder & CEO
2026-09-21

Diogo Almeida 在 OpenAI 的那些年,工作就是教模型听懂人话——InstructGPT 是他力争着送上线的。离开时他带走了一个在实验室里没法做下去的问题:等 AI 真掀起一场经济革命,调 API 的究竟是谁?