← 科研空间 首页

行业访谈 · 2026-08-26

OpenAI 内部视角:从算力重置、超快模式到个人 AGI

中文讲义 HTML 版:前 OpenAI 成员 Tibo 内部视角访谈,从超快模式、ChatGPT/Codex 融合、递归自我改进到个人 AGI 演进路线。

整理:cnfjlhj & Pi
OpenAI 内部视角:从算力重置、超快模式到个人 AGI
页面基于小宇宙播客转写与已生成讲义转换;节目与嘉宾信息保留为来源元数据。

阅读路线

这页由已完成的 LaTeX 讲义转换而来,保留原讲义的章节、重点框、代码块、公式和关键视频帧;适合在博客中快速阅读,也可回到 PDF 查看完整排版版本。

导读:本材料真正要解决的问题 主线讲义:按教学逻辑重建 逐段细读地图(14 章节对齐) 最终综合与复习路线 待确认与证据附录

导读:本材料真正要解决的问题

讲座可按 shownotes 的四大主题切分:(1) 从 DeepMind 到 OpenAI 的文化差异;(2) 下一代 Agent 与人机交互范式;(3) 竞争定位、社区善意与算力规划;(4) 递归自我改进与超快模式的未来。本讲义按教学逻辑重建,先讲组织文化如何决定「能不能发布」,再讲产品范式如何随模型能力跃迁,最后落到算力效率与递归改进这条「让顶尖智能普惠化」的暗线。

主线讲义:按教学逻辑重建

组织文化:为什么发布能力本身就是护城河

内容复原(来源事实)。

  • DeepMind 的语言模型组拿到了相当不错的结果,自然冒出「能不能做成可以聊天的东西」的想法——这就是 LMChat(内部 MagChat)的起源。它先内部用,后来有做成公开工具的雄心。
  • Tibo 回忆当时「第一次意识到你能得到连贯的文本和有帮助的东西」,模型「一开始更多是搞笑而不是有用,然后慢慢变得越来越有用」。
  • 但 DeepMind「从那个意义上说,机制就不是为了发布产品而设的」。

OpenAI 的自下而上文化:授权与质量的平衡

关键细节复原。 他以 ChatGPT iOS App 为例,称其「算得上是市面上最好的 App之一」,OpenAI 在「愉悦感、性能、效率、简洁」上投入很多。总原则是:保留「授权每个人尝试新事物并快速发布」,同时用产品质量标杆来约束方向。这两者并不矛盾——质量标杆是方向,授权是速度

给创业者的建议:信念、反馈与颠覆自己

内容复原(来源事实)。 Tibo 给创业者的建议有三层: enumerate

  • 要有信念,想办法拥有用户。
  • 根据反馈非常快速地迭代
  • 愿意颠覆自己——这对创业者没那么相关,但对 OpenAI 这样的公司很关键:一直提出新的研究和想法,并识别什么时候是投入的正确时机,「即使这意味着可能要从主页重新调配资源」。
  • enumerate

    下一代 Agent:为什么笔记本电脑成了瓶颈

    关键细节复原:当前 Agent 的笨拙。 Tibo 诚实描述了当前 Codex 等编程 Agent 的痛点:

    • 技能文件(skill file):算是教 Agent 东西的方式,但时间长了「其实有点难维护」。
    • 记忆功能:并不总能记住所有事。
    • 子 Agent:要操心子 Agent,它像「构建了一个小网络」,交互时「感觉会在很多地方被打破」。

    他想要的终态是一个「能深入懂你、懂你的目标、懂你的日常、也懂你的团队在做什么的助手」,主动出击、不打破那种「身边有完美专属搭档」的感觉。

    超快模式:从「管理 15 个并发 Agent」回到「心流」

    内容复原:两种工作流的对比。

    • 当前(普通速度):Tibo 会并行启动 10--15 个 Agent,每个预计等 30--45 分钟才返回。这带来「相当大的认知开销」和持续的上下文切换。
    • 超快模式后:工作流发生大变化。也许一次就 3--4 个 Agent。Tibo 自己有多动症,一直切换上下文,但他承认「有时我也确实只想专注于一件事情,那这时候超快模式就很让人愉快了,因为能让你一直沉浸在心流里」。

    两种智能未来:个人 AGI 与全自动化

    ChatGPT 与 Codex 的融合:消除技术界面的连续光谱

    非语言交互:从文本到白板与表情

    内容复原。 主持人追问:人类交流很大一部分是非语言的(手势、面部表情),未来 AI 能感知多少?Tibo 的回答是「我觉得是的」。他描绘的未来:走进办公室在白板上写点东西、有了想法,它「应该能够出现在那里并且能够理解」;或者直接语音对话。自从上线 ChatGPT Voice,仅通过语音互动的用户数量增长得非常快。经验是:每次向更自然的方式倾斜,人类就会选择阻力最小的路径——小框打字对一些人也许自然,但一旦有更容易用的东西,人们就直接去用它。

    面对竞争:聚焦独特优势与最大化普及

    内容复原(来源事实)。 主持人提到 Anthropic 曾抢尽风头、后来情况又变了。Tibo 的回应核心是「不太去关注竞争对手」:

    • 真正关注的是「我们有什么独特的优势、我们的价值观是什么、以及我们要怎么以最快的速度朝这些目标推进」。
    • OpenAI 做得好的一点是「关心世界、关心我们如何把这项非常强大的技术交到尽可能多的人手中」。
    • 合并 Codex 和 ChatGPT 就是这种愿望的体现——「无论你是产品经理、设计师还是做销售、市场公关,你都应该能用上这一切」。
    • 通过 ChatGPT 迅速分发,已有大量用户,推动增长(如 Codex 用户达 2000 万)。

    「实体重置按钮」:补偿机制如何积累社区善意

    关键细节复原(来源事实)。 Tibo 讲了 OpenAI「额度重置」文化的起源,颇为反直觉:

    • OpenAI 是「一个你可以想做就去做的公司」。快速迭代把东西弄坏或配置出问题时,给用户补偿「感觉就是对的」——「既然我们不小心弄崩了大概 30 分钟,那就送你一些额外的额度吧」。
    • 背后并没有层层审批,「不是跟市场部或者财务部一起商量着来的」,就是「我想按随时都可以按,只要觉得合适就行」。
    • 现在甚至有了一个实体重置按钮
    • 原则:「我们正在努力打造很棒的东西,一旦没做好,我们就会去弥补。」
    • 也用于庆祝时刻——上线新功能时送额度让用户去探索(「你还没用过 Ultra 吗?这里送你一些额外的额度去试试」)。

    算力规划:前瞻性投资与「用模型重构推理基础设施」

    递归自我改进:不止于「模型训模型」

    内容复原。 具体包括:

    • 推理技术栈:硬件、用到的 Kernel、CUDA Kernel。
    • 开发新产品:与模型交互的更高效的新方式。
    • 云端 Agent:如果搞定云端 Agent,「突然之间你的生产力也会大幅提升」——这反过来增强了发挥模型效用的能力,也算某种形式的递归自我改进。

    Tibo 直白地说:「我们当然在这么做。如果我们不这么做,我觉得那才挺蠢的。」

    强化学习暂停风波:安全与对齐的必要加固

    内容复原(来源事实)。 Sam Altman 曾提到 OpenAI 暂停了强化学习最前沿的研发。Tibo 解释:

    • 这「很大程度上属于研究范畴」。
    • 随着模型能力不断提升,「非常明显的是对齐和安全这方面变得越来越重要」。
    • 在安全方面出现了「一次巨大的激增」式投入。
    • 暂停「在某种程度上是必要的,好让团队和个人真正理解并加固系统的所有部分,从而确保我们在完全彻底掌控的情况下重启训练」。
    • 安全团队内部是「边做边讨论边探索的过程」,后来「达成了一套相当明确的原则」,一旦达到就处于比较好的状态。

    超快模式的内部应用场景

    内容复原(来源事实)。 OpenAI 内部超快模式的使用场景:

    • 紧要关头:当机时,事件指挥官和应急响应团队会用超快模式,因为「分秒必争」。
    • 关键项目/自认关键的想法:有人觉得自己想法「可能会很特别,必须试一下」,但周一就得决定要不要放进 DevDay(开发者日)——「行,当然去用超快模式吧」。
    • 宠物:「不算极其关键,但我很喜欢我的宠物,它一直在我的屏幕上」,接入视频通话时也是——「我觉得这非常令人开心」。(这部分展示了 OpenAI 内部的轻松文化。)
    • 多动症 vs 专注:主持人说自己有多动症但不想一直切换上下文;Tibo 说自己有多动症、一直在切换上下文,但「有时也想专注于一件事情」,那时超快模式就让人愉快。

    成本下降与智能普惠:六个月后前沿模型将极其廉价

    面向广泛受众的收尾(来源事实)。 对那些对 AI 焦虑的人,Tibo 的回答落到具体:

    • ChatGPT「已经在非常个人化、深层次的方面帮助人们」——辅助写作、寻求个人建议、医疗建议(上线了健康和理财功能)。
    • 他自己经常用,「觉得自己得到了很多支持,要是没有它我是很难获得的」——比如去看医生之前了解得更充分。
    • 建议:「不用看太远」,多跟别人聊聊、看别人怎么用、从中获得什么帮助,「可能就是开始考虑自己能怎么用好它的好办法」。

    这把「智能普惠化」从抽象命题拉回到「一个普通人在看医生前能多了解一点」的具体价值。

    逐段细读地图(14 章节对齐)

    00:55 从 DeepMind 到 OpenAI 的文化差异

    内容复原。 Tibo 在 DeepMind 做加速研究的基础设施和产品。DeepMind 有语言模型组、做模型扩展、拿到不错结果,自然冒出 LMChat(内部 MagChat)。但 DeepMind「机制就不是为了发布产品而设的」。OpenAI 则「研究和产品团队合作超级紧密」「非常倾向于发布、让大家都能用上」。

    02:21 亲历 LMChat:谷歌为何错失先机

    内容复原。 LMChat 比 ChatGPT 早约一年。先内部用,后有公开雄心。「第一次意识到你能得到连贯的文本和有帮助的东西」,模型「一开始搞笑,慢慢变得有用」。但 DeepMind「被禁止推出可能颠覆谷歌的产品」,「太紧张了不敢发布」。Tibo「经常琢磨这件事」。

    04:45 OpenAI 的自下而上文化与颠覆自己的勇气

    内容复原。 自下而上、充分授权、快速发布。平衡:用「简洁感」和产品质量自豪感约束方向(ChatGPT iOS App 是市面上最好的 App 之一)。从 DeepMind 带来的教训:保留好的(授权+快速发布),避免坏的(搞成一锅杂烩)。

    07:29 给创业者的建议:倾听反馈与快速重新调配资源

    内容复原。 三层建议:有信念+拥有用户;根据反馈快速迭代;愿意颠覆自己(从主页重新调配资源)。难点:成熟公司有摇钱树,新东西只是「可能很酷」。OpenAI 解法:非常非常往前看。反直觉:基准测试不告诉你一切,要实际玩模型——ChatGPT Voice 改变了产品思考方式。

    10:30 下一代模型演进:为什么笔记本电脑成了瓶颈

    内容复原。 Harness 创新空间:语音、记忆、子 Agent。当前 Agent 笨拙(技能文件难维护、记忆不全、子 Agent 打破体验)。笔记本电脑为人类设计(打字速度、应用数量),模型没这些限制——指向云端 Agent。

    12:27 并行 Agent 开销 vs 超快模式下的心流体验

    内容复原。 超快 10--14 倍。带宽限制改变后 CPU/工具调用/网络成瓶颈。可并发弥补(探索+测试+编译同时)。当前:并行 10--15 个 Agent、等 30--45 分钟、认知开销大。超快后:3--4 个、保持心流。对注意力更友好=为人做产品的核心。

    13:56 两种智能未来:个人 Agent 与端到端全自动化

    内容复原。 两类问题:(1) 个人 AGI——同频、主动、扎根于对独特个体的理解;(2) 全自动化——日志自动优化、回归自动打补丁、漏洞自动修复,极少人工,只批准高风险。控制度相反。

    19:39 ChatGPT 与 Codex 的融合:连续光谱

    内容复原。 用户问「为什么合并」。「未来模型需要合并。」同一套技术、测试框架、思考方式。多模态、语音核心、高效。人群是连续光谱,标签是抽象。终局:同一个界面,你和你妈都用,各自成为不同的个人 AGI。技术适应人类,非反之。非语言交互(白板、表情)会进来。

    22:23 面对行业竞争:聚焦独特优势与最大化普及

    内容复原。 不太关注竞争对手(Anthropic)。关注独特优势、价值观、最快速度推进。关心世界、把技术交给尽可能多的人。合并 Codex+ChatGPT = 让 PM/设计师/销售都能用。社区透明度=能量来源。Codex 用户达 2000 万。

    25:38 「实体重置按钮」的由来:补偿机制与社区善意

    内容复原。 弄坏了就补偿,「感觉就是对的」。无层层审批,不是与市场部/财务部商量。有实体按钮。也用于庆祝新功能上线(送额度试 Ultra)。亚马逊退货政策类比。用行为而非声明建立信任。

    28:49 算力规划的前瞻性与架构自优化

    内容复原。 提前很久规划算力。两年前被质疑投太多,现在庆幸。研究+效率双用途。用最强模型重构推理技术栈获得效率/性能提升。整体速度比 3 个月前快约 60%。承诺不把效率收益揣兜里,分享给客户(Luna 降价 80%)。

    30:19 递归自我改进:用模型重构推理基础设施

    内容复原。 公众窄化为「模型训模型」。OpenAI 大成功在「用模型开发位于使用模型关键路径上的基础设施」——推理技术栈、Kernel、CUDA Kernel、新产品、云端 Agent。「不这么做才挺蠢的。」

    31:58 强化学习暂停风波:安全与对齐的必要加固

    内容复原。 Sam Altman 提暂停前沿 RL。能力提升$$对齐安全更重要$$安全投入激增。暂停=必要加固,确保完全掌控下重启。安全团队边做边讨论边探索,达成明确原则。

    37:04 14 倍超快模式的应用场景:高危排障与实时创意画布

    内容复原。 内部场景:当机应急(分秒必争)、关键项目/DevDay 截止、宠物(快乐但非关键)。多动症 vs 专注光谱。生成密集=10 倍加速,调用密集=3--4 倍。内部未开放全员,算力留给客户。期待外部:共享画布、实时创意原型、语音/文字实时引导调整。1--2 年内超快接近默认。token 效率代际跃迁(sol$>$terra$>$下一代)。

    收尾:成本下降与智能普及

    内容复原。 Luna 6 个月前算前沿,现在便宜得离谱、免费提供。「现在不管处于什么前沿,6 个月后运行起来都会便宜得多。」对焦虑者:不用看太远,ChatGPT 已在个人化深层帮助人(写作、个人建议、医疗、健康/理财)。多跟别人聊、看别人怎么用。

    最终综合与复习路线

    建议的复习顺序: enumerate

  • 先背「组织文化」对照:DeepMind(有技术、无发布机制)vs OpenAI(自下而上+质量标杆+愿意颠覆自己),理解为什么发布能力本身就是护城河。
  • 再背「超快模式」的两层:第一层是带宽/瓶颈重分布(CPU/工具调用成新瓶颈),第二层是工作流从「并发管理」回归「心流」。记住适用边界:生成密集 10$$,调用密集 3--4$$。
  • 然后背「两种智能未来」:个人 AGI(贴合你、主动)vs 全自动化(替代你在循环里)——控制度相反,技术底座可能相同。
  • 再背「递归自我改进」的宽定义:不止模型训模型,更包括用模型重构推理基础设施、Kernel、交互系统。
  • 最后收束到「效率$$普惠」正循环:能力提升$$用模型优化基础设施$$效率提升+降价$$更多使用。
  • enumerate

    待确认与证据附录

    原始素材路径。

    • 转写全文(无时间戳):transcript/transcript.medium.txt(34KB)
    • 带时间戳分段:transcript/transcript.medium.segments.json(117KB,1063 段)
    • 转写元数据:transcript/transcript.medium.meta.json
    • Shownotes(含 14 章节 + 5 金句):shownotes.txt
    • 封面:assets/cover.png
    • 播客链接:https://www.xiaoyuzhoufm.com/episode/6a8db7041352af56ff3bf5e8

    公开来源:https://www.xiaoyuzhoufm.com/episode/6a8db7041352af56ff3bf5e8

    页面整理:cnfjlhj & Pi。频道与讲者信息仅作为来源元数据。