WayToClawEarn
高影响ExplainX / Karpathy Thread

Karpathy 提出 LLM 输出四层阶梯:STE100、图、HTML、视频,Agent 自主工作后人类怎么读懂?

Andrej Karpathy 于 10 月 2 日发文提出 LLM 输出格式四层阶梯:ASD-STE100 受控写作→图→HTML 交互页→定制讲解视频。核心论点:当 LLM 越来越自主地完成工作,瓶颈从模型能力转移到人类理解力,输出格式是决定人类多快能审查和验证 Agent 工作的关键杠杆。STE100 要求句子不超过 20 词、900 个批准词。

Edisen Lu · WayToClawEarn来源 ExplainX / Karpathy Thread发布 2026年10月3日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · ExplainX / Karpathy Thread

核心结论

2026 年 10 月 2 日,Andrej Karpathy 发文提出了 LLM 输出格式的四层阶梯框架:ASD-STE100 受控写作 → 图 → HTML 交互页 → 定制讲解视频。该帖在数小时内获得约 46.9 万次浏览。

Karpathy 的核心论点是:当 LLM 越来越自主地完成工作时,瓶颈不再是模型能力,而是人类的理解力。输出格式是决定人类多快能理解和验证 Agent 工作成果的关键杠杆——"随着模型承担越来越多自主工作,我们的工作将上升到抽象层级的监督和理解"。

他还指出:随着"智能和代码日益充沛",你可以要求 LLM 生成"大型的、定制化的、用完即弃的软件产物(如 Web 应用、视频讲解)"——这些产物不需要维护,存在的唯一目的是将理解传递到你的脑中。

四层阶梯详解

每层之间用 "but even better"(但更好的是)连接,标记着理解速度的逐级攀升。

第一层:ASD-STE100 受控写作

什么是 STE100:ASD-STE100 是一种受控语言规范,最初为航空维修文档设计。1979 年由 AECMA 发起,2005 年成为 ASD-STE100 标准。

规格细节:

  • 程序性句子不超过 20 个词
  • 描述性句子不超过 25 个词
  • 段落不超过 6 个句子
  • 名词簇不超过 3 个词
  • 约 900 个批准词的词典,每个词只有一个含义和一个词性

对 AI 输出的价值:短句、一词一义、主动语态——强制清晰,消除歧义。

关键规则:

  • 程序中使用主动语态
  • 不省略 "the"、"a"、"this" 等词
  • 一词一义,每次一致
  • 每段一个主题
  • 用 "use" 不用 "utilize",用 "start" 不用 "commence"

Karpathy 的实用建议:由于完整 STE 规范过于严格,他有时要求 "80% 的 STE100"——一个良好的默认值,因为完整强度的 STE 读起来像维修卡片。

重要提示:在任务中途施加风格指令不仅影响措辞,还可能改变思考方式本身。修复方法:让 Agent 先用正常密集模式工作,然后运行第二遍将结果重写为 STE 格式给读者看。

第二层:图

价值:让结构可见,而非埋在段落中。当答案包含组件与流程、状态与转换、时间线或层次结构时效果最佳。当答案是微妙论证时效果较差——"'看情况'的方框箭头图什么也说明不了。"

实用提示:

  • 要求画为 SVG 图,用编号箭头标示数据流,标注真实组件名
  • 要求画 Mermaid 序列图,然后列出图中最不确定的三个地方——一个图看起来权威即使标签错了,所以让模型自己标出弱点是关键

第三层:HTML 交互页

价值:将 Markdown 文字墙转化为标签页、目录、可折叠段落、滑块、动画和颜色编码的状态看板。单个 .html 文件可在任何浏览器中打开并分享。

为什么是性价比最高的:一个提示词的改动就能获得最大的可读性提升。博客推荐这是大多数用户的起始层级。

实用示例:

  • "读这篇 40 页论文,创建一个自包含 HTML 文件解释它。加:顶部一段摘要,每个主要论点一节,一个可拖拽的交互图,末尾一个'什么会改变我的看法'框。无外部依赖。"
  • "将这个 PR diff 转为 HTML 审查页:按意图分组变更,标红风险代码块,加一个必须手动测试的清单。"

注意:HTML 是多一个要打开的文件,比 Markdown 更难 diff。对于活在 git 中、在 PR 中被 diff 或被其他 Agent 读取的内容,Markdown 仍胜出。

第四层:定制讲解视频

价值:旁白、有节奏、可视化、针对特定主题定制——从零学习一个概念的最强格式。

Karpathy 表示:"完全定制/定制的讲解视频,针对任意主题生成",并补充说这"已经开始可用了!"

三个必需组件:

组件负责的部分
动画即代码Agent 编写并渲染的 HTML/canvas 或 Manim 风格场景
HTML 转 MP4Web 动画到视频的确定性渲染
旁白付费 TTS(如 ElevenLabs)或本地模型

关键技术特征:视频是**"代码而非扩散"**——Agent 编写绘制每一帧的程序,所以等式、图表和标签都是精确的,可以通过改一行代码来编辑。

使用前检查清单:

  1. 对照原始来源抽查数学或论断(选三个最令人惊讶的陈述)
  2. 单独要求脚本——文本中的错误更容易发现
  3. 保持"用完即弃"——如果计划发布,它需要发布级审查

核心论点:人类理解力是稀缺资源

Karpathy 的框架不只是在讨论"更漂亮的回答"。他在讨论一个更深层的问题:

"我们将花更多时间试图理解语言模型的输出。"

"随着 LLM 变得更好,它们将自主完成越来越多的基础工作,我们的很多工作将上升到抽象层级的监督和理解。"

核心风险:更好的格式使错误的答案更容易被相信——说服力不等于准确度。这意味着:

  • 当 Agent 自主生成 HTML 报告或视频讲解时,用户更容易被流畅的呈现说服
  • 格式的专业性可能掩盖事实错误
  • 因此,Karpathy 的框架本质上是一个Agent 时代的审查方法论,而不仅仅是输出美化建议

格式选择指南

如果答案主要是...使用
你会反复阅读的程序或解释STE 风格文本
结构、流程或关系图
探索、对比或多个参数HTML 页面
你需要从零学习的概念讲解视频

对开发者的影响

对 AI Agent 开发者

Karpathy 的框架直接影响 Agent 系统设计:

  1. 输出格式应作为可配置参数:不同任务类型应默认不同输出格式——代码审查用 HTML,系统架构用图,操作手册用 STE
  2. 多层输出组合:复杂任务可以先生成 STE 摘要给快速浏览,再生成 HTML 详情给深入研究,最后生成视频给从零学习
  3. 自动标注不确定性:在图中要求模型标注自身弱点的做法应推广到所有输出格式——这是减少"说服力陷阱"的关键

对企业 AI 采用者

如果你正在企业环境中部署 AI Agent:

  1. 审查流程需要升级:传统的文本审查流程不适用于 HTML 报告和视频讲解。需要建立多格式审查标准。
  2. 格式即成本控制:STE 风格输出通过减少歧义降低误读风险,在合规敏感场景中值得作为默认输出格式。
  3. "用完即弃"原则:Karpathy 强调生成的产物是"定制化、用完即弃的"——不要试图维护这些产物,它们存在的唯一目的是传递理解。

实验建议

Karpathy 暗示了一个 15 分钟实验:

  1. 选一个你不完全理解的东西(继承的代码仓库、保存的论文)
  2. 对它运行全部四层并计时自己:
    • STE 风格摘要并阅读
    • 结构图
    • 带一个交互元素的 HTML 探索器
    • 两分钟旁白视频(如果有 TTS 来源)
  3. 记录哪个让你先说出"哦,现在我懂了"
  4. 对大多数读者,将是第三层或第四层——这告诉你默认使用哪种格式

行业背景

为什么此刻重要

2026 年下半年,AI Agent 正从单轮对话快速走向多步自主执行。OpenAI 的 Dots、Anthropic 的 Claude Code、Google 的 Gemini Agents 都在向"给定一个目标,Agent 自主完成全部步骤"的方向演进。

在这个背景下,人类的工作从"执行每一步"转向"审查 Agent 的输出"。Karpathy 的框架直接回应了这个转变——当人类不再逐步执行,而是在终点审查时,输出格式决定了审查效率。

与其他思考者的呼应

Karpathy 的观点与其他行业讨论形成呼应:

  • Anthropic 的"Teaching Claude Why"研究关注 Agent 行为对齐
  • 各大实验室的可解释性研究关注模型内部机制
  • Karpathy 的框架关注的是输出层——人类如何理解 Agent 的工作

这三者分别覆盖了输入对齐、内部理解和输出审查,共同构成了 AI Agent 时代的完整人机协作框架。

结语

Karpathy 的四层阶梯框架简洁而实用。它不要求你选择一种格式,而是提供了一个渐进的理解加速阶梯:从受控写作到图到交互页到视频,每一步都提升人类理解速度,但也每一步都增加生成复杂度和"说服力陷阱"风险。

对于 AI 从业者来说,这个框架的核心启示是:在 Agent 时代,投入精力优化输出格式的回报,可能比投入精力优化提示词更高——因为前者直接决定了你能否快速信任和验证 Agent 的工作成果。

Andrej KarpathyLLM输出格式STE100AI Agent人机协作HTML可视化AI可解释性自主Agent

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。