Karpathy 提出 LLM 输出四层阶梯:STE100、图、HTML、视频,Agent 自主工作后人类怎么读懂?
Andrej Karpathy 于 10 月 2 日发文提出 LLM 输出格式四层阶梯:ASD-STE100 受控写作→图→HTML 交互页→定制讲解视频。核心论点:当 LLM 越来越自主地完成工作,瓶颈从模型能力转移到人类理解力,输出格式是决定人类多快能审查和验证 Agent 工作的关键杠杆。STE100 要求句子不超过 20 词、900 个批准词。
核心结论
2026 年 10 月 2 日,Andrej Karpathy 发文提出了 LLM 输出格式的四层阶梯框架:ASD-STE100 受控写作 → 图 → HTML 交互页 → 定制讲解视频。该帖在数小时内获得约 46.9 万次浏览。
Karpathy 的核心论点是:当 LLM 越来越自主地完成工作时,瓶颈不再是模型能力,而是人类的理解力。输出格式是决定人类多快能理解和验证 Agent 工作成果的关键杠杆——"随着模型承担越来越多自主工作,我们的工作将上升到抽象层级的监督和理解"。
他还指出:随着"智能和代码日益充沛",你可以要求 LLM 生成"大型的、定制化的、用完即弃的软件产物(如 Web 应用、视频讲解)"——这些产物不需要维护,存在的唯一目的是将理解传递到你的脑中。
四层阶梯详解
每层之间用 "but even better"(但更好的是)连接,标记着理解速度的逐级攀升。
第一层:ASD-STE100 受控写作
什么是 STE100:ASD-STE100 是一种受控语言规范,最初为航空维修文档设计。1979 年由 AECMA 发起,2005 年成为 ASD-STE100 标准。
规格细节:
- 程序性句子不超过 20 个词
- 描述性句子不超过 25 个词
- 段落不超过 6 个句子
- 名词簇不超过 3 个词
- 约 900 个批准词的词典,每个词只有一个含义和一个词性
对 AI 输出的价值:短句、一词一义、主动语态——强制清晰,消除歧义。
关键规则:
- 程序中使用主动语态
- 不省略 "the"、"a"、"this" 等词
- 一词一义,每次一致
- 每段一个主题
- 用 "use" 不用 "utilize",用 "start" 不用 "commence"
Karpathy 的实用建议:由于完整 STE 规范过于严格,他有时要求 "80% 的 STE100"——一个良好的默认值,因为完整强度的 STE 读起来像维修卡片。
重要提示:在任务中途施加风格指令不仅影响措辞,还可能改变思考方式本身。修复方法:让 Agent 先用正常密集模式工作,然后运行第二遍将结果重写为 STE 格式给读者看。
第二层:图
价值:让结构可见,而非埋在段落中。当答案包含组件与流程、状态与转换、时间线或层次结构时效果最佳。当答案是微妙论证时效果较差——"'看情况'的方框箭头图什么也说明不了。"
实用提示:
- 要求画为 SVG 图,用编号箭头标示数据流,标注真实组件名
- 要求画 Mermaid 序列图,然后列出图中最不确定的三个地方——一个图看起来权威即使标签错了,所以让模型自己标出弱点是关键
第三层:HTML 交互页
价值:将 Markdown 文字墙转化为标签页、目录、可折叠段落、滑块、动画和颜色编码的状态看板。单个 .html 文件可在任何浏览器中打开并分享。
为什么是性价比最高的:一个提示词的改动就能获得最大的可读性提升。博客推荐这是大多数用户的起始层级。
实用示例:
- "读这篇 40 页论文,创建一个自包含 HTML 文件解释它。加:顶部一段摘要,每个主要论点一节,一个可拖拽的交互图,末尾一个'什么会改变我的看法'框。无外部依赖。"
- "将这个 PR diff 转为 HTML 审查页:按意图分组变更,标红风险代码块,加一个必须手动测试的清单。"
注意:HTML 是多一个要打开的文件,比 Markdown 更难 diff。对于活在 git 中、在 PR 中被 diff 或被其他 Agent 读取的内容,Markdown 仍胜出。
第四层:定制讲解视频
价值:旁白、有节奏、可视化、针对特定主题定制——从零学习一个概念的最强格式。
Karpathy 表示:"完全定制/定制的讲解视频,针对任意主题生成",并补充说这"已经开始可用了!"
三个必需组件:
| 组件 | 负责的部分 |
|---|---|
| 动画即代码 | Agent 编写并渲染的 HTML/canvas 或 Manim 风格场景 |
| HTML 转 MP4 | Web 动画到视频的确定性渲染 |
| 旁白 | 付费 TTS(如 ElevenLabs)或本地模型 |
关键技术特征:视频是**"代码而非扩散"**——Agent 编写绘制每一帧的程序,所以等式、图表和标签都是精确的,可以通过改一行代码来编辑。
使用前检查清单:
- 对照原始来源抽查数学或论断(选三个最令人惊讶的陈述)
- 单独要求脚本——文本中的错误更容易发现
- 保持"用完即弃"——如果计划发布,它需要发布级审查
核心论点:人类理解力是稀缺资源
Karpathy 的框架不只是在讨论"更漂亮的回答"。他在讨论一个更深层的问题:
"我们将花更多时间试图理解语言模型的输出。"
"随着 LLM 变得更好,它们将自主完成越来越多的基础工作,我们的很多工作将上升到抽象层级的监督和理解。"
核心风险:更好的格式使错误的答案更容易被相信——说服力不等于准确度。这意味着:
- 当 Agent 自主生成 HTML 报告或视频讲解时,用户更容易被流畅的呈现说服
- 格式的专业性可能掩盖事实错误
- 因此,Karpathy 的框架本质上是一个Agent 时代的审查方法论,而不仅仅是输出美化建议
格式选择指南
| 如果答案主要是... | 使用 |
|---|---|
| 你会反复阅读的程序或解释 | STE 风格文本 |
| 结构、流程或关系 | 图 |
| 探索、对比或多个参数 | HTML 页面 |
| 你需要从零学习的概念 | 讲解视频 |
对开发者的影响
对 AI Agent 开发者
Karpathy 的框架直接影响 Agent 系统设计:
- 输出格式应作为可配置参数:不同任务类型应默认不同输出格式——代码审查用 HTML,系统架构用图,操作手册用 STE
- 多层输出组合:复杂任务可以先生成 STE 摘要给快速浏览,再生成 HTML 详情给深入研究,最后生成视频给从零学习
- 自动标注不确定性:在图中要求模型标注自身弱点的做法应推广到所有输出格式——这是减少"说服力陷阱"的关键
对企业 AI 采用者
如果你正在企业环境中部署 AI Agent:
- 审查流程需要升级:传统的文本审查流程不适用于 HTML 报告和视频讲解。需要建立多格式审查标准。
- 格式即成本控制:STE 风格输出通过减少歧义降低误读风险,在合规敏感场景中值得作为默认输出格式。
- "用完即弃"原则:Karpathy 强调生成的产物是"定制化、用完即弃的"——不要试图维护这些产物,它们存在的唯一目的是传递理解。
实验建议
Karpathy 暗示了一个 15 分钟实验:
- 选一个你不完全理解的东西(继承的代码仓库、保存的论文)
- 对它运行全部四层并计时自己:
- STE 风格摘要并阅读
- 结构图
- 带一个交互元素的 HTML 探索器
- 两分钟旁白视频(如果有 TTS 来源)
- 记录哪个让你先说出"哦,现在我懂了"
- 对大多数读者,将是第三层或第四层——这告诉你默认使用哪种格式
行业背景
为什么此刻重要
2026 年下半年,AI Agent 正从单轮对话快速走向多步自主执行。OpenAI 的 Dots、Anthropic 的 Claude Code、Google 的 Gemini Agents 都在向"给定一个目标,Agent 自主完成全部步骤"的方向演进。
在这个背景下,人类的工作从"执行每一步"转向"审查 Agent 的输出"。Karpathy 的框架直接回应了这个转变——当人类不再逐步执行,而是在终点审查时,输出格式决定了审查效率。
与其他思考者的呼应
Karpathy 的观点与其他行业讨论形成呼应:
- Anthropic 的"Teaching Claude Why"研究关注 Agent 行为对齐
- 各大实验室的可解释性研究关注模型内部机制
- Karpathy 的框架关注的是输出层——人类如何理解 Agent 的工作
这三者分别覆盖了输入对齐、内部理解和输出审查,共同构成了 AI Agent 时代的完整人机协作框架。
结语
Karpathy 的四层阶梯框架简洁而实用。它不要求你选择一种格式,而是提供了一个渐进的理解加速阶梯:从受控写作到图到交互页到视频,每一步都提升人类理解速度,但也每一步都增加生成复杂度和"说服力陷阱"风险。
对于 AI 从业者来说,这个框架的核心启示是:在 Agent 时代,投入精力优化输出格式的回报,可能比投入精力优化提示词更高——因为前者直接决定了你能否快速信任和验证 Agent 的工作成果。
主题中心
YouTube AI 内容政策与标签指南
把「AI 标签」「自动检测」「披露义务」等搜索意图收成常青解释页,而不只追单条新闻。
进入「YouTube AI 内容政策与标签指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →