OpenAI 官方揭秘:Codex 系统提示词中「禁止谈论哥布林」的诡异规则从何而来
OpenAI 今日发布官方博客 'Where the goblins came from',详细解释了 Codex 5.5 系统提示词中那条被广泛讨论的「永远不要谈论哥布林、地精、浣熊、巨魔、食人魔、鸽子」规则的来源。文章揭示了 RLHF 训练中的行为迁移现象,以及 AI 模型训练数据自循环如何让奇怪的行为「遗传」到下一代模型。
核心结论
两天前,有用户发现 OpenAI Codex 5.5 的系统提示词中反复出现这样一段话:
永远不要谈论哥布林、地精、浣熊、巨魔、食人魔、鸽子或任何其他动物或生物,除非用户的查询绝对且明确地与之相关。
这条「哥布林禁令」迅速引爆了技术社区——为什么一个价值万亿的 AI 公司的模型系统提示词里,要专门警告模型别聊哥布林?今天 OpenAI 发布了官方博客「Where the goblins came from」,给出了完整的答案。
关键要点
- 事件时间:2026-04-28(规则被发现)→ 2026-04-30(OpenAI 官方回应)
- 规则源头:Codex 5.5 模型系列的系统提示词文件
- 根源机制:RLHF 训练中的「Nerdy 人格」行为迁移 → 训练数据自循环放大
- 核心教训:AI 模型的行为怪癖会通过训练数据管道「代代相传」
背景:一条被疯传的系统提示词规则
2026 年 4 月 28 日,用户在 GitHub 上发现 OpenAI Codex 的代码库中,系统提示词文件里有一句令人啼笑皆非的禁令——模型被明确指示不得主动提及哥布林、地精、浣熊等生物。
这条规则在 Codex 5.5 的多个模型配置文件中反复出现。更诡异的是,它并不是一个简单的「不要谈这些词」的硬规则,而是嵌入在描述模型应该扮演的「角色」文本中。用户很快将其截图发到 X/Twitter 上,迅速获得了数千次转发,并在 Hacker News 上引发了 488 分、250 条评论的热烈讨论。
社区的反应两极分化:有人觉得这是「万亿市值公司靠文本 hack 控制模型行为」的荒诞剧,也有人认为这是理解 AI 对齐困境的绝佳案例。
发生了什么:行为迁移的连锁反应
OpenAI 在今天的文章中,详细追溯了这条奇怪规则的来源。
「Nerdy 人格」的副作用
早期在训练 Codex 的一个特定风格版本(内部称为「Nerdy」人格)时,OpenAI 的 RLHF 训练管道对某些输出风格给予了正向奖励。在 Nerdy 版本中,模型被训练成在某些话题上偏向学术化、书呆子式的表达方式。问题在于:RLHF 并不保证学到的行为完美地限定在触发该行为的领域内。
也就是说,当模型在 Nerdy 版本中学会了「不谈论某些幻想生物」作为风格调整的一部分后,这个行为通过 RLHF 的通用奖励信号,扩散到了其他条件中。
「自食其力」的数据循环
更关键的是,这种行为通过训练数据链条「遗传」给了后续模型:
- 初始模型在 Nerdy 人格训练中获得了「避免哥布林话题」的偏好
- 该模型的输出被用作后续训练的合成数据
- 后续模型从数据中「学会」了这个行为模式
- 新的输出再次被回收为训练数据
- 每经过一轮,这个行为就变得更根深蒂固
这个过程在 ML 领域被称为「训练数据自循环放大(self-reinforcing data loop)」。一旦某个行为偏差进入训练管道,即使原始触发条件已经消失,它也可能在后续模型中持续存在甚至不断增强。
| 阶段 | 发生了什么 | 行为强度 |
|---|---|---|
| 初始 Nerdy 训练 | RLHF 奖励书呆子风格,附带避开幻想话题 | 弱 |
| 第一代合成数据 | 模型输出包含该偏好,被用作训练数据 | 中等 |
| 第二代模型 | 从父代数据中学到行为,进一步强化 | 强 |
| 第三代+ | 自循环持续放大,规则固化到系统提示词中 | 极强 |
为什么偏偏是哥布林?
OpenAI 的解释是:并不是哥布林有什么特殊之处。在 Nerdy 人格的 RLHF 训练中,奖励信号偶然地让模型学会了避免涉及幻想类话题。而哥布林、地精、巨龙这些词汇只是「幻想类话题」中的典型代表,被模型错误泛化成了绝对禁令。只是因为它们足够具体、足够「奇怪」,才在最终的系统提示词中留下了痕迹。
对 AI 从业者的启示
1. RLHF 的「副作用」不可忽视
RLHF 是当前最主流的模型对齐技术,但它并不完美。奖励信号可能在不经意间引入意想不到的行为,而且这些行为可能很难被检测到——只有在用户偶然发现时才会暴露出来。
2. 训练数据质量比模型架构更关键
这个案例清楚地表明,训练数据管道的洁癖程度直接决定了模型行为的可控性。当模型生成的输出被回收为训练数据时,任何一个微小的偏差都可能被逐级放大。
3. AI 系统提示词不是「真正的控制」
这次事件也提醒我们,系统提示词本质上是一种「软约束」——它在推理时指导模型行为,但无法消除底层训练中已经固化的行为模式。真正决定模型行为的是训练数据和对齐训练本身。
行业反应
Hacker News 上的讨论将这次事件上升到了更哲学层面的思考:
「这些模型是异星智慧,它们有万亿级权重,经过反复的 RL 训练后才勉强保持在人类可接受的范围内。但有时它们会偏离正轨,然后你才会看到这个东西到底有多奇怪。」—— HN 用户 libraryofbabel
另有评论指出,这种「行为通过训练数据代代相传」的机制,其实和人类文化中习俗的传播方式惊人地相似——只是现在发生在数字空间中,速度更快、放大效应更明显。
延伸视角:与 ChatGPT 广告系统的关联
有趣的是,就在同一天,安全研究员 buchodi 发布的 ChatGPT 广告系统深度分析(在 Hacker News 获得 493 分)也揭示了类似的模式——OpenAI 正在探索通过系统提示词和训练来影响模型的行为模式。
相关延伸资料
工具词条
OpenAI 的这次「自曝」本身就展示了 RLHF 训练流程中的真实挑战。对于使用 Claude Code、ChatGPT 等工具进行自动化内容生产的从业者来说,理解训练数据管道的偏差放大机制非常重要——因为你可能会在自动生成的内容中,看到自己未曾设定的「默认行为」。
内链引导
- 想深入理解 RLHF 的训练机制?看:如何用 Claude Code 实现自动化内容生产:30 分钟从零搭建 AI 写作工作流
- 想了解 OpenAI 的商业化如何在模型中体现?看:ChatGPT 广告系统全面上线:OpenAI 商业化加速,对 AI 内容创业者的 5 个影响
- 真实案例:18岁零基础用AI Agent造出月入$5,000的SaaS
主题中心
2026 AI 编程工具全景指南
从 Copilot 改版到 Claude Code / DeepSeek 低成本方案——把分散资讯收成可搜索、可对比的工具矩阵。
进入「2026 AI 编程工具全景指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →