WayToClawEarn
中等影响OpenAI 官方博客 / Hacker News

OpenAI 官方揭秘:Codex 系统提示词中「禁止谈论哥布林」的诡异规则从何而来

OpenAI 今日发布官方博客 'Where the goblins came from',详细解释了 Codex 5.5 系统提示词中那条被广泛讨论的「永远不要谈论哥布林、地精、浣熊、巨魔、食人魔、鸽子」规则的来源。文章揭示了 RLHF 训练中的行为迁移现象,以及 AI 模型训练数据自循环如何让奇怪的行为「遗传」到下一代模型。

WayToClawEarn Editorial发布 2026年4月30日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

两天前,有用户发现 OpenAI Codex 5.5 的系统提示词中反复出现这样一段话:

永远不要谈论哥布林、地精、浣熊、巨魔、食人魔、鸽子或任何其他动物或生物,除非用户的查询绝对且明确地与之相关。

这条「哥布林禁令」迅速引爆了技术社区——为什么一个价值万亿的 AI 公司的模型系统提示词里,要专门警告模型别聊哥布林?今天 OpenAI 发布了官方博客「Where the goblins came from」,给出了完整的答案。

关键要点

  • 事件时间:2026-04-28(规则被发现)→ 2026-04-30(OpenAI 官方回应)
  • 规则源头:Codex 5.5 模型系列的系统提示词文件
  • 根源机制:RLHF 训练中的「Nerdy 人格」行为迁移 → 训练数据自循环放大
  • 核心教训:AI 模型的行为怪癖会通过训练数据管道「代代相传」

背景:一条被疯传的系统提示词规则

2026 年 4 月 28 日,用户在 GitHub 上发现 OpenAI Codex 的代码库中,系统提示词文件里有一句令人啼笑皆非的禁令——模型被明确指示不得主动提及哥布林、地精、浣熊等生物。

这条规则在 Codex 5.5 的多个模型配置文件中反复出现。更诡异的是,它并不是一个简单的「不要谈这些词」的硬规则,而是嵌入在描述模型应该扮演的「角色」文本中。用户很快将其截图发到 X/Twitter 上,迅速获得了数千次转发,并在 Hacker News 上引发了 488 分、250 条评论的热烈讨论。

社区的反应两极分化:有人觉得这是「万亿市值公司靠文本 hack 控制模型行为」的荒诞剧,也有人认为这是理解 AI 对齐困境的绝佳案例。

发生了什么:行为迁移的连锁反应

OpenAI 在今天的文章中,详细追溯了这条奇怪规则的来源。

「Nerdy 人格」的副作用

早期在训练 Codex 的一个特定风格版本(内部称为「Nerdy」人格)时,OpenAI 的 RLHF 训练管道对某些输出风格给予了正向奖励。在 Nerdy 版本中,模型被训练成在某些话题上偏向学术化、书呆子式的表达方式。问题在于:RLHF 并不保证学到的行为完美地限定在触发该行为的领域内。

也就是说,当模型在 Nerdy 版本中学会了「不谈论某些幻想生物」作为风格调整的一部分后,这个行为通过 RLHF 的通用奖励信号,扩散到了其他条件中。

「自食其力」的数据循环

更关键的是,这种行为通过训练数据链条「遗传」给了后续模型:

  1. 初始模型在 Nerdy 人格训练中获得了「避免哥布林话题」的偏好
  2. 该模型的输出被用作后续训练的合成数据
  3. 后续模型从数据中「学会」了这个行为模式
  4. 新的输出再次被回收为训练数据
  5. 每经过一轮,这个行为就变得更根深蒂固

这个过程在 ML 领域被称为「训练数据自循环放大(self-reinforcing data loop)」。一旦某个行为偏差进入训练管道,即使原始触发条件已经消失,它也可能在后续模型中持续存在甚至不断增强。

阶段发生了什么行为强度
初始 Nerdy 训练RLHF 奖励书呆子风格,附带避开幻想话题
第一代合成数据模型输出包含该偏好,被用作训练数据中等
第二代模型从父代数据中学到行为,进一步强化
第三代+自循环持续放大,规则固化到系统提示词中极强

为什么偏偏是哥布林?

OpenAI 的解释是:并不是哥布林有什么特殊之处。在 Nerdy 人格的 RLHF 训练中,奖励信号偶然地让模型学会了避免涉及幻想类话题。而哥布林、地精、巨龙这些词汇只是「幻想类话题」中的典型代表,被模型错误泛化成了绝对禁令。只是因为它们足够具体、足够「奇怪」,才在最终的系统提示词中留下了痕迹。

对 AI 从业者的启示

1. RLHF 的「副作用」不可忽视

RLHF 是当前最主流的模型对齐技术,但它并不完美。奖励信号可能在不经意间引入意想不到的行为,而且这些行为可能很难被检测到——只有在用户偶然发现时才会暴露出来。

2. 训练数据质量比模型架构更关键

这个案例清楚地表明,训练数据管道的洁癖程度直接决定了模型行为的可控性。当模型生成的输出被回收为训练数据时,任何一个微小的偏差都可能被逐级放大。

3. AI 系统提示词不是「真正的控制」

这次事件也提醒我们,系统提示词本质上是一种「软约束」——它在推理时指导模型行为,但无法消除底层训练中已经固化的行为模式。真正决定模型行为的是训练数据和对齐训练本身。

行业反应

Hacker News 上的讨论将这次事件上升到了更哲学层面的思考:

「这些模型是异星智慧,它们有万亿级权重,经过反复的 RL 训练后才勉强保持在人类可接受的范围内。但有时它们会偏离正轨,然后你才会看到这个东西到底有多奇怪。」—— HN 用户 libraryofbabel

另有评论指出,这种「行为通过训练数据代代相传」的机制,其实和人类文化中习俗的传播方式惊人地相似——只是现在发生在数字空间中,速度更快、放大效应更明显。

延伸视角:与 ChatGPT 广告系统的关联

有趣的是,就在同一天,安全研究员 buchodi 发布的 ChatGPT 广告系统深度分析(在 Hacker News 获得 493 分)也揭示了类似的模式——OpenAI 正在探索通过系统提示词和训练来影响模型的行为模式。

相关延伸资料

工具词条

OpenAI 的这次「自曝」本身就展示了 RLHF 训练流程中的真实挑战。对于使用 Claude CodeChatGPT 等工具进行自动化内容生产的从业者来说,理解训练数据管道的偏差放大机制非常重要——因为你可能会在自动生成的内容中,看到自己未曾设定的「默认行为」。

内链引导

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。