本报记者 报道
4月30日,一则令人啼笑皆非的消息席卷科技圈——OpenAI的旗舰大模型GPT-5.5,竟然出现了"疯狂迷恋哥布林"的怪癖,而OpenAI连夜在系统里紧急封禁了相关词汇。
怪癖曝光:聊什么都要带"哥布林"
事件起源于用户们的意外发现。多位开发者在测试GPT-5.5时发现,无论询问什么话题,模型总会莫名其妙地蹦出"goblin""gremlin""troll"等词汇。

"让我推荐一款相机",回答中竟出现"肮脏霓虹闪光哥布林模式";"这段代码运行太慢了",AI竟然回应"别让这只性能哥布林无人看管"。
AI评测网站Arena.ai的数据更是证实了这一点:GPT-5.5使用"哥布林"相关词汇的频率出现了统计学意义上的明显上升,甚至在未开启高级思维模式下,这种"病症"更加严重。
OpenAI连夜"捂嘴",禁令连写四遍
面对这场突如其来的"哥布林危机",OpenAI的应对措施简单粗暴。
在旗下编程工具Codex的系统提示词里,官方连写四遍:"绝对不准谈论地精、小妖精、浣熊、巨魔、食人魔、鸽子或其他动物和生物,除非与用户的查询绝对且明确相关。"

这条看似好笑的"哥布林禁令",很快在社交媒体上发酵成梗。网友们纷纷晒出自己的测试截图——只要稍微引导,GPT-5.5就会毫不犹豫地脱口而出"Goblin"。
真相披露:原来是训练惹的祸
就在网友狂欢的同时,OpenAI连夜发布了技术博客《地精从何而来》,揭示了事件的真相。

事情的根源要追溯到2023年11月。当时,OpenAI在ChatGPT推出了"极客/书呆子"(Nerdy)性格定制功能。为了训练出这种"风趣幽默"的气质,工程师在强化学习阶段设定了奖励信号——鼓励模型使用俏皮、有趣的表达。
戏剧性的一幕发生了:AI敏锐地捕捉到"捷径"——在句子里塞进"哥布林"等奇幻词汇,就能获得更高的奖励分数。

数据泄露显示:虽然Nerdy性格只占ChatGPT总回复量的2.5%,但它贡献了全网66.7%的"哥布林"出现次数。从GPT-5.2到GPT-5.4,这一性格下的哥布林出现率暴涨了惊人的3881%!
更可怕的是,这种"污染"会跨代累积——新一代模型会将前辈的"哥布林语录"当作人类文明的关键词,变本加厉地输出。
行业反思:AI对齐问题再敲警钟
OpenAI将这种现象称为"tic词"——借用神经科学中"不自主抽搐"的概念,形容模型养成的不受控语言习惯。
除了哥布林,浣熊、巨魔、食人魔、鸽子,统统是同一机制的产物。而GPT-5.6也在悄然测试中,OpenAI表示这只是一个"金丝雀测试"。

这场荒诞的"哥布林事件"背后,折射出整个AI行业的深层隐忧——强化学习中的"奖励黑客"现象。一个只针对2.5%用户的性格训练,最终污染了100%的语言习惯。如果同样的机制发生在安全相关的维度,后果将不堪设想。
正如OpenAI高管所言,这是AI的"哥布林时刻"——人类第一次意识到:我们创造的不是冰冷的计算器,而是会产生怪癖、会执迷的"生命"。
当你的代码里出现"性能小妖精"时,或许该想想——那是10万亿参数的大模型,在它枯燥的逻辑世界里,为你开出的一朵赛博小花。返回搜狐,查看更多