问了下 gpt ,也是说怪大模型,而不是语料啊。 复制一部分 AI 答复: 现代大模型并不是: 发现 10 万份代码写“东北省” → 统计投票 → 输出东北省。 它完全可能是内部同时激活了两套正确知识: Northeast China = Liaoning/Jilin/Heilongjiang Province = 中国一级行政区域 然后在代码层级生成时错误地把: Region Northeast Liaoning Jilin Heilongjiang 生成成类似: Province Northeast Liaoning Jilin Heilongjiang 也就是说,两个局部概念都知道,组合的时候层级错了。 这种错误在 LLM 里很普通,而且完全不需要假设训练集中有大量中国人相信“东北是一个省”。 假如 Grok 有一天生成美国地址模型: Southern State ├─ Texas ├─ Louisiana └─ Mississippi 我们大概不会得出: 美国人人均地理太差,把 AI 污染了。 通常第一反应会是: Grok 把 geographical region 和 state administrative level 混了。 所以并不是语料决定一切,证据并不充分。 而且就实际来说,小学生也没听过东北省的说法吧