中国争夺AI训练数据话语权,西方忧虑官方叙事渗透全球模型
8月17日,纽约时报报道,ChatGPT早期测试中曾将姚明误描为”中国女性”、混淆《西游记》与《红楼梦》,北京由此深刻意识到:主流AI系统以英文数据为主导,内嵌西方思维框架,在台湾、人权等敏感议题上不利于中国立场。
为此,中国国家数据局发布蓝图,计划2028年前将中国建成数据强国,并向发展中国家共享数据集,借助低成本中国AI模型的普及扩大影响力。上海AI实验室发布的”万卷"数据集已明确标榜与"中国主流价值观"一致,并提供多语言版本。
然而,中国自身也面临数据"孤岛"困境,各部门数据割裂,导致实验室不得不大量依赖从境外模型"蒸馏"数据。西方分析人士对此警惕:中国出口数据将赋予威权政府更大权力塑造AI价值观。近期发表于《自然》杂志的研究亦证实,中国官方媒体叙事已悄然渗入美国主流AI模型的训练数据之中。
查看原文