AI训练的“口粮”问题,国家开始系统性解决。国家数据局消息:我国将在32个城市启动新一批数据标注先行先试,同时14家央国企开放超60亿条高价值数据,为人工智能训练提供数据支撑。
数据标注是AI产业的“手工业”——大模型再聪明,也得靠人工把原始数据标注成能训练的样本。这一环节此前高度分散,质量参差不齐。现在搞先行先试城市,等于给数据标注产业定标准、建基地。
60亿条高价值数据开放,分量更重。这些数据来自央国企,覆盖政务、交通、能源、金融等领域,含金量远非互联网公开数据可比。过去这些数据锁在柜子里,现在拿出来喂AI,等于把国家积累几十年的数据资产盘活了。
配套数据也在增长。《中国数据产业发展报告(2026)》显示,我国数据产业规模已超6万亿元。数据标注先行先试+高价值数据开放+产业规模扩大,一条清晰的政策主线:把数据从“资源”变成“要素”,再变成“生产力”。
对AI行业来说,这是实打实的利好。训练数据一直是中文大模型的短板——网上能扒的公开数据快用完了,高质量中文语料更缺。央国企数据入场,恰好补上这块拼图。数据要素市场化,正在从文件里走进现实。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!


