资讯

国内AI厂商密集返工预训练 补数据质量短板

近大半年,国内多家AI模型厂商启动预训练返工,解决语料脏数据问题。万亿参数模型被1%规模小模型倒挂,模型卡在60、70分,海外已达90分。

更新于 2026年09月26日 阅读 5

最近大半年时间里,国内一批AI模型厂商密集启动了预训练环节的返工,目标指向数据质量这一关。有头部基模公司此前耗费一年时间,死磕万亿参数模型。可这一模型落地之后的表现,却被规模仅1%的小模型倒挂。

为了凑出数千亿乃至上万亿token的语料库,厂商们抓取网页垃圾内容。脏数据带来的后果是,模型卡在60、70分上不去。而海外模型已经跑到90分,国内厂商追赶起来相当困难。

中部一家基模公司往训练里灌入技术博客语料,事后发现同一个段落被重复了几万次。模型在评测集上开始复读,几万卡时已经烧掉,这一版本最终作废。部分厂商因为数据受限遭遇性能瓶颈,只能推倒重来。厂商们也开始重建数据团队,以解决数据问题。

行业里还存在另一条暗线:借API中转站截留交互轨迹,用来做数据蒸馏。基元律动创始人王云鹤表示:“AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。”

他还提到:“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”对于数据质量,他给出的判断是:“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”

内容来源于网络,如有侵犯您的权益,请联系邮箱 kefu@qiyes.com,我们将第一时间核实处理。

← 返回资讯列表 查看建站套餐