国内AI厂商密集返工预训练 补数据质量短板
近大半年,国内多家AI模型厂商启动预训练返工,解决语料脏数据问题。万亿参数模型被1%规模小模型倒挂,模型卡在60、70分,海外已达90分。
近大半年,国内多家AI模型厂商启动预训练返工,解决语料脏数据问题。万亿参数模型被1%规模小模型倒挂,模型卡在60、70分,海外已达90分。
最近大半年时间里,国内一批AI模型厂商密集启动了预训练环节的返工,目标指向数据质量这一关。有头部基模公司此前耗费一年时间,死磕万亿参数模型。可这一模型落地之后的表现,却被规模仅1%的小模型倒挂。
为了凑出数千亿乃至上万亿token的语料库,厂商们抓取网页垃圾内容。脏数据带来的后果是,模型卡在60、70分上不去。而海外模型已经跑到90分,国内厂商追赶起来相当困难。
中部一家基模公司往训练里灌入技术博客语料,事后发现同一个段落被重复了几万次。模型在评测集上开始复读,几万卡时已经烧掉,这一版本最终作废。部分厂商因为数据受限遭遇性能瓶颈,只能推倒重来。厂商们也开始重建数据团队,以解决数据问题。
行业里还存在另一条暗线:借API中转站截留交互轨迹,用来做数据蒸馏。基元律动创始人王云鹤表示:“AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。”
他还提到:“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”对于数据质量,他给出的判断是:“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”
内容来源于网络,如有侵犯您的权益,请联系邮箱 kefu@qiyes.com,我们将第一时间核实处理。
平台公告
拖拽式可视化编辑、模板自由更换、支持自定义域名绑定。
Interconnects 的 Nathan Lambert 最近被请去给美国国会议员做了个简报,主题是开源权重模型的现状——放在中美竞争的语境下。他把讲稿整理成文发表了,这大概是目前对"开源模型权力版图"最系统的一份第三方评估。一句话结论:中国实验室已经稳坐开源权重生态的头部,美国开源权重模型全线落后,而这还叠加了经济价值拐点...
2026中国国际数字经济博览会9月23日至25日在石家庄举办,数字文旅展区展出AI岩石识别平台“岩眼”、沉浸式VR及全息海洋馆等多项技术应用。
广州抢抓双节消费窗口期,启动服务消费季,海珠区推小额烟火券,越秀区办百余项文旅活动,广百百货天河中怡店推出促销,政企联动释放假日消费活力。
重庆、宜春、北京等地以文化活动带动消费,国庆文旅消费月启动,曹县汉服、村超等成亮点;公共文化服务仍存短板,需提质增效。