BAT 集体重做「AI 预训练」,补「脏数据」的坑

最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。

它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。

有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。

还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。

与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。

数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。

“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。

周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意,做 Token 转发。一方面有收益,但更重要的是,可以借此收集大量用户行为数据。

5 个赞

还有 B 的事?你说的是哪个 B?

4 个赞

注:文中的周俊 可能是蚂蚁集团副总裁周俊

1 个赞

还有人怀恋Robin!

6 个赞

所以说把国外友商的模型给蒸馏了。这个对模型不好吧。

1 个赞

百度,在清理自己数据的时候,是不是也会被自己恶心到hhh。自食恶果