最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。
它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。
有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。
还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。
与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。
数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。
“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。
周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意,做 Token 转发。一方面有收益,但更重要的是,可以借此收集大量用户行为数据。
