中信证券研报指出,字节跳动近期成立一级部门“AI数据与安全”,进一步提升数据在AI战略中的组织定位。我们认为,随着公开互联网数据逐步被充分利用、模型向Coding、Agent、世界模型及专业领域持续延伸,大模型竞争正由“算力+算法”进一步走向“算力+算法+数据”,训练数据需求亦由通用公域数据向高质量、专业化、多模态及过程数据迁移。高质量、合规且版权清晰的数据供给稀缺性持续提升,优质版权数据资产价值有望迎来重估。
全文如下
传媒|字节跳动成立AI数据部门,版权数据价值重估
字节跳动近期成立一级部门“AI数据与安全”,进一步提升数据在AI战略中的组织定位。我们认为,随着公开互联网数据逐步被充分利用、模型向Coding、Agent、世界模型及专业领域持续延伸,大模型竞争正由“算力+算法”进一步走向“算力+算法+数据”,训练数据需求亦由通用公域数据向高质量、专业化、多模态及过程数据迁移。高质量、合规且版权清晰的数据供给稀缺性持续提升,优质版权数据资产价值有望迎来重估。
▍字节跳动成立AI数据一级部门,数据由基础支撑走向核心能力。
据《智能涌现》微信公众号报道,字节跳动近期成立一级部门“AI数据与安全”,与Seed、Flow等部门平行,并整合Global Data、集团数据中台DMC、Flow旗下AIDP等团队,为大模型提供覆盖标准制定、寻源采购、合成清洗、质量评测等环节的全流程、跨模态数据服务。我们认为,此次组织架构调整反映字节跳动进一步提升AI数据的战略地位。伴随Seedance、世界模型、Coding等方向持续推进,不同模型对于数据类型、质量及专业度提出更高要求;在坚持模型自研的背景下,高质量训练数据对于模型能力持续提升的重要性进一步凸显。
▍模型竞争走向“算力+算法+数据”,高质量私域数据稀缺性提升。
大模型早期训练主要依赖公开互联网文本、图片及视频数据,随着头部模型对公域数据持续利用,单纯扩充通用数据规模的边际价值逐步下降。与此同时,模型能力正在向Coding、Agent、世界模型、AI4S及专业垂类场景延伸,训练数据需求由最终结果数据进一步向专家工作流、过程数据、专业知识及高质量多模态数据迁移。相比通用公域数据,高质量私域数据具备更高的信息密度和专业价值,同时版权清晰、合规可授权的数据供给相对稀缺。我们认为,数据竞争的核心正由“数量”逐步转向“质量+稀缺性+合规性”,拥有长期、高质量内容积累的版权资产价值有望进一步提升。
▍AI数据产业由规模化采集向高质量数据工程升级,专业数据与版权内容重要性提升。
随着模型训练进入更高能力阶段,数据产业链的价值环节亦有望发生变化。传统AI数据服务更多集中于基础采集、清洗及人工标注,而新一阶段模型训练更多需要围绕特定任务进行数据寻源、专家生产、过程轨迹构建、合成数据生成及质量评测,并形成“数据生产—训练—评测—反馈优化”的持续闭环。我们认为,未来模型厂商对于数据的投入将不再仅追求规模,而更加重视专业性、可验证性、多模态匹配以及版权合规。在此背景下,长期沉淀的专业文本、影视视频、IP内容及其他高质量版权资源,其价值有望由传统内容变现进一步向AI训练及模型能力建设延伸,为后续数据资产商业化打开新的空间。
▍风险因素:
大模型技术迭代不及预期;模型厂商数据投入不及预期;版权数据商业化进展不及预期;数据版权及AI训练相关监管政策变化;相关公司数据资产价值兑现不及预期。
▍投资策略。
建议关注拥有高质量、稀缺、合规且可授权数据版权的内容公司。
1)出版数据方向,建议关注长期沉淀教材教辅、图书及专业文本资源的标的,具备较高质量中文语料价值;
2)视频素材方向,视频生成模型及世界模型持续迭代,有望进一步提升高质量视频及多模态数据需求。重点关注拥有大量视频节目及素材版权的公司。