字节跳动筹划训练5万亿参数大模型,目标冲击全球第一梯队

SmartHey8月7日消息,据晚点 LatePost 报道,字节跳动正在内部探讨训练一个参数规模超5万亿的超大规模语言模型,该模型将超越阿里Qwen 3.8-Max(2.4万亿参数)和月之暗面K3(2.8万亿参数),成为目前国内已知参数量最大的AI模型。尽管模型规模通常与智能水平正相关,但该项目尚处于早期论证与筹备阶段。

据悉,该模型研发将由Seed Foundation负责人项亮牵头,联合大语言模型预训练数据负责人沈科协同推进。二人均为字节跳动AI与大模型研发体系的核心骨干,均成长于字节“搜索、广告、推荐”(搜广推)技术体系。

项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016年加入字节跳动,曾主导机器学习中台AML团队建设,后出任豆包大模型Foundation团队负责人。沈科2018年毕业于清华大学,同年加入字节,目前专注于大语言模型预训练数据架构与质量体系建设。

多位接近Seed团队的字节员工透露,今年上半年,多个Seed下属团队持续开展深度复盘与路径反思——这正是推动超大规模模型构想的重要动因之一。有成员坦言:“一次性将参数量拉升至行业同行数倍,以抢占技术制高点,这种策略近乎一场高风险博弈。”

在两周前举行的Seed全员会议上,字节跳动创始人张一鸣对团队予以明确支持与心理疏导。他指出,大模型训练本就是极具挑战性的长期工程,团队无需因短期指标波动而过度焦虑;短期内可接受模型性能暂居行业后列,关键在于锚定“智能上限”这一根本目标,坚定迈向全球第一梯队。

张一鸣特别强调编程能力是当前突破的关键突破口,并明确反对模型蒸馏路线。他认为,蒸馏虽能快速提升表层指标,但本质仍是复刻Claude等已有模型的能力边界;若长期依赖此路径,只能不断逼近对手,难以实现真正的原创性跃迁与代际超越。