拒绝蒸馏捷径:字节跳动为何押注十万亿参数构建AI底层主权?
拒绝捷径:一场关于技术主权的豪赌
在人工智能大模型竞争日益白热化的2026年,字节跳动内部发生了一场罕见的路线之争。据The Information报道,在Seed模型的全员会议上,创始人张一鸣明确拒绝了团队提出的通过“蒸馏”技术追赶前沿大语言模型的提议。这一决定看似违背了商业效率最大化原则,实则揭示了字节跳动在AI底层逻辑上的深层思考。
当前,全球大模型榜单竞争激烈。月之暗面的Kimi K3 Max、阿里的Qwen 3.8 Max等中国模型已占据全球前十近半席位,而字节的Seed 2.1 Pro仅排在第21位。论资金、人才、算力及数据,字节均处于行业顶尖水平,为何在榜单上落后?核心原因在于,字节不愿走“背老师作业”的蒸馏捷径,而是选择了一条更艰难、更漫长的从头训练之路。
蒸馏技术,即利用其他大模型的输出数据来训练自己的模型,曾是行业快速提升性能的常用手段。然而,张一鸣认为,这种模仿式的训练无法让模型真正学会“思考”,只能学会模仿“碎碎念”。在多次内部冲突中,无论是面对DeepSeek-R1的推理风格冲击,还是英伟达Blackwell芯片带来的算力差距,张一鸣均坚持拒绝蒸馏,转而投入巨资建设智算中心,追求长远目标。
模型坍缩:合成数据的致命陷阱
从技术演进的角度来看,拒绝蒸馏并非出于固执,而是基于对AI发展规律的深刻洞察。牛津、剑桥等机构在《Nature》发表的研究证实,反复使用AI生成的合成数据训练模型,会导致原始数据分布中的尾部信息逐渐消失,引发不可逆的“模型坍缩”。
这种现象类似于生物界的近亲繁殖。第一代模型可能表现正常,但随着代际传递,基因多样性(即数据的多样性)快速流失,隐性缺陷集中爆发。ICLR 2025的研究进一步指出,即使训练数据中仅掺入千分之一的合成数据,也足以触发毒性效应。参数量越大,这种坍缩效应反而可能被放大。
真实世界的知识并非均匀分布。常见问题占据头部,而边缘场景、反常识提问、方言俚语等长尾信息,才是决定模型智能上限的关键。AI生成的“标准答案”往往抹平这些长尾,导致模型变得自信却狭隘。字节跳动拥有抖音、TikTok等全球最大的原生内容池,日均产出数亿条真实视频、文本及交互数据。清洗这些原生数据虽难,但能完整保留现实世界的分布,包括那些奇怪、鲜活且不可预测的长尾信息。这是合成数据无法替代的,也是字节突破智能天花板的底气所在。
夺回底层主权:词表与多模态的自主权
除了数据质量,词表的自主权也是字节拒绝蒸馏的另一大理由。词表是模型的“眼睛”,决定了文字切分的基础单元。使用他人的词表,意味着接受他人的语言偏好和认知颗粒度。例如,针对英语优化的词表在处理中文成语或网络热梗时,往往将其拆分为零散单字,导致语义关联性破碎,推理效率降低。
更为关键的是在多模态领域。字节Seed系列的核心战场是原生多模态,如Seedance 2.0已实现原生音画同步的视频生成。这种能力的前提是模型在底层实现文本、视频帧、音频信号的原子级映射。如果蒸馏他人模型,字节将继承他人的编码地基,无法自主定义视频Token的切分粒度、音频节奏特征的编码方式以及多模态信号的联合注意力机制。
不蒸馏,意味着字节可以从零定义规则,掌握底层决策权。对于致力于视频生成和多模态交互的字节而言,地基的自主权远比短期的文本榜单排名重要。这种底层能力的掌控,是构建差异化竞争优势的核心。
工程护城河:万卡集群的重工业挑战
在硬件受限的背景下,字节的从头训练路线更是一场工程实力的较量。受美国芯片出口管制影响,字节无法采购英伟达最新旗舰芯片,只能使用性能受限的H20芯片。为了弥补单卡效率的差距,字节必须依靠更大的集群规模、更高的资源利用率和极致的工程优化。
超大规模预训练对集群稳定性要求极高。平均无故障时间(MTBF)是核心指标。假设单张GPU的MTBF为10万小时,由一万张卡组成的集群平均每10小时就会遭遇一次硬件故障。如果没有毫秒级的故障检测、精准的断点续训和完备的容错恢复机制,大规模训练将难以持续。
为此,字节在乌兰察布、怀来等地布局了数万张卡规模的分布式算力网络,2026年AI基础设施资本开支上调至超2000亿元。张一鸣本人也将大量精力倾注于Seed团队,推动从底层算子优化到算力资源管理的全栈自主研发。这套能支撑“万亿参数从零训练”的工程体系,构成了字节真正的技术护城河。走蒸馏路线的厂商无需攻克万卡级稳定训练难题,自然无法沉淀此类重工业级系统能力。
灵魂归属:奖励模型与商业逻辑的对齐
蒸馏模型学到的是“答案”,而从头训练学到的是“思维”。使用他人模型输出训练,会导致模型继承对方的输出分布、说话语气甚至价值观偏好。这种“灵魂”的烙印,使得后续微调难以从根本上改变模型的行为模式。
字节跳动需要的是完全对齐自身业务逻辑的奖励模型。抖音的推荐算法关注完播率和互动率,电商业务关注点击到购买的转化效率,短视频内容关注节奏感和视觉冲击力。这些独特的商业逻辑必须深度植入Reward Model,让模型在RLHF(人类反馈强化学习)阶段就与字节系产品的目标对齐。
如果蒸馏GPT-4,模型的底层偏好将刻上OpenAI的逻辑。只有从头训练,从预训练到RLHF全链路自主,字节才能让模型真正服务于其极致的商业逻辑。这不仅关乎效果,更关乎对模型行为的完全可控性,确保AI能力能够精准赋能其庞大的业务生态。
十万亿参数:量级跃迁的战略野心
拒绝捷径后,字节的追赶路径逐渐清晰:通过参数规模的量级跃迁,直接冲击世界顶尖梯队。据《金融时报》报道,字节跳动正在讨论训练一个参数规模达10万亿的大模型,远超阿里Qwen 3.8-Max的2.4万亿和月之暗面K3的2.8万亿。该项目由Seed Foundation负责人项亮主导,目前仍处于早期探索阶段。
这一选择本质上是“用规模换时间”。在Scaling Law依然有效的当下,参数规模的提升会带来可预测的能力增长。当主流玩家还在2-3万亿参数区间内卷时,字节直接冲击10万亿,旨在跳过中间的追赶步骤,直接摸到下一个梯队的门槛。尽管这面临数据供给、算力稳定性、对齐难度及推理成本等巨大挑战,但其战略价值不容忽视。
在全球AI竞争加剧、知识产权争议频发的背景下,全链路自研的模型没有合规包袱,无论是全球化布局还是长期技术竞争,都站在更安全的位置。未来三年,大模型的技术范式窗口期正在收窄,头部玩家的技术路线选择将决定未来十年的竞争格局。
蒸馏的诱惑在于确定性,但其代价是永远失去定义终点的资格。张一鸣坚持长期主义,追求智能上限,期待Seed模型跻身世界第一梯队。这不仅是对技术的执着,更是对技术主权的捍卫。在这条更难走的路上,字节跳动正试图重新定义AI竞争的规则,为行业提供另一种可能。