ARTICLE · 人工智能

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

作者:AI科技评论 来源:AI科技评论 2026-08-07 17:33 21 分钟 12 阅读 5245 字
大语言模型模型训练蒸馏技术主权重工业
一语总结

张一鸣坚决拒绝蒸馏捷径,坚持从头训练大模型,凭借数据、算力和技术主权押注长期主义,目标是让 Seed 模型跻身世界第一梯队。

AI 总结

文章详细阐述了字节跳动创始人张一鸣在内部会议上明确拒绝采用模型蒸馏技术追赶前沿大语言模型的决定。他指出,字节愿意为长远目标牺牲短期利益,坚持从头训练模型以避免“近亲繁殖”导致的模型坍缩、保留真实数据长尾信息、掌握词表和多模态技术主权、构建重工业级别的训练基础设施以及获得符合自身业务逻辑的奖励模型。文章进一步分析了字节在数据、算力、人才方面的优势,以及其正在探讨的 10 万亿参数超大模型计划,强调这条更慢更难的路是为了在未来智能竞争中获得技术主权和长期竞争力。全文引用了 Nature、ICLR 等研究,并结合内部知情人士透露,展示了字节在大模型领域的长期主义战略。

核心要点
  1. 拒绝蒸馏以避免模型坍缩和保留数据长尾。

    蒸馏会导致模型输出概率最高的回答,抹平真实数据的长尾信息,长期使用合成数据会引发不可逆的模型坍缩;字节依赖抖音、头条和 TikTok 的原生内容池,保证训练数据的真实分布。

  2. 坚持自主词表和多模态技术主权,以实现底层对齐。

    使用他人词表会将中文表达拆散,影响语义关联;在多模态场景中,词表决定 Token 切分方式,蒸馏会继承他人的编码地基,失去对视频、音频等底层对齐的自主权。

  3. 投资超大规模算力基础设施,构建重工业级训练体系。

    字节在美国芯片出口管制下只能使用 H20 芯片,通过在乌兰察布、怀来等地建设数万张 GPU 的分布式智算中心,投入超 2000 亿元,解决 MTBF、故障检测与容错等工程难题,为万亿参数从零训练提供稳定平台。

  4. 通过从头训练获得符合字节业务逻辑的奖励模型,提升可控性。

    蒸馏会继承他人模型的价值观偏好和行为模式,后期 RLHF 难以根本改变;字节需要奖励模型深度植入抖音的完播率、互动率、电商转化等业务指标,以确保模型在训练全链路中对齐自身商业逻辑。

  5. 规划 10 万亿参数模型,用规模换取未来竞争优势。

    参考 Scaling Law,字节正在探讨训练参数规模达 10 万亿的大模型,远超当前主流的 2‑3 万亿参数,通过量级跃迁跳过中间追赶阶段,争夺未来智能上限的定义权。

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

文章详细阐述了字节跳动创始人张一鸣在内部会议上明确拒绝采用模型蒸馏技术追赶前沿大语言模型的决定。他指出,字节愿意为长远目标牺牲短期利益,坚持从头训练模型以避免“近亲繁殖”导致的模型坍缩、保留真实数据长尾信息、掌握词表和多模态技术主权、构建重工业级别的训练基础设施以及获得符合自身业务逻辑的奖励模型。文章进一步分析了字节在数据、算力、人才方面的优势,以及其正在探讨的 10 万亿参数超大模型计划,强调这条更慢更难的路是为了在未来智能竞争中获得技术主权和长期竞争力。全文引用了 Nature、ICLR 等研究,并结合内部知情人士透露,展示了字节在大模型领域的长期主义战略。

文章金句

"

字节跳动应该愿意为了长远目标牺牲一些短期利益。

"

蒸馏的本质,是用别人模型的输出当 '标准答案' 来训练自己的模型。

"

近亲繁殖,第一代看起来健康正常,但基因多样性在快速流失,繁衍几代后,隐性缺陷会集中爆发。

"

字节最大的底气,恰恰是数据。抖音日均产出超 8000 万条短视频,头条日均推荐内容以亿计,海外 TikTok 覆盖 150 多个国家和地区,这是全球最庞大的原生人类内容池。

"

不蒸馏,意味着字节可以从零定义规则:视频帧以什么粒度做 Token 化最合理、音频的节奏特征怎么编码进语言模型、多模态信号怎么做联合注意力...... 所有底层决策全部握在自己手里。

"

字节需要的,是完全对齐自身业务逻辑的奖励模型。

"

据《金融时报》报道,字节跳动正在讨论训练一个参数规模 10 万亿的大模型,显著超过阿里 Qwen 3.8-Max 的 2.4 万亿参数和月之暗面 K3 的 2.8 万亿参数,是目前国内已知参数规模最大的模型计划。

"

张一鸣在会议上,明确望大家以追求智能上限为目标,期待 Seed 模型能力能跻身世界第一梯队。