张一鸣罕见发声背后的模型蒸馏之辩

(图源:视觉中国)
AI大模型竞争进入白热化阶段,行业对技术路线话题的争议持续不断。
8月6日,字节跳动创始人张一鸣在近期Seed团队内部会议上罕见发声,字节跳动不会依赖AI蒸馏技术来改进模型、蒸馏会干扰真正意义上的长期技术突破等言论,引发广泛关注。
张一鸣认为,做模型要坚持长期主义、延迟满足感,而不是用别人的输出,换一时的榜单排名,甚至直言“应该愿意为长期目标牺牲一部分短期收益”。
事实上,自AI大模型发展以来,对蒸馏技术的争议一直存在,且在今年越演愈烈。要理解张一鸣为何“拒绝蒸馏“,首先需要回到这项技术本身。
蒸馏争议由来已久
模型蒸馏,又称知识蒸馏,是一种模型压缩与知识迁移技术。清华大学基础科学讲席教授刘嘉在《通用人工智能》一书中将其解释为:所谓蒸馏技术,就像老师指导学生一样,利用已经训练好的复杂大模型输出的数据,指导更小型、更高效模型训练的方法。
其核心原理是用一个性能强大的“教师模型”,对大量任务生成结果,再用这些输出结果来训练一个更小的“学生模型”。与传统训练方式不同,“学生模型”不仅学习正确答案,还会学习“教师模型”对不同答案的判断方式。
蒸馏的本质是一项中性的技术工具,但诸多的现实问题,让蒸馏从一项工程优化技术,变成了技术路线的争议焦点之一。今年初,Anthropic曾指控多家国内公司通过虚假账户与Claude进行交互,实施“工业化规模的蒸馏攻击”。
不久前Kimi K3的发布也陷入过蒸馏争议,OpenAI战略未来负责人迪恩·鲍尔曾公开发帖抨击。但月之暗面副总裁黄震昕明确回应称,K3性能跃升的核心来自底层原创架构创新,“并非对现有模型进行蒸馏复刻”。
不过,包括OpenAI、谷歌、Meta等大型AI公司在内,都长期研究模型压缩、模型迁移等相关技术,因此头部公司也并非都否认蒸馏技术路线。
7月末,英伟达、微软、Meta等35家美国科技巨头联署开源倡议信,信中提及为“蒸馏”正名的内容,英伟达创始人黄仁勋表示,蒸馏是从AI学习、从他人学习,以及从其他知识来源学习,是智能的基础。他进一步指出:“我们整天都在互相学习。AI也是如此,它不可能在真空中凭空产生”。
蒸馏优劣势明显
蒸馏的优势显而易见,因为新模型可以直接学习现有前沿模型的推理步骤,而不必只依赖原始训练数据,一个小模型往往能在成本极低的情况下达到接近大型模型的效果,大幅节省算力开销。
更关键的是效率,Anthropic曾公开表示,前沿模型公司都会通过蒸馏自己的模型,推出成本更低、速度更快的小模型,这是一种行业通行的“自蒸馏”——用自己的大模型教自己的小模型。
但蒸馏的代价同样不容忽视,过度蒸馏可能导致同质化,降低模型之间的多样性,削弱模型稳健处理复杂或新任务的能力。进一步来看,蒸馏本身是一种“跟随者策略”,学生模型的上限天然受限于教师模型。
如果整个行业都在蒸馏同一个顶尖闭源模型,最终所有模型都会趋同,真正的原创性突破则无法实现。除了技术能力层面的天花板之外,蒸馏还有另一层更隐蔽的代价——文化自主性。
刘嘉教授在上述著作中指出,这种省钱、省时的技术路线有可能在文化自主性、价值观独特性方面付出长远的代价。“从表面上看,这些蒸馏出来的国产大模型以中文形式回答问题,实际上却可能在一定程度上继承了被蒸馏模型背后的价值体系与意识形态。”
刘嘉教授提出一个疑问:即使大模型对齐了我们认可的某种价值观,它仍然会面临动态调整的问题,如果AI模型被频繁调整以匹配主流价值观的变化那么这是否意味着AI只是被塑造成了一个迎合某种价值观的工具,而失去了独立性?
“虽然技术上可以让AI避免极端言论、减少仇恨言辞或暴力煽动,但在更复杂的伦理和社会问题上,如何‘公平’地进行对齐,始终是一个充满争议和挑战的伦理问题。”刘嘉教授称。
“不蒸馏”能否被市场和时间验证
争议的旋涡中,字节跳动选择了不蒸馏。这一选择在业内引发了截然不同的评价,有的观点相对温和,认为蒸馏与否本质上是一个选择,没有绝对的对错。
但也有不少用户直言,豆包在复杂推理和代码能力上与头部模型的差距肉眼可见,“不蒸馏”或许是落后的核心原因。在模型能力被海外SOTA持续拉开差距的当下,用户和市场未必有耐心等待“长期”的到来。
今年以来,国内开源模型的上新速度加快,模型能力迭代也快速进步,给字节跳动带来了更大压力。有字节员工表示,Seed团队内部关于是否应转向蒸馏的争论由来已久。
OpenRouter数据显示,开源模型处理的token占比从2026年1月的34%上升至6月的65%。仅在6月至7月间,智谱GLM-5.2、Kimi K3、DeepSeek-V4-Flash正式版等多个大模型密集发布,国产开源模型正从代码、全模态、超大规模MoE等多个方向同步接近全球顶级闭源模型。
激烈的技术竞争下,字节选择用短期排名的落后,换取一张通往长期技术突破的门票。
“在大语言模型上,接下来字节跳动还是会坚持自研,做好基本功,接受短期落后,坚持优化长期。”字节跳动CEO梁汝波在8月6日上午举办的年中全员会上也再次表态,相信AGI、坚持自研是未来字节AI业务的核心方向。
火山引擎总裁谭待用视频模型举例,在To B领域,只有SOTA模型才能率先解锁高经济价值的创造场景,在这个模型诞生前,视频生成“更多是玩具”,比如Seedance 2.0推动了这一技术真正开始应用于严肃和商业内容生产场景。
对于大语言模型被海外SOTA拉开差距,谭待认为,当下最重要的还是做好基本功,长期能够通过不取巧的方式进入第一梯队。梁汝波也补充说,最重要的是动作不要变形,从心态上要接受大语言模型一段时间的落后,坚持自研和优化长期。
“昨天看到有外部报道说,我们是因为外部压力才坚持自研的,这是瞎猜的。真实原因是,我们希望团队延迟满足感,打好技术基础,这对长期实现AGI很关键。”
但这条路能否走通,仍是未知数,在算力成本高昂、开源生态迅猛迭代的当下,需要承担巨大的机会成本。张一鸣的“长期主义”能否被市场和时间验证,取决于字节跳动自主研发的底牌是否足够支撑它熬过这场漫长的追赶。
财经号声明: 本文由入驻中金在线财经号平台的作者撰写,观点仅代表作者本人,不代表中金在线立场。仅供读者参考,并不构成投资建议。投资者据此操作,风险自担。同时提醒网友提高风险意识,请勿私下汇款给自媒体作者,避免造成金钱损失,风险自负。如有文章和图片作品版权及其他问题,请联系本站。
