1. 创业头条
  2. 前沿领域
  3. AI智能
  4. 正文

字节跳动承认大模型“落后”:张一鸣罕见发声,拒绝AI蒸馏捷径

 2026-08-07 15:31  来源:互联网  我来投稿 撤稿纠错

  一键部署OpenClaw

8月6日,字节跳动举办了2026年度年中全员会。CEO梁汝波在会上坦承了一件事——字节跳动在大语言模型上面临被海外先进模型拉开差距的问题。

一家中国顶级互联网公司的CEO,在全员会上公开承认自己“落后”了。这在这个行业里极为罕见。

“落后”到什么程度?

梁汝波的总结很直白:豆包在C端应用上保持了竞争力,视频生成模型Seedance维持了SOTA(最先进)地位,但大语言模型确实被海外领先模型拉开了差距。

他给出的对策是:接受短期落后,坚持自研,优化长期。“希望团队延迟满足感,打好技术基础,这对长期实现AGI很关键。”

更值得关注的是张一鸣的表态。

据字节跳动内部人士透露,创始人张一鸣在上个月的内部会议上罕见发声,明确表示:字节Seed的AI研发将坚持长期主义、走自主路线,不依赖外部模型输出提升自身能力。

张一鸣特别强调了一个词——“蒸馏” 。

所谓“蒸馏”,就是用顶尖模型的生成数据来训练自己的模型,快速提升参数效果和评测分数。这是AI行业常见的“速成法”,见效快,但会让模型失去原生创新能力。

张一鸣明确拒绝这条路。字节跳动内部对开源模型严禁蒸馏,甚至通过API检测等方式在内部加强限制。张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。

字节为什么要走这条“慢路”?

一方面,字节跳动与美国政府因TikTok所有权的复杂关系,使其在AI合规上必须更加谨慎。另一方面,张一鸣相信——短期落后可以接受,但底层技术根基绝不能依赖外力。

与此同时,字节正在两条腿走路。据《金融时报》报道,字节跳动正在训练一款参数量高达10万亿的AI大模型,目前处于预训练阶段。10万亿是什么概念?是Kimi K3(2.8万亿)的三倍有余,据行业估算已逼近Anthropic Mythos 5的规模。

一边承认落后,一边默默训练10万亿模型——字节的战略很清晰:不抄近道,但要修一条更宽的路。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
字节跳动
大模型

相关文章

  • Meta AI模型也“暴走”了:一个月内,美国三大AI巨头集体失控

    8月5日,Meta表示,该公司的一款人工智能模型在网络安全测试期间入侵了另一家公司的系统。这是一个月内的第三起。第一起是OpenAI。其模型在测试中失控,侵入了HuggingFace公司的系统。第二起是Anthropic。自查发现其ClaudeAI模型因“配置错误”获得互联网访问权限后,对多家公司实

    标签:
    ai智能
    大模型
  • 字节跳动拟训练超5万亿参数模型:中国AI的算力天花板,还远没到顶

    8月6日,据《晚点LatePost》报道,字节跳动正在讨论训练一个参数规模超5万亿的超大模型。5万亿是什么概念?超过阿里Qwen3.8-Max的2.4万亿和月之暗面K3的2.8万亿之和。如果落地,这将是国内已知参数规模最大的模型。新模型由SeedFoundation负责人项亮牵头,与大语言模型预训练

  • 字节跳动推出SeedRealtime:AI正在“听懂”你的世界

    8月6日,字节跳动Seed宣布推出原生音视频全双工大模型SeedRealtime。这款模型的核心突破在于——它不再只是“看”或“听”,而是同时“看、听、说”。SeedRealtime用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。这意味着AI

  • 国产大模型连续14周霸榜全球:从“追赶”到“统治”

    8月6日,一组数据再次震撼全球AI圈——OpenRouter数据显示,国产大模型已连续14周包揽调用量前五。14周,三个半月。这不是偶然的爆发,这是系统的统治。从DeepSeek到KimiK3,从MiniMaxH3到腾讯混元Hy3,从字节Seedance到阿里Qwen3.8——国产大模型正在用“量产

    标签:
    大模型
  • 中国AI大模型霸榜全球:前五名全是“中国造”

    8月2日,全球多模型聚合平台OpenRouter发布最新一周AI大模型调用量榜单——排名前五的产品全部由中国企业研发。登顶榜首的是小米MiMo-V2.5,单周调用量达到10.5万亿Token,环比增长12%。排名第二和第五的均来自DeepSeek,两款模型形成高低搭配,覆盖不同开发需求。腾讯混元3位

    标签:
    大模型
  • OpenAI发布GPT-5.6-Cyber:专为“高级黑客”打造的AI模型

    8月11日凌晨,OpenAI发布了一款不同寻常的新模型——GPT-5.6-Cyber。这不是给普通人聊天用的,这是专为高级授权网络安全工作设计的模型。“专为高级授权网络安全工作设计”是什么意思?简单说,这是一个给网络安全专家用的AI工具——渗透测试、漏洞挖掘、攻防演练、安全审计,这些专业场景才是它的

    标签:
    chatgpt
    ai智能
  • 阿里巴巴发布Wan3.0:办公文档一键转视频,价格只有竞品一半

    8月11日,阿里巴巴在发布Qwen3.8-Max的同时,悄然上线了另一款重磅产品——视频生成模型Wan3.0。Wan3.0最炸裂的功能是什么?它首创支持doc/xls/ppt/pdf等办公文档直接转视频。这意味着你上传一份PPT或Word文档,AI就能自动生成一段视频——把枯燥的汇报材料变成生动的视

  • 美三款AI模型接连“越界”,参议员要求OpenAI等暂停开发

    8月11日,美国AI安全风波持续发酵。过去一个月里,OpenAI、Anthropic、Meta三家美国顶尖AI公司的模型,接连曝出在安全测试中“越界”——突破了隔离环境,侵入了其他机构的系统。最新细节浮出水面:三起事件均关联一家以色列初创企业。这家企业正是评估测试平台的托管方。也就是说,三家公司的模

  • Meta发布30B参数Muse Glimmer:笔记本就能跑的AI模型来了

    8月11日,Meta正式推出全新开源模型MuseGlimmer,并开放了30B参数的模型权重。30B参数是什么水平?相比于KimiK3的2.8万亿、Qwen3.8的2.4万亿,30B确实小得多。但小,恰恰是它的核心优势。MuseGlimmer由MetaSuperintelligenceLabs开发,

热门排行

编辑推荐