字节跳动训练10万亿参数AI模型:TikTok背后的公司,现在想和Anthropic掰手腕

9次阅读

字节跳动正式下场了。

据三位知情人士透露,TikTok的母公司正在训练一款参数规模高达10万亿的AI模型——这相当于Moonshot上个月刚发布的Kimi K3参数量的3倍,也是目前已知最大的中文AI模型。行业估算Anthropic最先进的Mythos 5约为8万亿参数,字节直接冲到了10万亿这个量级。

字节跳动这次没有选择"蒸馏"路线——也就是从现有大模型压缩出小模型的传统方式。据内部人士透露,字节的Seed团队从一年多前就坚持从零开始独立训练,刻意绕开这条路。代价是进度比竞争对手慢一些,但字节认为只有这条路才能做出真正能打的东西。

Seed团队规模约2000人,由前谷歌DeepMind科学家吴永辉带队。团队分工很细:核心研究员、基础设施工程师、数据标注组、翻译组,一应俱全。过去三年,字节跳动在AI上的投入比任何一家中国科技巨头都激进——数据中心不停建,人才不惜重金挖。

有意思的是,字节在AI圈一直比较低调。它的视频生成模型SeeDance是目前全球最先进的之一,但一直没什么声量。真正让它在C端出名的是旗下对话AI产品"豆包"——目前月活3.24亿,中国市场渗透率已经干掉了大多数同类产品。

这次训练还处于早期阶段——预训练本身通常就要3到6个月,之后还要微调。能不能如期发布、参数规模最后定格在多少,都是未知数。但字节的意图已经很明显:它不想只当一个TikTok公司,它想站到AI最前沿去。

最近几周,Moonshot和阿里巴巴的中文模型在多个基准测试上已经逼近Anthropic的Fable 5,只有某些领域还差一点。Anthropic的Mythos 5在6月因安全担忧被临时限制后,目前只对通过审批的组织开放。这恰恰给了字节跳动一个切入的窗口。

字节跳动想做的事,和它在短视频赛道做过的一样:用更快的速度、更低的姿态,追上然后超过那些看起来不可战胜的对手。只不过这次,战场换成了AI最前沿的模型竞赛。

正文完
 0