芯片行业又搞出了一件大事。
AMD今天宣布收购一家叫Taalas的多伦多初创公司。这家公司做的事情听起来有点疯狂——把AI模型直接"烧"进硬件里,让模型成为计算机本身,而不是在传统GPU上跑软件。
你可能想问:这和现在有什么不同?
现在的AI芯片,包括英伟达的GPU和AMD自己的加速器,都是通用处理器。它们依赖高带宽内存(HBM)把模型参数一次次喂给计算单元。这套架构很灵活,一台服务器能跑几千个不同的模型——但代价是巨大的功耗和内存带宽开销。
Taalas直接把这个逻辑翻过来了。它用专用设计流程,把模型的数学运算、路由和参数直接硬线到CMOS逻辑里。通俗点说,就是不再把模型当"软件"加载到内存里跑,而是把模型"焊死"在芯片逻辑本身。
效果很猛。今年早些时候,Taalas展示过一款针对Llama 3.1-8B定制测试芯片,单用户每秒能输出超过16000个token——比通用GPU的吞吐量高出好几个量级。
当然有代价。这种芯片只能跑它对应的那个模型,零灵活性可言。但性能收益实在太诱人,没法忽视。
AMD也没打算用这玩意儿替代自己的通用GPU。路线图是把Taalas的技术整合进现有的Instinct GPU、EPYC服务器处理器和Helios机架级平台里,做成全栈部署。对客户来说,将来可以选择:通用场景用传统GPU,需要极致性能的场景用定制化推理芯片。
这次收购还给AMD带回了关键人才。Taalas创始人Ljubisa Bajic曾在AMD工作过,后来创办了AI芯片设计公司Tenstorrent。他和团队将加入AMD人工智能集团。
这对AMD意味着什么?简单说,它在AI芯片领域又下了一注更激进的棋。英伟达现在几乎垄断了AI训练市场,但在推理端,定制化芯片的路子如果跑通,可能会开辟出一个全新的竞争维度。
以后跑AI模型,可能真的不用贵的要死的显卡了——至少在推理这个环节。