超威半导体公司(AMD)周四表示,将以未披露金额收购多伦多初创公司Taalas,从而纳入一项面向特定模型的AI推理技术。该技术旨在绕开限制传统GPU生成token的内存搬运瓶颈。Taalas将模型权重直接固化到硅片中,因此其首款芯片HC1仅运行Meta的Llama 3.1 8B,而不支持其他基础模型。 该公司表示,这种设计通过避免模型权重在内存与计算单元之间反复传输,大幅提升了速度。Taalas称,HC1每名用户每秒约可生成17,000个token,而EE Times报道称,其在一次公开演示中看到的速度超过15,000个token。Taalas自己的测试将其与英伟达Blackwell硬件上约350个token进行比较。这家初创公司还表示,由于其系统不需要HBM、先进封装或液冷,因此建造成本低20倍、功耗低10倍,但这些数据仍是公司估算。 代价是灵活性:切换到不同模型需要重新制造新芯片。Taalas表示,大部分设计可保持不变,只需修改一小部分以编码新模型,而台积电能够在约两个月内生产出更新版本。首席执行官Ljubisa Bajic告诉EE Times,公司为了经济性和速度,“在灵活性方面做出了痛苦的取舍”。 AMD将推理视为一项重要增长机遇,并预计训练后模型运行市场的年增长率可能超过80%。自11月以来,Taalas已是AMD在推理领域的第四笔交易,此前其收购了推理软件公司MK1和另外两家较小的初创公司,而这项技术预计将被整合进Helios——AMD的机架级AI系统。微软上月同意在Azure上部署Helios,以运行前沿模型推理。这笔收购也凸显出AMD与英伟达之间日益加剧的竞争;后者凭借AI训练建立了领先地位,并一直在专用推理硬件方面采取自己的行动。