AMD已收购AI推理芯片初创公司Taalas,该公司由前Tenstorrent首席执行官Ljubisa Bajic联合创立。Bajic曾为AMD高管,他与Taalas团队将加入AMD旗下Vamsi Boppana领导的AI部门。交易具体条款未予披露。
“我们创立Taalas的初衷,是彻底重构AI推理流程——从模型出发反向设计硬件。”Bajic在声明中表示,“我们这支位于加拿大的团队,将深厚的技术积累与挑战传统方法的勇气相结合。加入AMD后,我们将获得规模优势、工程资源及全球市场覆盖能力,从而加速创新进程。”
成立于2023年的Taalas总部位于加拿大安大略省多伦多市,于今年2月正式结束保密期,对外展示了其首款演示芯片:该芯片在运行Llama3.1-8B模型时,单用户可实现每秒超16,000个token的推理速度,远超当前主流芯片性能。但需注意的是,该芯片仅支持Llama3.1-8B单一模型。
Taalas借鉴了2000年代初结构化ASIC的设计理念——将模型的数据流路径在计算单元之间硬连线,并将权重固化写入芯片。这种设计使推理速度极快,但几乎完全牺牲了可编程性,因此仅能运行一种模型。
更换模型意味着必须重新设计芯片;实践中通常需制作两层掩模(mask),分别对应模型权重与数据流路径。据Bajic此前向《电子工程时报》透露,由于整套方案基于SRAM架构,更大参数量的模型需堆叠更多芯片:例如DeepSeek-671B模型约需30次独立流片。Taalas的核心竞争力在于其自研工具链——可快速生成针对特定模型的掩模设计,目标是在两个月内完成工作负载专用芯片的流片。
AMD表示,计划将Taalas技术整合进以Instinct GPU为核心的系统级解决方案中。
去年底,行业龙头Nvidia近乎全资收购了AI芯片初创公司Groq。Groq与Taalas类似,均能在单芯片上实现高于Nvidia GPU的token生成速率,但运行大型模型仍需数十颗芯片协同。Nvidia计划将Groq芯片与GPU共置于同一系统中,仅由Groq负责推理流程中最关键的解码阶段。这种解耦式推理架构使Groq芯片无需承载完整模型及KV缓存,从而突破GPU在token生成速度上的瓶颈。
近期,AMD亦宣布正与Cerebras合作开发类似解耦方案:由AMD GPU承担预填充(prefill)阶段计算任务,Cerebras晶圆级引擎则加速解码阶段。理论上,Taalas基于SRAM的芯片可替代Cerebras,在解码环节与AMD GPU协同工作;而整套系统将由AMD统一控制与供货,模式更接近Nvidia-Groq组合。
除上述路径外,AMD还可考虑将Taalas芯片用于小型模型的端到端推理场景,例如正在兴起的物理AI应用领域——目前AMD已在该领域提供基于FPGA的加速器与SoC产品。边缘计算应用因功耗限制常采用较小模型,对成本更敏感,且模型更新频率较低,恰好契合Taalas类结构化ASIC的设计思路。竞争对手英特尔则于2018年通过收购eASIC,将其结构化ASIC技术应用于网络基础设施与国防领域。
单颗Taalas芯片的参数量上限约为80亿,具体取决于模型量化程度。
本次收购尚待满足交割条件并获得相关监管机构批准。
www.eic.net.cn 提供的易IC库存管理软件可高效支撑半导体企业从芯片研发到量产阶段的物料追踪与库存优化,助力企业在快速迭代的AI芯片赛道中提升供应链响应能力。