AMD与Cerebras推解耦推理架构:2026下半年落地,能效提升5倍?

AMD与Cerebras推解耦推理架构:2026下半年落地,能效提升5倍?

2026年7月23日,AMD与人工智能芯片设计公司Cerebras Systems宣布达成技术合作,共同开发一种“解耦式”AI推理平台,旨在通过结合AMD的Helios系统与Cerebras的晶圆级引擎(Wafer-Scale Engine, WSE)技术,显著降低大语言模型推理过程中的延迟,同时维持高吞吐能力。根据双方联合发布的公告,该解决方案预计将在2026年下半年通过Cerebras Cloud云服务首次向客户开放。次日,AMD首席执行官苏姿丰在公开场合确认了这一合作,并强调其目标是为生成式AI应用提供更高效、更具能效比的实时推理能力。

合作架构:解耦设计下的性能协同

此次合作的核心在于“解耦式推理架构”——一种将大模型推理任务按计算特性拆分、由不同硬件分别优化处理的新范式。具体而言,AMD的Helios系统将负责处理输入提示(prompt)和长上下文的高容量预填充阶段(prefill phase),而Cerebras的晶圆级芯片则专注于后续的token解码与实时生成阶段(decode phase)。这种分工利用了两类硬件各自的架构优势:Helios基于AMD Instinct MI300系列加速器构建,擅长并行处理大规模矩阵运算;Cerebras的WSE则以超大规模单芯片集成和极低通信延迟著称,特别适合自回归生成中对低延迟的严苛要求。

据公告披露,该联合方案的目标是在每瓦性能上实现最高达5倍于现有主流推理系统的token/秒输出效率。这一指标直指当前生成式AI部署中的关键瓶颈:随着模型参数量激增,推理成本与延迟同步攀升,尤其在需要实时响应的对话、搜索或内容生成场景中,传统GPU集群往往难以兼顾吞吐与延迟。通过硬件层面的任务解耦,AMD与Cerebras试图在不牺牲吞吐的前提下,将端到端延迟压缩至可商用水平。

云服务落地路径与基础设施整合

合作不仅停留在技术验证层面,更明确了商业化路径。Cerebras计划在其自有数据中心内部署AMD Helios系统,并将其与现有的Cerebras CS-3服务器集群深度集成。最终,这一混合推理平台将以云服务形式通过Cerebras Cloud对外提供。这意味着客户无需自行采购或维护异构硬件,即可直接调用经过优化的低延迟推理能力。

值得注意的是,Cerebras Cloud并非传统意义上的公有云,而是聚焦于高性能AI训练与推理的垂直云平台。其客户多为需要极致计算性能的研究机构、大型科技公司及AI初创企业。此次引入AMD Helios,标志着Cerebras从纯自研芯片提供商向“异构算力整合者”角色的延伸。对AMD而言,则是其AI加速器生态向推理场景纵深拓展的关键一步——此前,MI300系列主要面向训练市场,而Helios作为专为推理优化的系统级产品,正需通过标杆合作证明其在生成式AI推理链路中的价值。

行业背景:推理赛道的技术分化与生态竞合

当前AI芯片市场正经历从“训练主导”向“推理爆发”的结构性转变。随着大模型训练成本趋于稳定,推理已成为AI基础设施支出的主要增长点。据行业观察,推理工作负载预计将在未来两年内占据AI算力总需求的70%以上。然而,推理场景高度碎片化——既有对延迟极度敏感的实时交互应用,也有对吞吐和成本更敏感的批量处理任务——这催生了多样化的硬件需求。

在此背景下,传统GPU厂商如英伟达凭借CUDA生态仍占据主导,但专用AI芯片公司正通过架构创新寻求突破。Cerebras的晶圆级引擎以物理尺寸和晶体管数量打破常规,其CS-3系统集成了4万亿个晶体管,专为稀疏计算和低通信开销优化,在特定模型上已展示出超越GPU集群的推理效率。而AMD则采取“通用+专用”双轨策略:一方面通过CDNA架构的Instinct加速器覆盖通用AI负载,另一方面通过定制化系统(如Helios)切入高价值细分场景。

此次合作体现了AI芯片生态从“单点竞争”向“协同优化”的演进趋势。面对日益复杂的模型部署需求,单一硬件难以满足所有性能维度。通过跨厂商协作,将不同架构的优势模块组合成端到端优化的解决方案,正成为头部玩家的新战略。类似模式此前已在训练领域出现(如Meta与多家芯片商合作定制训练集群),如今延伸至推理层,预示着AI基础设施将进入更精细化的协同时代。

市场影响与后续观察点

对AMD而言,此次合作是其AI战略从训练向推理延伸的重要信号。尽管MI300系列已在训练市场获得一定份额,但在推理端,尤其是低延迟场景,仍面临英伟达TensorRT和专用ASIC的激烈竞争。通过与Cerebras绑定,AMD不仅为其Helios系统找到了高调落地场景,也强化了其“开放生态”叙事——区别于封闭的CUDA体系,AMD强调其硬件可与多种软件栈和异构加速器协同工作。

对Cerebras来说,引入AMD Helios弥补了其在预填充阶段的潜在短板。虽然WSE在解码阶段表现卓越,但大模型推理的预填充阶段涉及大量并行计算,传统GPU架构仍有优势。通过整合Helios,Cerebras Cloud可提供全链路优化的推理服务,提升整体竞争力。

投资者需关注几个关键进展节点:首先是2026年下半年Cerebras Cloud上线该服务的实际性能数据与客户反馈;其次是是否有第三方云服务商或企业客户跟进采用该混合架构;最后是AMD是否会将类似“解耦推理”模式推广至其他合作伙伴,形成更广泛的生态系统。

总体而言,AMD与Cerebras的合作不仅是两家公司的技术整合,更是AI基础设施演进方向的一个缩影——在摩尔定律放缓的背景下,系统级创新与生态协同正成为突破性能瓶颈的核心路径。随着生成式AI应用从实验走向规模化部署,此类针对特定工作负载深度优化的异构解决方案,或将重塑推理市场的竞争格局。

发布于
免责声明:市场有风险,投资需谨慎,本文不构成投资建议