AI 基建,困于系统
9 月 14 日消息,微软 Azure 硬件系统与基础设施总裁 Rani Borkar 近日表示,单纯扩充存储芯片产能无法破解 AI 基建瓶颈,
她直言存储本质属于系统问题,而非简单的元器件供给问题。
Borkar 称,AI 推理模型持续扩容、对话上下文不断拉长,存储与电力已成为比算力芯片更棘手的约束。多层架构的 AI 系统受数据传输延迟、
带宽限制影响,实际性能仅能释放约 20%。
她提出芯片到系统的跨层协同设计方案,联合优化模型、编译器、芯片、网络与供电,在同等存储与电力预算下提升算力利用率与 Token 产出。
以微软自研 Maia 200 AI 加速器为例,该芯片采用台积电 3nm 工艺,搭载 216GB HBM3e,
同时通过模型压缩、数据优化、架构改良降低 KV Cache 占用。
网络层面采用双层 Scale-up 网络,网卡直连芯片并搭配定制传输协议,减少加速器因网络拥塞、故障恢复造成的闲置。
供电方面,AI 机柜功耗攀升至数百千瓦,数据中心进入吉瓦级规划。微软引入固态变压器与 800V 直流供电,
在 Cobalt 200 内核集成精细化电压与时序控制器。
Borkar 认为单项技术难以根除瓶颈,多技术组合才能提升存储资源利用率。微软引入 “有效产出” 指标,标志 AI 基建竞争,
正从堆芯片数量转向系统效率的较量。
