前英特尔CEO示警AI算力瓶颈!电力、HBM记忆体与光互连成关键战场
人工智慧(AI)加速发展,晶片设计的门槛与时间成本正因AI工具而降低,但硬体製造、记忆体、能源供应及资料传输等环节,却成为限制算力扩张的新瓶颈。前英特尔(INTC-US) 执行长季辛格(Pat Gelsinger)认为,AI正推动硬体产业迎来一波前所未有的创新浪潮,从电力架构、记忆体材料到光互连技术,都存在重大突破的机会。
硅谷创投机构 a16z 于9日播出一场深度访谈,由创投机构 Playground Global 普通合伙人季辛格,与 a16z 的 Raghu Raghuram、Guido Appenzeller 共同探讨AI基础设施的发展。
季辛格曾参与英特尔386、486处理器的设计,并见证电子设计自动化(EDA)工具的发展。他指出,当前硬体产业的创新机会,涵盖记忆体、光互连、电力系统与网路架构,是他职涯中少见的密集发展阶段。
AI资料中心面临电力瓶颈,季辛格示警违约风险
随着AI资料中心建置加速,电力供应正成为算力扩张难以迴避的瓶颈。
季辛格指出,AI时代的能源供应能力已直接关係经济产能,但美国过去15年在增加再生能源的同时逐步淘汰燃煤发电,整体能源容量几乎没有成长,即使近期增速加快,年化成长率仍仅约4%,难以满足动辄需要百万颗GPU的AI资料中心需求。
季辛格警告,若业者投入大量资金採购GPU,却无法取得足够电力,未来可能有愈来愈多资料中心专案面临违约风险。
他认为,甲骨文(ORCL-US) 先前谈及核能资料中心的相关言论,正是产业供电瓶颈逐渐浮现的初步讯号。
为因应日益严峻的电力需求,季辛格认为,资料中心的供电架构亟需重新设计。他特别提到,800伏特直流电(DC)重新受到重视,象徵电力系统正迎来重大转变。
此外,从发电、输电,到运用垂直氮化镓(GaN)技术进行降压转换,以及液冷等散热技术的升级,整个资料中心电力与散热系统都可能迎来25年来少见的创新浪潮。
HBM散热与功耗受限,新型记忆体创新蓄势待发针对目前AI晶片高度仰赖的高频宽记忆体(HBM),季辛格(Pat Gelsinger)提出不同看法。他直言,HBM是一种极糟糕的记忆体,只是现阶段市场能取得的最佳选择。
季辛格指出,HBM的位元密度不理想,频宽受限于晶片边缘,且面临功耗偏高、散热困难等问题。由于DRAM对高温相当敏感,随着AI运算对记忆体的需求持续攀升,现有技术的限制也日益受到关注。
他认为,这些挑战加上AI对记忆体运算的高度需求,正为新一波记忆体技术创新创造条件;过去4年,记忆体产业市值已增加2.5兆美元,也反映市场对相关技术的重视。
季辛格表示,回顾过去30年,记忆体领域真正重大的技术创新相当有限,主要仍是DRAM、静态随机存取记忆体(SRAM)与快闪记忆体(Flash)。
不过,他认为,产业可能即将迎来30年来首次重大新型记忆体创新,并看好铁电材料(ferroelectrics)等新材料的发展潜力,认为其有望应用于不依赖电容、具备高密度与堆叠能力的记忆体。他也透露,自己已投资相关的新创公司。
至于3D封装与记忆体堆叠,季辛格认为,堆叠层数并非愈多愈好。考虑到製程複杂度提高可能导致良率大幅下降,他不认为业界应一味追求16层或32层堆叠,反而看好2至4层堆叠。
AI缩短晶片设计时间,製造与封装仍需数月AI工具正在改变晶片设计流程。季辛格认为,AI辅助设计的影响,可比拟早期EDA工具问世时对晶片开发带来的变革。透过AI工具,优秀团队可能只需3个月,就能完成一款AI加速器的逻辑设计。
但设计速度提升,并不代表硬体能同步投入使用。季辛格指出,晶片开发的瓶颈正逐渐转移至製造、先进封装与系统整合。
以一款AI晶片为例,设计可能需要3个月,晶圆製造至少再花3个月,複杂的3D先进封装又需要约3个月,之后还得整合至机架级系统。换言之,即使设计阶段大幅提速,从设计完成到系统可用,仍可能9个月的等待时间。
他强调,当前AI运算系统的核心已不再只是单颗晶片,而是整合运算、记忆体、网路与电力的整个机架(Rack)。当硬体交付速度赶不上AI模型与工作负载的变化,产品在正式部署时,就可能已不再符合原先的需求。
AI晶片市场终将整合,光互连有望在2028至2029年加速普及针对市场上大量AI推论加速器与不同晶片架构竞争的局面,季辛格预期,产业最终将逐步整合,由少数主导平台掌握市场。
他认为,未来AI工作负载可能纳入更多传统高效能运算(HPC)需求,例如分子与化学分析所需的64位元高精度运算。若晶片架构过度专门化,未必能适应未来2至4年的模型演进。
此外,打造大规模AI算力基础设施需要数百亿美元的资本支出,庞大的投资门槛也不利于数十种甚至上百种晶片架构长期并存。
OpenAI、辉达(NVDA-US) 与Anthropic等主要业者,也将在软硬体协同发展过程中,影响市场最终由哪些平台胜出。
在资料传输方面,季辛格则认为,铜互连的限制将推动光互连逐步普及。他指出,资料中心内铜缆的电气传输特性,使其在约5公尺距离的成本,可能高于可传输约100公尺的光纤,反映光学技术在高速传输上的优势。
他预期,2028至2029年可能成为产业转折点,届时近封装光学(NPO)与共封装光学(CPO)技术有望加速导入。
季辛格也肯定辉达NVL72系统的工程设计,但认为其製造複杂度极高;若光学供应链能更早成熟,相关系统的发展可能更加超前。
除了光互连,季辛格也支持光路交换(OCS)技术的发展。他指出,传统网路架构主要为资料可能流向不同目的地而设计,但AI工作负载的资料流量往往规模庞大且相对可预测,因此更适合探索电路交换式的网路架构。
AI代理兴起,下一代基础设施需要重新定义虚拟化访谈最后,季辛格将焦点转向AI代理(AI Agent)时代的基础设施。
他以过去在VMware(VMW-US) 的经验指出,每一波技术创新都会催生新的抽象层,而虚拟机仍是运算架构中值得保留的重要概念,但服务对象正从硬体与人类使用者,逐渐转向AI代理。
他认为,下一代类似VMware的基础设施,需要重新建立虚拟化与管理机制,协助AI代理有效运作、配置安全环境并管理执行效能。
同时,系统仍须保留人类对代理行为的管理能力,包括制定政策、设定行为準则,以及透过仪表板掌握运作状态。