开云官网切尔西赞助商在能效发达上权贵优于上一代居品及同类x86决策-开云官网kaiyun切尔西赞助商 (中国)官方网站 登录入口

谷歌的AI居品阴私其里面系统与云办事双线布局。咫尺,谷歌数据中心惩处的AI Token数目已是旧年同期的七倍。为跟上这一增速,谷歌正在加速数据中心软硬件工夫的升级迭代开云官网切尔西赞助商,并计算参加800亿好意思元用于新建数据中心。
Network World就此采访了谷歌AI与狡计业务副总裁兼总司理马克·洛迈尔(Mark Lohmeyer),议论谷歌基础样貌若何应酬AI需求的快速增长。
基础样貌需求的中枢革新
Network World:基础样貌需求最中枢的变化是什么?
马克·洛迈尔:咱们看到智能体及智能体化应用场景正在快速崛起。几年前,主流模式是对话阶段——发问、赢得谜底。咫尺咱们已进入智能体时间:用户抒发意图后,智能体会派生出多个子智能体,并交运作、保持气象。这对基础样貌提议了根人道的新条件——要快、要合算、要安全、要可靠。咱们正在构建专为智能体时间优化的基础样貌。
基础样貌成就计算与资本终结
Network World:基础样貌扩建的计算是什么?客户在资本方面能期待什么?
马克·洛迈尔:最终计算是让客户以领域化、具有资本竞争力的款式使用前沿才能和模子。引入智能体后,推理事务量比拟非智能体负载加多了50到100倍。咱们正在以指数级速率压低单次事务的资本。在最新平台上,相通使命量的资本斥责了近一半。客户不错用相通的用度办事两倍的用户,径直升迁盈利才能。
动力恶果的升迁政策
Network World:你们若何应酬动力恶果问题?
马克·洛迈尔:动力是要道资源,谷歌在这方面已深耕多年。咱们在数据中心和狡计硬件的假想上赓续优化PUE(电源使用恶果)。液体冷却工夫是咱们五年前就已引入的,最新系统全部遴选液冷决策。面临智能体负载,CPU的作用愈发隆起——崇敬智能体编排、器具调用以及强化学习中的评估轮回。咱们最新推出的基于Axion架构的N4A CPU平台,在能效发达上权贵优于上一代居品及同类x86决策。
Token恶果的构建逻辑
Network World:在系统成就中,你们若何看待Token恶果?
马克·洛迈尔:性能和恶果的升迁,源于模子与基础样貌的协同假想。Gemini在TPU上完成覆按,主要也在TPU上进行推理办事,具备强大的前沿模子才能,同期在Token滥用和资本终结上发达出色。这一切来自联理解盘工夫栈的协同假想。
若何提前谋划基础样貌需求
Network World:你们若何瞻望将来数年的基础样貌需求?
马克·洛迈尔:硬件更新周期苟简每年一代,但假想周期时常需要提前两年以上启动。咱们买通了从DeepMind中枢连系、应用团队模子落地、数十亿用户需求,到咱们团队基础样貌成就的无缺链条。咱们提前与DeepMind和应用团队对都,了解工夫走向。智能体在外部还没被无为商议时,里面也曾知悉到其所需的才能。这些知悉径直体咫尺硬件假想中。咱们把抓住了期间节点——这些平台恰是为智能体而生。
第八代TPU平台
Network World:第八代TPU平台有哪些碎裂?
马克·洛迈尔:咱们每年都会推出新平台,而几年前发布的平台于今运用率接近100%,足见市集对AI优化狡计的茂盛需求。第八代TPU是首个同期提供两套无缺系统的平台——从芯片到汇注、存储直至软件,收场全栈优化。
其中,TPU-8t专为覆按优化,TPU-8i专为推理优化。TPU-8i将芯片上的SRAM升迁至384MB,是上一代的三倍,HBM也加多了50%。
GPU与TPU的兼容政策
Network World:你们若何惩处GPU与TPU的兼容问题?
马克·洛迈尔:在单个集群内,GPU和TPU不会羼杂使用。咱们凭据具体负载需求提供两种聘请。在TPU侧,咱们赓续参加,使客户熟习的GPU软件框架也能在TPU上动手,举例PyTorch和vLLM。客户不错同期顾惜GPU和TPU资源池,在调和的vLLM层上动手使命负载。任务从TPU启动,若TPU资源池满载,可自动溢出至GPU,反之也是。这一切成绩于两者分享吞并兼容软件层。
智能体时间的编排平台演进
Network World:智能体的编排平台发生了哪些变化?
马克·洛迈尔:Kubernetes正在成为AI编排的主流平台。谷歌正在将GKE(Google Kubernetes Engine)打酿成原生复旧智能体的编排决策。当用户向智能体抒发意图,智能体派生出多个子智能体时,TPU或GPU算力必须飞快拉起,幸免长久间恭候,任务完成后再快速开释。咱们正在对GKE各层进行优化:大幅压缩节点启动期间,加速容器的启停速率。Lovable恰是基于GKE收场了这一才能——在其平台上为及时编程会话并行启动数百个沙箱,作念到按需付费。
汇注与存储基础样貌的扮装
Network World:汇注和存储基础样貌在其中上演什么扮装?
马克·洛迈尔:汇注对AI至关迫切。这需要构建大领域GPU或TPU集群,并确保它们之间的高性能通讯。为此咱们创建了Virgo汇注——一种折叠式汇注架构,在数据中心内收场无梗阻,多个Pod或NVLink72域可互联互通。
在TPU-8t中,借助Virgo可将跳跃一百万个TPU蚁集在沿途,形成大领域、高性能、高可靠的集群,加速革命迭代。存储相似弗成漠视。在大领域集群中,故障随时可能发生,省略创建快照并回滚至查验点至关迫切。
咱们推出了Managed Lustre 10T,提供每秒10TB的带宽,单集群复旧18PB存储容量,速率比旧年升迁10倍,比竞争敌手快20倍。此外,咱们还推出了Rapid Bucket——基于谷歌存储系统的低蔓延存储办事。两者在大领域覆按环境中均施展着迫切作用。
KV缓存政策:覆按与推理的互异
Network World:覆按与推理在KV缓存政策上有何不同?
马克·洛迈尔:TPU-8i将片上SRAM升迁至384MB,是上一代的三倍,HBM也加多了50%。将KV缓存径直存储在芯片内存中,不错以更快的速率、更低的资本反映推理恳求,无需依赖外部系统。关于推理负载而言,尽可能多地将KV缓存保留在片上是要道地方。
咱们还引入了一套专用KV缓存存储子系统,可同期跨GPU和TPU使命。跟着KV缓存领域遏抑扩大,省略回落至这一专用子系统变得愈发迫切。此外,在加速器常常切换模子的动态推理环境中,快速加载模子权重相似是重中之重。
Q&A
Q1:谷歌第八代TPU平台TPU-8i和TPU-8t有什么辞别?
A:TPU-8t专为模子覆按优化,TPU-8i则专为推理优化。TPU-8i将片上SRAM升迁至384MB,是上一代的三倍,HBM容量也加多了50%,能更快速、更低资腹地反映推理恳求。这是谷歌首个同期提供两套从芯片到汇注、存储全栈优化无缺系统的TPU平台。
Q2:谷歌Virgo汇注是什么,有什么作用?
A:Virgo是谷歌为大领域AI集群假想的一种折叠式汇注架构,在数据中心内收场无梗阻通讯,复旧多个Pod或NVLink72域互联。借助Virgo,TPU-8t平台可将跳跃一百万个TPU蚁集在沿途,构建大领域、高性能、高可靠的覆按集群,灵验镌汰革命迭代周期。
Q3:谷歌如安在GPU和TPU之间收场兼容和纯真调节?
A:谷歌通过调和的软件兼容层(复旧PyTorch、vLLM等框架)收场GPU与TPU的互通。客户可同期顾惜两种资源池开云官网切尔西赞助商,使命负载默许在TPU上动手,若TPU资源耗尽则自动溢出至GPU,反之也是,从而收场纯真调节、提高资源运用率。
