Review

Servers

AMD maakt met EPYC 7006 met Zen 6 en Instinct MI455X een enorme inhaalslag ten opzichte van Nvidia en Intel in de AI-markt - AMD EPYC 7006

Portret van de auteur


Advertentie

Op Advancing AI haalt AMD het doek af van de zesde generatie EPYC-processors voor servers. De eerste generatie kwam acht jaar geleden op de markt. In dat prille begin wist AMD 2 procent van de markt te pakken; inmiddels heeft het 46 procent van de markt in handen.

De codenamen van de AMD-serverprocessors zijn gebaseerd op Italiaanse steden. Het begon met Naples, de nieuwe generatie wordt Venice genoemd. 

De nieuwe chips krijgen in veel gevallen een rol binnen AI-toepassingen. Tot nu toe werden processors vooral gebruikt als verkeersregelaar tussen de GPU’s. Inmiddels komen er meer systemen die zijn ingericht voor agentische toepassingen. In dat soort omgevingen nemen processors meer taken voor hun rekening en wordt niet alles meer uitgevoerd door GPU’s. Efficiëntie voor dit soort taken is dan ook een belangrijk element geweest bij de ontwikkeling van de nieuwe serie. CPU-servers voor agentische toepassingen worden ‘sandbox-servers’ genoemd. De huidige Turin-chips kunnen het dubbele aantal agents per watt afhandelen ten opzichte van Vera Rubin. Venice haalt 2,8 keer zoveel.

We noemen het bewust een serie. Er komen namelijk verschillende varianten op de markt voor verschillende omgevingen. AMD is ervan overtuigd dat deze generatie de beste serverprocessorfamilie van dit moment is. De familie komt in vier varianten op de markt, waarbij SP7- en SP8-sockets worden toegepast. Ook is er een speciale low-profilevariant. De nieuwe chips kunnen tot 256 Zen 6c-cores of 96 Zen 6-cores bevatten. Daarnaast kan er 3D V-Cache aanwezig zijn met een maximale grootte van 1152 MB. De nieuwe chips ondersteunen zestien kanalen met MRDIMM met een doorvoer tot 12.800 MB/s en standaard-DIMM tot 8.000 MB/s. Daarnaast kan er worden gekozen voor LPDDR5 met 24 kanalen. Het zijn eveneens de eerste chips met ondersteuning voor PCI Express 6. De chips bieden tot 128 kanalen van 64 Gbit/s.

De L2-cache is opnieuw verdeeld en via Infinity Fabric gekoppeld.

AMD richt zich met Venice en Verano op omgevingen waarin veel verschillende taken tegelijk moeten worden uitgevoerd. Dat verklaart waarom er niet één processor komt, maar een complete familie. Veel klanten bouwen momenteel systemen voor agentische AI en proberen daarbij de kosten zo laag mogelijk te houden. In klassieke AI-servers fungeert de processor vooral als host: hij zorgt ervoor dat de GPU’s continu van werk worden voorzien. Tot nu toe kon één processor vaak meerdere GPU’s aansturen. In agentische omgevingen verschuift die verhouding vaker naar één CPU per GPU, omdat de processor zelf meer taken moet uitvoeren.

Een agentische AI-pijplijn bestaat uit meerdere stappen. De processor moet daarbij niet alleen de GPU’s actief houden, maar ook databases en andere systemen aansturen waaruit de agenten informatie ophalen. Daardoor wordt de rol van de CPU belangrijker dan bij traditionele AI-workloads. In iedere stap komen andere elementen aan bod en worden andere servers toegepast.

Caches worden ook steeds belangrijker. Tot nu toe werden caches voor tokens (KV-cache) in het geheugen van de GPU bewaard, maar volgens AMD wordt het belangrijker om deze caches in het werkgeheugen op te slaan. Mogelijk ontstaan hier in de toekomst zelfs specifieke servers voor. Kortom: achter de inzet van een agent gaat een groot aantal servers schuil. Het is te vergelijken met een domino-effect.

Caches worden ook steeds belangrijker. Tot nu toe werden caches voor tokens (KV-cache) in het geheugen van de GPU bewaard, maar volgens AMD wordt het belangrijker om deze caches in het werkgeheugen op te slaan. Mogelijk ontstaan hier in de toekomst zelfs specifieke servers voor. Kortom: achter de inzet van een agent gaat een groot aantal servers schuil. Het is te vergelijken met een domino-effect.

Met de nieuwe AMD-modellen is het mogelijk om met 82 nieuwe servers, 1.000  zes jaar oude Intel Xeon-servers te vervangen.

Met de hogedichtheidmodellen uit de EPYC Venice-serie is het mogelijk tot 49.152 cores in een rack te combineren.

Bronnen en meer links REACTIES (0)