Nieuws

Videokaarten

Rubin CPX: Nvidia brengt AI-accelerator naar verluidt begin 2027 uit met HBM4 in plaats van GDDR7

Portret van de auteur


Rubin CPX: Nvidia brengt AI-accelerator naar verluidt begin 2027 uit met HBM4 in plaats van GDDR7
0

Advertentie

Vorig jaar al introduceerde Nvidia met de Rubin CPX een eigen versneller voor AI-workloads met een lange context. De Rubin CPX-accelerator maakt daarbij gebruik van een chip op basis van de Rubin-architectuur en een gddr7-geheugeninterface. In totaal zou de AI-accelerator over 128 GB snel grafisch geheugen moeten beschikken. Geruchten wezen er echter op dat Nvidia de ontwikkeling zou hebben stopgezet. De techgigant sprak ook niet over Rubin CPX tijdens de afgelopen GTC.

Een render van Rubin CPX die Nvidia inmiddels een jaar geleden voor het eerst liet zien.

Maar nu volgt er een ommezwaai: volgens de doorgaans goed geïnformeerde analist Ming-Chi Kuo zou Rubin CPX al in het eerste kwartaal van 2027 een concreet product moeten worden. In plaats van 128 GB gddr7 gebruikt Nvidia naar verluidt echter 288 GB hbm4. Dit zal waarschijnlijk ook een volledig nieuw chipontwerp vereisen, aangezien de geheugeninterface hierdoor aanzienlijk verandert.

De herontworpen Rubin CPX-accelerator zou een hogere prefill-prestatie moeten bieden en brengt zowel wat betreft de specificaties van de gpu als de rackarchitectuur ingrijpende veranderingen met zich mee. Dit onderstreept het grote belang dat Nvidia hecht aan oplossingen voor prefill-verwerking.

De nieuwe CPX zal worden ingezet in een zelfstandig MGX-ETL-rack en zal dus niet langer samen met Rubin-gpu's in één rack worden ondergebracht, zoals in het vorige concept was voorzien. Afhankelijk van de vereisten kunnen klanten configuraties met 64, 128, 192 of 256 CPX-gpu's. Binnen een CPX-rack vormt een groep van 64 CPX-gpu's telkens een rackmodule. Deze bestaat uit acht compute-trays, met elk acht CPX-GPU’s en één switch-tray.

X (Twitter) Privacymelding

Op deze positie willen we je een Twitter-feed tonen. We vinden het belangrijk om je gegevens te beschermen. X wil voor het afspelen van een feed cookies op je computer plaatsen, waarmee je eventueel gevolgd kan worden. Wanneer je de feed toch wil bekijken, kun je op de feed klikken. De feed wordt daarna geladen en getoond.

Toon tweets vanaf nu direct

NVLink wordt daarbij uitsluitend gebruikt voor de scale-up-verbinding tussen de acht CPX-gpu's binnen een compute-tray. Per CPX is daarbij tussen 1 en 1,5 TB/s aan NVLink-bandbreedte beschikbaar, terwijl Rubin 3,6 TB/s haalt. De scale-out-verbinding tussen de afzonderlijke trays binnen een rackmodule verloopt via Spectrum-6-Ethernet en zuivere L1-koperverbindingen. Tussen meerdere rackmodules verzorgt de betreffende Spectrum-6-switch de scale-out-communicatie via optische OSFP-verbindingen.

CPX moet worden gecombineerd met een Vera Rubin NVL72-systeem. Nvidia beveelt daarbij een verhouding van 1:1 aan tussen CPX- en Rubin-gpu's. Terwijl CPX de prefill-verwerking voor zijn rekening neemt en de KV-cache opbouwt, wordt deze vervolgens via Ethernet RDMA doorgegeven aan de Rubin-gpu's, die de decodeerfase van de inferentie uitvoeren.

Meer dan de helft van de huidige AI-inferentielast zou bestaan uit de verwerking van de invoercontext en het opbouwen van de bijbehorende KV-cache. CPX zou de prefill-verwerking daarom flexibeler en kostenefficiënter moeten kunnen uitvoeren. Een compute-tray met acht CPX-gpu's beschikt over circa 1,34 TB HBM4-geheugen, wat voldoende zou moeten zijn voor de meeste prefill-taken met grote contextvensters en de daarmee samenhangende eisen aan de key-value cache.

Terug naar boven