Am 30. September 2026 gab CoreWeave bekannt, dass NVIDIA Vera Rubin NVL72 auf CoreWeave Cloud verfügbar sei, und nannte Cognition als ersten Kunden, der Produktions-Workloads auf dem System betreibt. Für SWE-2-Inferenz meldete Cognition bis zu 4,8-mal so hohen Gesamtdurchsatz an Tokens wie auf einer NVIDIA GB200 NVL72; für Workloads zum bestärkenden Lernen nannte das Unternehmen einen separaten 3,8-fachen Durchsatz ausgegebener Tokens.

Was Cognitions Messwerte für SWE-2 und bestärkendes Lernen bedeuten

Die beiden Zahlen beschreiben unterschiedliche Aufgaben und Kennzahlen. Bei SWE-2-Inferenz geht es um den gesamten Token-Durchsatz: Cognition zufolge erreichten die Workloads auf NVIDIA Vera Rubin NVL72 bis zu das 4,8-Fache des Durchsatzes auf einer NVIDIA GB200 NVL72. Für Workloads zum bestärkenden Lernen meldete Cognition separat den 3,8-fachen Durchsatz ausgegebener Tokens.

Ein Token ist eine Texteinheit, die ein KI-Modell verarbeitet oder erzeugt. Der Token-Durchsatz gibt an, wie viele solcher Einheiten ein System in einer bestimmten Zeit verarbeitet. Die Zahlen betreffen Cognitions jeweilige Workloads; sie beschreiben nicht pauschal die Leistung jedes Modells oder jeder Anwendung.

Rack-Konfiguration und der Weg in den Produktiveinsatz

Ein Vera-Rubin-Rack im Rechenzentrum, Entladearbeiten am Lieferbereich und Techniker beim Umgang mit der Infrastruktur

CoreWeave zufolge wurde Cognitions Vera-Rubin-Cluster Anfang September 2026 aufgesetzt. Am 16. September meldete das Unternehmen bereits Multi-Rack-Cluster mit NVIDIA Vera Rubin NVL72 auf seiner Cloud; am 30. September folgte die Ankündigung zu Cognitions Kunden-Workloads. Pro Rack kombiniert NVIDIA Vera Rubin NVL72 72 Rubin-GPUs mit 36 Vera-CPUs.

NeoTeo hatte zuvor über CoreWeaves Vera-Rubin-Infrastruktur berichtet; die Ankündigung vom 30. September rückt nun Cognitions produktive Workloads in den Mittelpunkt.