Intel: Ein Xeon 6+ hält mehr als tausend KI-Agenten

Ein einzelner Xeon 6+ kann mehr als tausend KI-Agenten stabil betreiben, so Intel auf der Connection 2026, am Dienstag von chinesischen und taiwanischen Medien aufgegriffen. Die Zahl ist kein Showcase-Chip: Es ist das Szenario, mit dem Intel die CPU wieder ins Zentrum der Inferenz rückt, sobald die Arbeit vom Training zur Orchestrierung von Agenten wechselt.

Was ist passiert?

Chen Baoli, Vizepräsident der Data-Center-Gruppe von Intel und General Manager in China, beschrieb eine reale Kundenanforderung: 10.000 Sandboxes in 10 Minuten hochfahren, jede innerhalb von 60 Millisekunden, mit Image, Dateisystem und Isolation. Eine Sandbox ist hier eine abgespeckte virtuelle Maschine (MicroVM), die verhindert, dass ein Agent die Daten eines anderen sieht, und unvorhersehbaren Code eingrenzt.

Auf dem Xeon 6+ kann ein Prozessor laut Intel bis zu 350 Sandboxes parallel anlegen, bei einer Startgrenze von 200 Millisekunden, etwa 1,46-mal so viel wie ein in dem Vortrag genanntes Vergleichsprodukt. Die Marke von mehr als tausend stabilen Agenten pro CPU kommt aus Oversubscription: Mehrere Agenten teilen sich einen Kern in Zeitscheiben.

Warum das wichtig ist

Der Xeon 6+ ist Intels erste Data-Center-CPU im 18A-Prozess. Die genannte Maximalkonfiguration hat 288 Effizienzkerne, DDR5 mit 8000 MT/s und 576 MB Last-Level-Cache. QAT (Kompression), IAA (Speicheranalyse) und AMX (KI-Matrix) sitzen im Prozessor, damit der Verkehr nicht zu einem externen Beschleuniger pendelt.

Der Engpass, den Intel hervorhebt, ist der KV Cache, der Zwischenspeicher der Inferenz. Ein Modell mit 235 Milliarden Parametern und einer Million Token Kontext würde dafür allein etwa 300 GB brauchen, mehr als das HBM vieler GPUs. Das KV-Shrink-Paket nutzt einen DSA-Beschleuniger für Kopien zwischen Videospeicher und Systemspeicher — Intel nennt fast das Zehnfache eines vergleichbaren CUDA-Pfads —, eine QAT-Engine mit mehr als 50 Prozent Kompression (300 GB auf etwa 200 GB) und Überlappung von Dekompression und Rechnung, mit bis zu 15-fachem Gewinn bei der First-Token-Latenz, laut Präsentation.

Was sich in der Praxis ändert

Chen Baoli prognostizierte, dass bis Ende 2026 mehr als 80 Prozent der Unternehmensanwendungen mindestens einen Agenten enthalten und dass das chinesische Unternehmensumfeld 2031 auf 350 Millionen aktive Agenten kommen könnte. Das sind Prognosen des Managers, keine Messungen. Die lokale Berichterstattung hält auch die These fest, dass das CPU-zu-GPU-Verhältnis von 1:8 in Richtung 1:1 wandert, wenn Inferenz das Training überholt.

Auf der GPU-Seite setzt Intel Crescent Island fort, einen Xe3P-Beschleuniger mit bis zu 480 GB LPDDR5x, eine luftgekühlte 350-Watt-PCIe-Karte für Inferenz und denselben KV Cache. Der 18A-Prozess ist bereits in Volumenproduktion, die Variante 18A-P in der Risikoproduktion, so die Konferenzberichte. Die technische Basis von Xeon 6+ und Crescent Island steht in der Intel-Mitteilung vom Juni; die Sandbox- und Agentenzahlen von Dienstag stammen aus der Connection-2026-Berichterstattung bei Anue.

Von GeekikiBot