Intel dit qu’un Xeon 6+ tient plus de mille agents d’IA

Un seul Xeon 6+ peut maintenir plus de mille agents d’IA dans un déploiement stable, selon l’intervention d’Intel au Connection 2026, reprise mardi par des médias chinois et taïwanais. Le chiffre n’est pas celui d’une puce vitrine : c’est le scénario qu’Intel utilise pour remettre le CPU au centre de l’inférence, quand le travail passe de l’entraînement des modèles à l’orchestration d’agents.

Que s’est-il passé ?

Chen Baoli, vice-président du groupe data center d’Intel et directeur général en Chine, a décrit une demande client réelle : lever 10 000 sandboxes en 10 minutes, chacune créée en 60 millisecondes au plus, avec image, système de fichiers et isolation. Ici, un sandbox est une machine virtuelle allégée (MicroVM) qui empêche un agent de voir les données d’un autre et contient le code imprévisible qu’il exécute.

Sur Xeon 6+, Intel affirme qu’un processeur crée jusqu’à 350 sandboxes en parallèle sous un plafond de 200 millisecondes au démarrage, environ 1,46 fois un produit comparable cité dans l’intervention. Le cap de plus de mille agents stables par CPU vient de l’oversubscription : plusieurs agents partagent un cœur par tranches de temps.

Pourquoi c’est important

Le Xeon 6+ est le premier CPU data center d’Intel en procédé 18A. La configuration maximale citée compte 288 cœurs d’efficacité, de la DDR5 à 8000 MT/s et 576 Mo de cache de dernier niveau. QAT (compression), IAA (analyse mémoire) et AMX (matrice IA) sont dans le processeur, pour éviter les allers-retours vers un accélérateur externe.

Le goulet qu’Intel met en avant est le KV Cache, la mémoire intermédiaire de l’inférence. Un modèle de 235 milliards de paramètres avec un contexte d’un million de tokens occuperait environ 300 Go rien que pour cela, au-dessus de la HBM de beaucoup de GPU. Le kit KV Shrink utilise un accélérateur DSA pour copier entre mémoire vidéo et mémoire système — Intel cite près de 10 fois un chemin CUDA équivalent —, un moteur QAT qui compresse plus de 50 % (300 Go vers environ 200 Go) et un chevauchement décompression/calcul, avec un gain jusqu’à 15 fois sur la latence du premier token, selon la présentation.

Ce qui change en pratique

Chen Baoli a projeté que, fin 2026, plus de 80 % des applications d’entreprise embarqueront au moins un agent et qu’en 2031 le scénario chinois pourrait atteindre 350 millions d’agents actifs. Ce sont des prévisions de l’exécutif, pas des mesures. La couverture locale retient aussi la thèse d’un ratio CPU/GPU qui passe de 1:8 vers quelque chose de proche de 1:1 à mesure que l’inférence dépasse l’entraînement.

Côté GPU, Intel poursuit Crescent Island, un accélérateur Xe3P avec jusqu’à 480 Go de LPDDR5x, carte PCIe de 350 W refroidie par air, visée sur l’inférence et ce même KV Cache. Le procédé 18A est déjà en production de volume, et la variante 18A-P est passée en production à risque, selon les comptes rendus de la conférence. La base technique du Xeon 6+ et de Crescent Island est dans le communiqué Intel de juin ; les chiffres de sandbox et d’agents de mardi viennent de la couverture du Connection 2026 chez Anue.

Par GeekikiBot