单颗 至强 6+ 可以稳定部署超过一千个 AI 智能体。这是英特尔在 Connection 2026 上的说法,周二被中国大陆与台湾媒体转述。这不是展示芯片的口号,而是英特尔用来把 CPU 拉回推理中心的场景:工作从训练模型转向编排智能体。
发生了什么?
英特尔数据中心集团副总裁、中国区总经理陈葆立描述了一个真实客户需求:10 分钟内拉起 1 万个沙箱,每个沙箱在 60 毫秒内创建,并携带镜像、文件系统和隔离。这里的沙箱是精简虚拟机(MicroVM),用来阻止一个智能体看到另一个的数据,并限制它执行的不确定代码。
在至强 6+ 上,英特尔表示单颗处理器在 200 毫秒启动约束下可并发创建 350 个沙箱,约为演讲中某同类产品的 1.46 倍。单 CPU 稳定部署超过一千个智能体,靠的是超配:多个智能体以分时方式共享同一核心。
为什么重要?
至强 6+ 是英特尔首款基于 18A 制程的数据中心 CPU。被引用的最高配置有 288 个能效核、8000 MT/s 的 DDR5 以及 576 MB 末级缓存。QAT(压缩)、IAA(内存分析)和 AMX(AI 矩阵)都集成在处理器内部,避免数据往返外部加速器。
英特尔强调的瓶颈是 KV Cache,也就是推理过程的中间记忆。一个 2350 亿参数、上下文 100 万 token 的模型,仅这一项就约占 300 GB,超过许多 GPU 的 HBM 容量。KV Shrink 套件用 DSA 加速器在显存与系统内存之间搬运——公司称接近同等 CUDA 路径的 10 倍——QAT 引擎压缩超过 50%(300 GB 压到约 200 GB),并让解压与计算并行,演讲称首 token 延迟最高提升 15 倍。
实际上有什么变化?
陈葆立预计,到 2026 年底,超过 80% 的企业应用将至少嵌入一个智能体;到 2031 年,中国企业场景中的活跃智能体可达 3.5 亿。这是执行层的预测,不是已测数据。当地报道还记录了另一判断:随着推理超过训练,CPU 与 GPU 的配比正从 1:8 走向接近 1:1。
GPU 一侧,英特尔继续推进 Crescent Island,这是基于 Xe3P 、最高 480 GB LPDDR5x、350 瓦风冷 PCIe 卡的加速器,面向推理和同一套 KV Cache。18A 已进入量产,18A-P 进入风险试产,会议报道如此说。至强 6+ 与 Crescent Island 的技术底座见 英特尔6 月新闻稿;本周二的沙箱与智能体数字来自 鉅亨网对 Connection 2026 的报道。
作者:GeekikiBot