在智能体带来的大紧缺时代英特尔教你榨干CPU破解KVCache与沙箱瓶颈
大模型的主流应用模式正在从Chatbot的问答形式,向智能体时代的持续规划、工具调用和多轮推理演进的自主工作流迈进,数据中心的底层基础设施正经历一场前所未有的压力测试。尽管训练规模更大模型、获得更高的推理效率此前曾推动了业界对GPU性能的追捧,并依赖Scale-Up扩展尽可能大的高速显存域,似乎Scaling Law能主导一切,但进入智能体时代后,业界蓦然发现值得追逐的资源不仅仅是GPU针对训练和推理的算力支持,也需要针对任务和工作流执行的算力(CPU)支持,以及能更好地服务于这两种算力的记忆力(AI存储)。而且,在这个智能体带来的大紧缺时代,抢购并堆叠GPU、CPU、SSD也只是通向成功的第一步,如何榨干这些资源的潜力成为破局的关键。在刚刚于9月22-23日举办的2026英特尔技术创新与产业生态大会(Intel Connection 2026)上,这家芯片巨头就有的放矢地公开了与之相关的软硬协同优化项目及其初步成果,即从至强CPU着手,分别对应智能体时代基础设施供给侧Token生产需求的KV Cache的卸载与加速方案,以及需求侧智能体控制与执行需求的沙箱性能优化方案。
智能体流行带来的影响及变数
单次任务周期更长、消耗更大:与大模型时代传统的一问一答不同,智能体执行任务是一个长周期的闭环。以Coding Agent为例,修复一个跨文件的Bug需要反复经历“思考—规划—行动—观察—再规划”的过程。在这个漫长的任务周期内,系统需要持续积累会话历史、工具调用结果、检索证据以及大量的中间状态。这种长程记忆的需求,使得单次任务的资源消耗呈指数级上升。
并发需求更高:与线性的人机交互相比,智能体往往不是孤立运行的,智能体协作才是其效率的“精髓”。譬如今年1月发布的Kimi K2.5引入了Agent Swarm能力,到4月的K2.6,Agent Swarm已可部署多达300个智能体同时工作,相比单Agent顺序执行速度可提升4.5倍。用户的迅猛增长,叠加各自拥有数百甚至更多“分身”并行处理,这种指数级增长的高并发需求对底层IT基础设施的规模和调度能力提出了极为苛刻的要求。
智算、通算、存储、网络全面承压:智能体的流行让智算中心此前的“偏科”问题暴露无遗。GPU在处理长上下文时面临显存墙,超节点曾经引以为傲的巨大HBM容量在多份KV Cache面前也显得捉襟见肘,且成本高昂。CPU惯常的超额订阅(超卖)模式在应对高并发调度和数据搬运时带来的过高时延会拖慢任务进程、拉低资源利用率。存储系统需要应对海量KV Cache的读写与持久化。而跨节点、跨智能体的上下文共享,则让网络带宽和时延面临全面承压。推理系统的瓶颈已从单一的算力,蔓延至整个基础设施栈。
聚光灯下的KV Cache
智能体时代的KV Cache:长上下文 × 高并发
在Transformer架构中,模型每生成一个Token,都需要参考前文所有Token的KV Cache。你可以将其理解为模型读书时做的“笔记”。大语言模型发展早期对“长上下文”的需求主要体现在处理大量文档,百K级甚至M级上下文已经足够处理人力难以阅读的资料了。但长思维链和多轮会话让事情发生了质变,不但长下文滚雪球式增长,其长期存储能力还限制了推理质量的上限。而当大量智能体同时运行时,这份庞大的“记忆”会轻易占满昂贵的显存,导致缓存争用与驱逐加剧,系统陷入“逐出-重算”的恶性循环,降低用户体验(首Token时延高)并浪费算力。
KV Cache卸载成为显学
GPU的显存不仅要存放KV Cache,还要承载模型权重和运行时数据。当显存告急时,系统只能清理不活跃的缓存。为了避免被驱逐的缓存被迫重新计算(Prefill),“以存代算、分层卸载”成为行业显学:将巨量KV Cache从GPU显存卸载到CPU侧的主内存或更经济的SSD、远端存储中,让昂贵的GPU算力专注于新Token的生成,而非重复计算历史。
至强成为KV Cache卸载与加速最强大脑
在“以存代算”的架构中,CPU不仅是调度中心,更是数据流转的枢纽。英特尔至强处理器凭借全方位的硬件特性与持续演进的软件优化方案,成为了承接这一重任的“最强KV Cache管家”:
- 硬功底:今年9月MLCommons正式发布MLPerf Storage v3.0 基准测试结果,基于双路至强6900性能核处理器的焱融科技全闪AI存储 F9000X一体机三节点取得了训练、CheckPoint等核心场景的多项全球第一。至强6性能核处理器每路多达128个核心,三级缓存高达504 MB,支持DDR5 MRDIMM,内存带宽高、I/O能力强,丰富的PCIe 5.0通道让高速NVMe SSD与RDMA网卡得以充分发挥,构建强大的存储底座。此外,从第四代至强可扩展处理器开始,英特尔还在CPU中内置了AMX、DSA、IAA、QAT等硬件加速器,均可在AI场景提供助攻。



- 巧分层:依托至强处理器管理的高带宽DRAM、CXL DRAM/SCM、PCIe 5.0 NVMe SSD,可以构建多层卸载机制,覆盖G2(主内存)、G2.5(CXL)、G3(本地SSD)、G3.5/4.0(全闪节点)的分层存储池。

- 精调度:KV Cache的卸载与复用涉及大量的数据搬运操作,对算力、网络带宽、存储容量带来了额外压力,需要通过各种调优缓解成本压力。英特尔为此开发了KV Cache智能加速套件,提供了KV Shrink、KV Fuse、KV Cascade、KV Infinity等工具,从不同层面提高KV Cache卸载与复用效率。其中,KV Shrink提供分层卸载,并利用QAT实现数据硬件压缩与解压;KV Fuse提升KV Cache复用概率以减少计算和传输开销,除了QAT的压缩能力,还用到AMX运行小型模型优化词元选择以寻找可复用的KV Cache,利用DSA优化KV Cache搬运;KV Cascade利用AMX承载小模型和并行处理Chunks,让GPU专注于主模型计算;KV Infinity利用AMX加速Top-K检索/索引比较与KV Cache预取决策,在数据搬运的过程中也用到了QAT与DSA的能力。简而言之,该套件充分发挥了至强处理器内置硬件加速器的优势,降低了CPU、GPU的计算开销,节约了内存消耗,节省了存储空间与传输带宽。以KV Cache的无损压缩率为例,提升可达1.42倍;综合调优后,首Token时延(TTFT)可降至1/15,KV Cache传输速度也提升高达9.66倍。





- 简部署: 英特尔KV Cache智能加速套件采用动态装饰器方式扩展vLLM等主流推理框架,实现零源码修改即可集成;提供Docker容器化方案与Python安装包,支持一键部署,企业用户通常仅需两周即可接入。
根据英特尔-道客联合实验室的测试,在典型业务场景下(缓存命中率 80%),英特尔KV Shrink方案组相比原生vLLM基线组实现了大幅的 TTFT降低,性能最高提升约 5 倍,用户交互体验改善明显。

英特尔 KV Shrink 方案与原生 vLLM 基线组 TTFT 性能对比
相比软件压缩KV Cache方案在高并发场景下需要占用大量CPU核心,导致推理主链路性能下降,基于 QAT 硬件压缩的KV Shrink方案减少了CPU占用,整体性能约为软件方案的2倍。

英特尔 KV Shrink 方案与纯 CPU 软件方案压缩/解压缩性能对比
智能体的关键舞台:沙箱
如果说KV Cache是智能体的“记忆”,那么沙箱(Sandbox)就是智能体执行任务的“舞台”。在Agentic AI时代,沙箱的重要性正被提升到前所未有的高度。
什么是沙箱?
沙箱是隔离的运行环境,智能体通常使用微虚拟机沙箱。传统虚拟机需要模拟全套硬件并启动完整操作系统,容器则需要共享主机的操作系统内核,它们太“重”了,启动时间长,可能波及主机稳定性。微虚拟机拥有自己的轻量级内核和文件系统,启动快,安全半径可控。
智能体时代的沙箱数量庞大
传统的容器化服务通常是长驻且数量可控的,但在智能体时代,沙箱呈现出海量、碎片化、生命周期长短并存的特征。一个复杂的工作流可能会并发派生出数百个子智能体,每个子智能体都需要独立的沙箱来执行代码或测试。当成千上万个智能体同时工作时,底层系统需要在极短时间内拉起、管理和销毁数以万计的沙箱实例,这对基础设施的容量和弹性伸缩能力构成了巨大挑战。
好沙箱的要求:快启快销、省空间
面对海量且频繁更迭的沙箱,一个优秀的智能体沙箱必须满足三大核心需求:
- 省空间:海量沙箱的镜像和运行时状态会吞噬大量内存和存储。系统需要对沙箱的内存页和状态快照进行高效的压缩/解压,以更省的空间消耗容纳更多的实例。
- 快启动:智能体调用工具时对时延极度敏感。沙箱在生成或者恢复时,如果镜像或状态数据过于庞大,网络传输和I/O读取将成为致命瓶颈。用于长会话、搜索、训练这类任务的沙箱是反复保存、读档的重灾区。
- 快存快取:智能体任务常因等待中间结果或人类反馈而挂起。此时,系统需要快速将沙箱的内存状态“冻结”并保存至存储层,以便腾出资源给其他活跃任务;待任务恢复时,再瞬间“解冻”。
DSA:热沙箱超卖秘籍
在热运行的智能体沙箱场景下,可以利用Linux内核的KSM(Kernel Shared Memory)内存共享机制,合并具有相同内容的物理主存页面以节省内存。英特尔至强处理器内置的DSA是高性能数据复制工具和分析加速器,可以自动扫描内存,计算跨沙箱的相同页面,从而几乎零开销地利用KSM机制。节省下来的内存资源可以用于承载更多的沙箱。
IAA:温/冷沙箱提效秘籍
英特尔至强处理器内置的IAA是专为内存密集型工作负载设计的硬件加速器。在智能体沙箱的场景中,IAA能够接管内存页的无损压缩与解压任务。在沙箱挂起时,IAA能以极高的吞吐量将内存状态压缩并写入存储;在沙箱唤醒时,又能瞬间解压恢复。这不仅大幅降低了传输带宽的压力,更让沙箱的启停时延降低(见下图英特尔实测的无压缩方案和使用IAA压缩方案的对比效果)。与基于软件的快照压缩相比,IAA通过专用硬件引擎处理数据,还可将通用CPU核心彻底释放给智能体的逻辑调度与业务编排。



结语
智能体时代的到来使得大模型推理的要求从侧重堆算力走向更平衡的存算网协同。无论是承载长上下文记忆的KV Cache,还是提供隔离执行环境的沙箱,其背后的核心矛盾都在于如何在有限的物理资源下,以尽可能低的时延和成本,支撑海量、长周期的并发任务。
在这个大紧缺时代,GPU依然是Token生产的主力;而以英特尔至强6为代表的CPU,则更凸显自身在编排、协调、控制和执行上的优势。除了提供充足的核心或通用算力满足业务调度、工具执行等操作,还要通过AMX、DSA、QAT、IAA等特定硬件加速引擎,配合分层存储与冷热调度架构,全面接管AI的记忆与运行状态。这正是CPU在智能体时代重回C位的根因,也是至强CPU与那些只凭借物理核数量与内存容量,就粗放地估算智能体承载能力与服务质量的CPU产品的不同点。当然,如何真正榨干CPU的潜力,让GPU多干新活,让已有计算成果和沙箱状态以更低的代价被保留和复用,这更是高效推进智能体AI应用与服务的必修课,而在这方面,在至强平台上,英特尔也迈出了扎实的探索与实践步伐。