Menu

大模型推理遇瓶颈,正从“堆GPU”走向存算协同

图片来源:界面新闻 界面新闻记者 | 肖...
网络新闻 1 小时 之前

图片来源:界面新闻

界面新闻记者 | 肖芳

界面新闻编辑 | 文姝琪

大模型推理正在遇到新的瓶颈。

随着模型上下文越来越长、多轮对话和Agent被越来越广泛应用,推理过程中需要处理的数据量快速增加。过去主要依靠GPU算力解决问题的方式,开始暴露出了问题:算力足够了,显存却可能先被KV Cache(键值缓存)占满。

KV Cache原本是大模型推理的重要加速器,可以通俗地理解为“模型的短期记忆草稿本”。模型在处理上下文时,会将已经计算好的KeyValue向量缓存下来,后续生成新的Token时直接复用,从而避免重复计算。但当上下文越来越长,KV Cache本身又成为新的成本和性能瓶颈。

对此,中科曙光北京公司总裁助理、分布式存储产品部总经理石静在接受界面新闻采访时表示,目前行业已经形成以存换算的共识,把已经计算好的KV Cache保存下来,在后续请求中直接复用,从而减少重复计算。

传统KV Cache只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群场景中,加速效用迅速衰减。AI智能体、知识库问答这类高频调用相同上下文的应用,大量基础Token被成千上万次重复计算,GPU算力被白白浪费。

828日,中科曙光发布ParaCache解决方案,试图来解决这一问题。该方案通过构建分布式共享KV Cache池,打通GPU HBMCPU DRAMSSD和分布式存储四级缓存,让不同温度的数据进入不同存储层,同时实现跨GPU、跨节点的KV Cache复用。

通俗地讲,中科曙光的思路是把大模型用完即弃的计算中间结果,变成全集群共享的长期记忆,即算一次、存下来,谁用谁取,不必重算。石静表示,ParaCache更适合长上下文占比较高、存在大量公共重复上下文,同时具有较大并发压力的场景;如果只是一次性的短请求,缓存复用价值就相对有限。

根据中科曙光披露的测试数据,在高并发场景下,其Token吞吐量最高可以提升27倍;在多轮会话场景中,首Token时延(TTFT)降低超过80%。而在真实的场景中,某银行信用卡中心智能客服场景,并发吞吐量提升约3倍;某教科研知识库问答场景,并发度可提升1520倍。

石静对界面新闻表示,在长上下文、多轮对话、智能体等场景下,ParaCache可以帮助客户在内存与SSD配置上节省约三分之一的硬件采购。

据界面新闻了解,国内一家头部互联网厂商已和中科曙光完成在线推理业务的KV Cache管理优化。

这背后是AI基础设施建设逻辑的变化:大模型基础设施建设正在从“堆GPU”转向存算协同。石静表示,过去做AI建设的思路是遇到瓶颈就堆GPU,但GPU成本高、供给受限,数据路径上的无效计算和额外搬运也在制约GPU效率的发挥。“存算协同不是短期的技术改良,而是大规模训推生产的必然趋势。”

在石静看来,AI正在驱动数据基础设施的结构性变化,这给国内厂商带来更多机遇。

中科曙光想要抓住这一轮机遇,底气在于其在存储领域多年的积累。其ParaStor分布式存储与FlashNexus集中式存储是两大核心产品线,已广泛应用于大模型训练、自动驾驶、具身智能、智算中心等AI场景。今年7月,国内首个全国产十万卡AI超集群“曙光8000”落成并接入国家超算互联网,ParaCache正是在十万卡集群中完成验证。

更值得注意的是,ParaCache带来的不只是工程层面的优化,而是大模型推理架构的范式变化。

“以前GPU是整个架构里面的中心,KV Cache只是一个临时状态。”石静表示,在新的架构下,KV Cache正在成为一种数据资产,GPU则应该围绕这些数据提供Prefill(处理用户 Prompt)和Decode(逐字输出)计算能力。未来KV Cache管理能力甚至可能影响推理服务成本、响应速度以及Agent的扩展能力。

从行业的角度看,这一轮基础设施的结构性变化,带来的更深层次变化在于算力的建设思路。AI集群的规划正在从只看GPU算力,转向算力、存储、网络、缓存的一体化规划,并以总拥有成本(TCO)为标尺。存储的定位,也从被动的数据容器转向深度的数据调度、缓存复用与计算卸载。

可以说,管好记忆正在变得和提升算力同等重要。大模型竞争的下半场,不只是比谁的算力更强,还要比谁的数据存得更聪明。

声明:转载此文是出于传递更多信息之目的。若有来源标注错误或侵犯了您的合法权益,请作者持权属证明与本网联系,我们将及时更正、删除,谢谢

           – 推广 –