当前位置:首页 / 业界 / 正文

中科曙光发布词元加速方案ParaCache 以存换算破解大模型推理显存墙

来源:互联网

2026年8月28日,中科曙光在2026中国国际大数据产业博览会期间发布词元加速方案ParaCache。该方案基于存算协同理念,构建L1-L4四级缓存体系,覆盖HBM、DRAM、SSD及分布式存储,目标直指大模型推理环节长期存在的显存瓶颈与重复计算问题。

推理算力需求加速释放

IDC预测,2027年中国智能算力中推理占比将达到72.6%,推理算力增速远超训练。高盛研报显示,2026年全球DRAM供需缺口为4.9%,NAND闪存供需缺口为4.2%,HBM供需缺口为5.1%,三项指标均创2011年以来新高,其中AI服务器贡献了超过50%的DRAM总需求。推理负载的快速增长使存储带宽与容量面临更大压力,传统以训练为中心的算力基础设施难以直接适配高并发、低时延的推理服务需求。

显存墙与重复计算的双重压力

中科曙光分布式存储产品部总经理石静指出,大模型推理存在“显存墙”与重复计算问题。以处理16K长度序列为例,单次需执行2.56亿次键值对计算,对存储层级与数据调度效率提出极高要求。在长上下文推理场景中,键值缓存数据量随序列长度与并发请求数同步增长,显存容量有限导致部分数据被迫丢弃,后续请求需重新计算,形成重复计算开销。这种显存容量受限与重复计算叠加的情况,直接推高推理时延并降低系统吞吐。

中科曙光发布词元加速方案ParaCache 以存换算破解大模型推理显存墙 图1

ParaCache通过热数据驻留HBM、温数据下沉内存或SSD、冷数据存入分布式存储的方式实现动态调度。方案采用XDS技术,使GPU显存与分布式存储直接交互,减少经CPU和SSD层级的数据搬运。L1至L4四级缓存分别对应不同热度与访问频率的数据,依据词元访问模式自动完成数据在各级存储之间的迁移,从而在有限显存条件下扩大可服务的上下文规模。

实测性能与落地案例

实测数据显示,ParaCache使单轮对话首词元时延(TTFT)最高降低98.5%,高并发场景下词元吞吐量最大提升27倍。在落地案例中,某银行信用卡中心引入该方案后并发吞吐量提升约3倍,高校科研场景并发度提升15至20倍。银行信用卡中心场景涉及大量在线对话请求,对响应时延与系统稳定性要求较高;高校科研场景则包含长文档分析与多用户并发调用,两类场景均体现出ParaCache在不同负载特征下的适配能力。

曙光8000全国产十万卡AI超集群已集成ParaCache并通过生产级验证。曙光8000、FlashNexus及ParaStorF9000作为相关产品体系组成部分,共同支撑该方案的规模化部署。其中FlashNexus与ParaStorF9000为存储侧基础设施,负责提供分布式存储容量与数据通路,曙光8000超集群则作为算力平台承载大规模推理任务。ParaCache在十万卡规模集群上的生产级验证,表明该方案能够在大规模并行推理环境中稳定运行,并实现跨节点、跨存储层级的数据调度。

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。