4Syw0BUUBk0 tech.huanqiu.comarticle环球问策|中科曙光石静:存算协同重构AI推理效率/e3pmh164r/e3pmh33i9【环球网科技报道 记者 李文瑶】8月28日,2026中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案——基于存算协同理念的ParaCache高效管理方案。实测显示:基于该方案,模型单轮对话首词元时延(TTFT)最高降低98.5%,高并发场景词元吞吐量最大提升27倍。“大模型推理每生成一个新字,模型要重复计算所有历史内容的键(Key)和值(Value)向量。处理16K长度的序列,单次推理需要执行2.56亿次键值对计算。”在接受记者采访时,中科曙光分布式存储产品部总经理石静用一组直观的数据向记者描述了当前大模型推理面临的效率困境。 就在一个月前,中国首个全国产十万卡AI超集群“曙光8000(登峰)”正式落成并接入国家超算互联网。与此同时,赛迪顾问数据显示,2022年至2025年中国分布式存储市场规模从104.2亿元跃升至289.4亿元,累计增幅达177.8%。大模型推理正在从“技术验证”走向“规模化落地”,而存储——这个过去被视为算力“配角”的领域,正站上舞台中央。推理时代来临:GPU遭遇“显存墙”与“健忘症”过去两年,AI算力市场的重心正发生转移。包括IDC、德勤等机构一致测算,2026年全球推理算力占比已突破66%。工业和信息化部数据显示,2025年国内智能算力总规模达每秒680百亿亿次浮点运算,其中推理算力占比快速攀升至38%。推理服务需求的指数级增长,使产业发展重心从模型训练转向推理服务。然而,推理规模化部署带来的挑战远比想象中复杂。石静向记者解释,当前主流大模型采用“自回归”方式逐字生成回答,这个过程好比一个“健忘”的助手,每写下一个新字,都需要把前面所有的历史对话重新“回想”一遍并进行计算。这种机制导致计算量呈平方级增长,直接拖慢响应速度。为了解决这个问题,业界通行的做法是引入KV Cache(键值缓存)技术——将已计算好的历史上下文向量暂存在GPU的高带宽显存(HBM)中,避免重复计算。但这又引发了新的矛盾。“KV Cache虽然加速了‘思考’,却让‘记忆’变得极其昂贵。 ”石静指出。KV Cache对显存消耗极大,随着上下文长度增加和多轮对话深入,HBM很快会被撑满。据业内分析,KV缓存已成为GPU上主要的存储瓶颈,每Token对应的KV Cache可达数十KB,大规模服务中每日需处理数百TB甚至PB级缓存数据。这堵“显存墙”导致一个尴尬局面:即便GPU算力有余,也因显存容量不足而无法响应更多请求。数据印证了这一判断。2025年下半年以来存储芯片持续涨价,进入2026年涨幅更惊人,AI芯片已进入“内存为王”时代。TrendForce预估,2027年HBM合约价格仍可能上涨70%至140%。企业为了跑长文本任务,被迫采购更高端、显存更大的GPU,单次词元生成的硬件成本急剧攀升。存储正在成为AI基础设施的沉重“负担”。四级缓存破局:从“存数据”到“存智能”面对行业共性痛点,中科曙光此次推出的ParaCache方案给出了系统性解法。其核心逻辑是通过工程创新将存储系统从被动的“数据仓库”升级为主动的“智能调度中心”。石静详细拆解了ParaCache的技术架构。该方案构建了业界完整的L1至L4四级缓存体系: L1对应GPU HBM,L2为CPU DRAM,L3为SSD(首次创新性地纳入了集中式存储FlashNexus),L4则为分布式共享存储池ParaStor。“我们的理念是从‘存数据’到‘存智能’。”石静强调,KV Cache本身就是一种蕴含上下文理解的智能化数据。通过全局统一的数据视图和元数据管理,ParaCache能够打破传统方案中的数据孤岛,让KV Cache在四个层级间根据“热度”自动流转——热数据驻留HBM实现极速响应,温数据下沉至内存或SSD,冷数据则持久化存放在大规模分布式存储中。这种动态调度机制背后的核心逻辑有三重。第一是池化共享——只有把KV Cache池化,才能将推理集群规模扩大,实现跨GPU、跨节点的缓存复用。第二是元数据统筹管理——池化只是第一步,必须把元数据统一管理起来,才能知道在整个分布式集群中,当前需要的KV Cache该落到哪一个层级,根据热度去做调度。第三是智能调度——基于业务情况判断何时预取、何时淘汰。石静特别提到,ParaCache的调度算法可以基于目录设置不同的淘汰策略,“假如说咱们有两个推理应用,一个推理应用可能希望KV Cache保存到几分钟就淘汰,另一个可能要保留到小时级别,我们可以基于目录去设置不同策略”。石静说道。在L4分布式存储层,ParaCache做了多项定向优化。一是将覆盖写改为追加写,降低延迟;二是对分布式锁做轻量化处理,可基于目录去掉重排他锁;三是在PD分离架构中只传输增量KV,节省网络带宽。石静特别强调了中科曙光首创的XDS技术的价值,“XDS能够支持国内主流AI加速卡直接与分布式存储交互,实现从L1到L4的直接卸载与回迁,跳过L2和L3层级,省掉CPU DRAM和本地SSD”。这种机制带来的收益是显著的。测试数据显示,面对30K至120K长度的多轮对话场景,ParaCache可将首次Token时延(TTFT)降低89%;在高并发场景下,Token吞吐量最大可提升27倍。这意味着,通过存力换算力,企业可以用中低配硬件的成本,跑出高配硬件的上下文长度。在技术生态层面,ParaCache展现出务实的开放姿态。石静明确表示,ParaCache与LMCache等业界主流开源项目深度兼容,“已基于vLLM、SGLang等主流推理框架搭建业务的客户,可以无缝接入,无需推倒重来”。在硬件层面,ParaStor分布式全闪存刚刚拿下2026年IO500生产型双榜第一,这是中国厂商首次在生产类榜单斩获双料冠军。存算协同重塑AI基建:从“堆GPU”到“全局最优”此次采访也恰逢曙光8000正式落成。作为其中的关键推理组件,ParaCache已在超大规模集群中得到初步验证。这不仅是技术突破,更折射出AI基础设施建设思路的改变。“以前遇到瓶颈就堆GPU,但这条路越来越窄。”石静对记者分析道。随着“十五五”规划将存力纳入算力枢纽考核体系,以及“双碳”目标临近,AI基础设施正在从“算力单点突破”走向“算-存-传”系统级协同优化。存储不再只是算力的附属品,而是决定GPU利用率的核心变量。2023年,工信部等六部门联合印发《算力基础设施高质量发展行动计划》,明确提出“推动计算与存储融合设计,促进存储与网络和计算协同发展,引导合理配置存算比例”。2025年,国家数据局进一步提出“存力算力协同发展指数”考核体系。内蒙古自治区已出台《数据中心存力分级评估规范》等地方标准,建立起覆盖存储容量、性能、安全、能耗的分级评估体系。存力正首次实现与算力“政策同权”。赛迪顾问报告印证了这一趋势。报告显示,当万卡集群中存储IOPS不足时,GPU有效利用率可从90%骤降至40%以下。分布式全闪存凭借NVMe-oF协议栈、RDMA网络直连和百万级IOPS能力,已成为万卡级智算中心的标准配置。赛迪顾问预测,2026至2028年中国分布式存储市场规模将从428亿元增长至838亿元。存储竞争的核心已从容量、可靠性等通用指标转向AI场景适配能力。石静进一步分析了ParaCache在超大规模集群中需要应对的挑战。“10万卡计算节点之间交互,还有PD分离这种跨节点的KV读取,对时间要求很高。同时,多会话并发读写时如果不做好处理,可能会导致脏数据、垃圾数据,推理结果出错。”曙光8000通过自研的scaleFabric原生RDMA无损高速网络和元数据持久化设计来应对这些挑战,“元数据不会乱,数据就不会乱”。在应用场景上,石静指出ParaCache最适用五类场景:长上下文多轮对话、RAG知识库问答、AI智能体工作流、固定任务场景(如文档摘要)、以及分布式推理场景。“如果是一些短请求,问一次就再也不问了,那它本身不会去共用KV Cache,就没有很大收益。如果是实时交易性非常强的场景,KV Cache技术也不是特别适合,因为从L2、L3到L4,无论做得多么快,性能也没有L1高。”但她强调,“这两个极端场景在当前推理应用中反而不是最多的。”从石静的角度来看,与其花天价去买更大的显存,不如通过智能的KV Cache管理,把昂贵的HBM留给最急迫的实时计算,把历史的、共享的上下文交给更大更便宜的存储池。这种转变对于正努力降低推理成本、推动大模型应用爆发的产业界而言,提供了一条极具参考价值的破局路径。随着十万卡级AI基础设施从标志性工程走向持续部署,存储系统的战略价值将进一步凸显。展望未来,随着AI智能体和多模态应用的普及,上下文共享和长序列处理的需求将呈指数级增长。赛迪顾问指出,AI存储专业化正成为技术演进的主线,KV-Cache、CheckPoint等AI原生存储场景正推动技术向场景定制化转型。ParaCache这类缓存管理系统,或许将如同操作系统管理内存一样,成为下一代AI算力集群中不可或缺的“基础设施软件”,重新定义Token生成的效率边界。当算力追逐遭遇物理极限,存算协同正在打开一扇新的窗户。1787920264048环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:石婷婷环球网17879202640481[]{"email":"shitingting@huanqiu.com","name":"石婷婷"}
【环球网科技报道 记者 李文瑶】8月28日,2026中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案——基于存算协同理念的ParaCache高效管理方案。实测显示:基于该方案,模型单轮对话首词元时延(TTFT)最高降低98.5%,高并发场景词元吞吐量最大提升27倍。“大模型推理每生成一个新字,模型要重复计算所有历史内容的键(Key)和值(Value)向量。处理16K长度的序列,单次推理需要执行2.56亿次键值对计算。”在接受记者采访时,中科曙光分布式存储产品部总经理石静用一组直观的数据向记者描述了当前大模型推理面临的效率困境。 就在一个月前,中国首个全国产十万卡AI超集群“曙光8000(登峰)”正式落成并接入国家超算互联网。与此同时,赛迪顾问数据显示,2022年至2025年中国分布式存储市场规模从104.2亿元跃升至289.4亿元,累计增幅达177.8%。大模型推理正在从“技术验证”走向“规模化落地”,而存储——这个过去被视为算力“配角”的领域,正站上舞台中央。推理时代来临:GPU遭遇“显存墙”与“健忘症”过去两年,AI算力市场的重心正发生转移。包括IDC、德勤等机构一致测算,2026年全球推理算力占比已突破66%。工业和信息化部数据显示,2025年国内智能算力总规模达每秒680百亿亿次浮点运算,其中推理算力占比快速攀升至38%。推理服务需求的指数级增长,使产业发展重心从模型训练转向推理服务。然而,推理规模化部署带来的挑战远比想象中复杂。石静向记者解释,当前主流大模型采用“自回归”方式逐字生成回答,这个过程好比一个“健忘”的助手,每写下一个新字,都需要把前面所有的历史对话重新“回想”一遍并进行计算。这种机制导致计算量呈平方级增长,直接拖慢响应速度。为了解决这个问题,业界通行的做法是引入KV Cache(键值缓存)技术——将已计算好的历史上下文向量暂存在GPU的高带宽显存(HBM)中,避免重复计算。但这又引发了新的矛盾。“KV Cache虽然加速了‘思考’,却让‘记忆’变得极其昂贵。 ”石静指出。KV Cache对显存消耗极大,随着上下文长度增加和多轮对话深入,HBM很快会被撑满。据业内分析,KV缓存已成为GPU上主要的存储瓶颈,每Token对应的KV Cache可达数十KB,大规模服务中每日需处理数百TB甚至PB级缓存数据。这堵“显存墙”导致一个尴尬局面:即便GPU算力有余,也因显存容量不足而无法响应更多请求。数据印证了这一判断。2025年下半年以来存储芯片持续涨价,进入2026年涨幅更惊人,AI芯片已进入“内存为王”时代。TrendForce预估,2027年HBM合约价格仍可能上涨70%至140%。企业为了跑长文本任务,被迫采购更高端、显存更大的GPU,单次词元生成的硬件成本急剧攀升。存储正在成为AI基础设施的沉重“负担”。四级缓存破局:从“存数据”到“存智能”面对行业共性痛点,中科曙光此次推出的ParaCache方案给出了系统性解法。其核心逻辑是通过工程创新将存储系统从被动的“数据仓库”升级为主动的“智能调度中心”。石静详细拆解了ParaCache的技术架构。该方案构建了业界完整的L1至L4四级缓存体系: L1对应GPU HBM,L2为CPU DRAM,L3为SSD(首次创新性地纳入了集中式存储FlashNexus),L4则为分布式共享存储池ParaStor。“我们的理念是从‘存数据’到‘存智能’。”石静强调,KV Cache本身就是一种蕴含上下文理解的智能化数据。通过全局统一的数据视图和元数据管理,ParaCache能够打破传统方案中的数据孤岛,让KV Cache在四个层级间根据“热度”自动流转——热数据驻留HBM实现极速响应,温数据下沉至内存或SSD,冷数据则持久化存放在大规模分布式存储中。这种动态调度机制背后的核心逻辑有三重。第一是池化共享——只有把KV Cache池化,才能将推理集群规模扩大,实现跨GPU、跨节点的缓存复用。第二是元数据统筹管理——池化只是第一步,必须把元数据统一管理起来,才能知道在整个分布式集群中,当前需要的KV Cache该落到哪一个层级,根据热度去做调度。第三是智能调度——基于业务情况判断何时预取、何时淘汰。石静特别提到,ParaCache的调度算法可以基于目录设置不同的淘汰策略,“假如说咱们有两个推理应用,一个推理应用可能希望KV Cache保存到几分钟就淘汰,另一个可能要保留到小时级别,我们可以基于目录去设置不同策略”。石静说道。在L4分布式存储层,ParaCache做了多项定向优化。一是将覆盖写改为追加写,降低延迟;二是对分布式锁做轻量化处理,可基于目录去掉重排他锁;三是在PD分离架构中只传输增量KV,节省网络带宽。石静特别强调了中科曙光首创的XDS技术的价值,“XDS能够支持国内主流AI加速卡直接与分布式存储交互,实现从L1到L4的直接卸载与回迁,跳过L2和L3层级,省掉CPU DRAM和本地SSD”。这种机制带来的收益是显著的。测试数据显示,面对30K至120K长度的多轮对话场景,ParaCache可将首次Token时延(TTFT)降低89%;在高并发场景下,Token吞吐量最大可提升27倍。这意味着,通过存力换算力,企业可以用中低配硬件的成本,跑出高配硬件的上下文长度。在技术生态层面,ParaCache展现出务实的开放姿态。石静明确表示,ParaCache与LMCache等业界主流开源项目深度兼容,“已基于vLLM、SGLang等主流推理框架搭建业务的客户,可以无缝接入,无需推倒重来”。在硬件层面,ParaStor分布式全闪存刚刚拿下2026年IO500生产型双榜第一,这是中国厂商首次在生产类榜单斩获双料冠军。存算协同重塑AI基建:从“堆GPU”到“全局最优”此次采访也恰逢曙光8000正式落成。作为其中的关键推理组件,ParaCache已在超大规模集群中得到初步验证。这不仅是技术突破,更折射出AI基础设施建设思路的改变。“以前遇到瓶颈就堆GPU,但这条路越来越窄。”石静对记者分析道。随着“十五五”规划将存力纳入算力枢纽考核体系,以及“双碳”目标临近,AI基础设施正在从“算力单点突破”走向“算-存-传”系统级协同优化。存储不再只是算力的附属品,而是决定GPU利用率的核心变量。2023年,工信部等六部门联合印发《算力基础设施高质量发展行动计划》,明确提出“推动计算与存储融合设计,促进存储与网络和计算协同发展,引导合理配置存算比例”。2025年,国家数据局进一步提出“存力算力协同发展指数”考核体系。内蒙古自治区已出台《数据中心存力分级评估规范》等地方标准,建立起覆盖存储容量、性能、安全、能耗的分级评估体系。存力正首次实现与算力“政策同权”。赛迪顾问报告印证了这一趋势。报告显示,当万卡集群中存储IOPS不足时,GPU有效利用率可从90%骤降至40%以下。分布式全闪存凭借NVMe-oF协议栈、RDMA网络直连和百万级IOPS能力,已成为万卡级智算中心的标准配置。赛迪顾问预测,2026至2028年中国分布式存储市场规模将从428亿元增长至838亿元。存储竞争的核心已从容量、可靠性等通用指标转向AI场景适配能力。石静进一步分析了ParaCache在超大规模集群中需要应对的挑战。“10万卡计算节点之间交互,还有PD分离这种跨节点的KV读取,对时间要求很高。同时,多会话并发读写时如果不做好处理,可能会导致脏数据、垃圾数据,推理结果出错。”曙光8000通过自研的scaleFabric原生RDMA无损高速网络和元数据持久化设计来应对这些挑战,“元数据不会乱,数据就不会乱”。在应用场景上,石静指出ParaCache最适用五类场景:长上下文多轮对话、RAG知识库问答、AI智能体工作流、固定任务场景(如文档摘要)、以及分布式推理场景。“如果是一些短请求,问一次就再也不问了,那它本身不会去共用KV Cache,就没有很大收益。如果是实时交易性非常强的场景,KV Cache技术也不是特别适合,因为从L2、L3到L4,无论做得多么快,性能也没有L1高。”但她强调,“这两个极端场景在当前推理应用中反而不是最多的。”从石静的角度来看,与其花天价去买更大的显存,不如通过智能的KV Cache管理,把昂贵的HBM留给最急迫的实时计算,把历史的、共享的上下文交给更大更便宜的存储池。这种转变对于正努力降低推理成本、推动大模型应用爆发的产业界而言,提供了一条极具参考价值的破局路径。随着十万卡级AI基础设施从标志性工程走向持续部署,存储系统的战略价值将进一步凸显。展望未来,随着AI智能体和多模态应用的普及,上下文共享和长序列处理的需求将呈指数级增长。赛迪顾问指出,AI存储专业化正成为技术演进的主线,KV-Cache、CheckPoint等AI原生存储场景正推动技术向场景定制化转型。ParaCache这类缓存管理系统,或许将如同操作系统管理内存一样,成为下一代AI算力集群中不可或缺的“基础设施软件”,重新定义Token生成的效率边界。当算力追逐遭遇物理极限,存算协同正在打开一扇新的窗户。