存算一体
存算一体,亦称为存内计算,是后摩尔时代针对冯・诺依曼架构固有缺陷演化形成的硬件架构范式。其核心思想是将计算功能嵌入存储阵列内部,改变存储单元与运算单元物理分离的传统设计,使部分运算任务直接在存储阵列内部完成,减少处理器与存储器之间大规模的数据搬移。在传统架构中,数据搬运带来的时延、功耗往往高于计算本身,该现象被学界概括为存储墙效应。存算一体并不以单纯提升单核运算速率为目标,而是通过削减无效数据传输开销,提升系统整体能效,为人工智能推理、神经形态计算提供新的硬件实现路径。该构想最早出现于 20 世纪 70 年代,受器件工艺约束长期停留于理论层面,伴随大参数神经网络的普及,逐步从实验室原型走向产业验证阶段。存算一体属于异构加速技术,并非通用计算机架构的完全替代方案。
中文名称:
存算一体外文名称:
Compute‑In‑Memory学术简称:
CIM所属学科 :
集成电路科学与工程、计算机体系结构核心定位:
消解存储墙的新型硬件架构范式实现类别:
数字存算、模拟存算发展脉络
理论雏形
20 世纪 70‑80 年代,计算机体系结构领域已经意识到存算分离带来的传输损耗问题,学界提出在存储内部完成运算的构想。受限于当时存储器件特性、半导体制造能力,缺少可以支持大规模并行运算的硬件载体,相关研究仅停留在架构推演与理论论文层面,没有可流片实现的完整方案。工业界主流依旧沿用冯・诺依曼体系,通过提升总线带宽、缓存层级优化缓解数据访问矛盾,并未触及架构根源。这一阶段,存算一体属于小众学术设想,未进入产业研发视野。
原型验证
2010 年之后,非易失存储器件研究取得进展,阻变、相变、自旋磁存储等器件展现出物理层面的信号运算潜力。全球多所高校与科研院所开展小规模阵列流片,完成矩阵向量乘等神经网络核心运算的硬件原理验证。该时期芯片原型普遍存在阵列规模有限、器件一致性差、系统集成度不足等问题,仅可完成基础算法演示,距离商业化产品存在明显差距。研究重心集中在器件‑电路层级,系统软件与编译链配套研究相对滞后。
产业落地
2020 年以来,大模型算力需求爆发,存储墙矛盾进一步显性化,单纯依靠制程迭代、缓存扩容已经难以平衡算力、功耗、时延三者关系。存算一体由学术原型转向产业探索,国内外研究机构与企业分别在数字、模拟两条路线推进样片开发。近存计算作为广义存算融合方案率先实现小规模商用,狭义存内计算芯片主要集中于边缘垂直场景,通用大规模商用仍处于爬坡阶段。行业逐步形成共识:存算一体将以异构协处理部件的形式融入现有算力体系,而非直接取代 GPU、NPU 等成熟计算芯片。
架构机理
体系瓶颈
冯・诺依曼架构将存储与计算划分为两个独立模块,计算过程需要反复读取存储内的数据,运算结束后回写结果。人工智能任务中矩阵乘法占绝大多数运算量,模型参数量持续膨胀,存储带宽增长速度显著落后于算力增长速度,由此形成存储墙。大量能耗消耗在数据读取、传输、回写过程,计算单元时常处于等待数据的空闲状态。工艺微缩可以提升晶体管算力,但无法从根本解决模块间数据搬移的结构性矛盾。存算一体正是针对这一结构性矛盾提出的架构解决方案。
运行机制
存算一体改变 “搬运数据再执行计算” 的工作流程,将权重驻留于存储阵列内部,输入信号送入阵列后直接完成矩阵向量运算,运算结果就近输出,降低跨模块的数据传输频次与传输距离。其能效增益具备场景依赖性:参数量越大、重复读取权重越多的任务,架构收益越显著。需要厘清概念边界,3D 堆叠、芯粒封装可以缩短存储与计算单元物理距离,属于近存优化手段,可与存算一体协同使用,但不等同于狭义存算一体。狭义存算一体要求运算行为发生在存储阵列单元内部。
能力边界
存算一体存在明确能力边界,不能覆盖全部计算任务。其优势集中在高并行矩阵运算、神经网络推理等场景;对于复杂分支跳转、高精度浮点运算、通用逻辑处理,原生存算阵列存在明显短板。从体系结构视角看,存算一体是对冯・诺依曼架构的补充,而非完全颠覆。未来较长周期内,硬件系统将走向异构混合模式,传统通用内核与存算阵列分工协作,共同完成完整计算任务。
技术路径
模拟存算
模拟存算依托存储器件电导、电阻等物理属性映射权重,在模拟信号域完成并行矩阵运算,多采用 RRAM、PCRAM、MRAM 等非易失存储介质。权重以物理状态形式保存在阵列,断电可保留,天然适配低功耗边缘推理。该路线并行度高,理论能效上限突出,但受器件物理特性约束,存在阻值漂移、器件离散性、噪声干扰等问题,计算精度受限,数模转换外围电路会带来额外开销,大规模阵列良率控制难度较高,片上训练实现难度大。
数字存算
数字存算以 SRAM、DRAM 等成熟存储介质为基础,在存储阵列内嵌入数字逻辑电路,全部运算在数字域完成。完整继承数字计算精度可控的优势,与现有半导体工艺兼容性强,软件工具链适配难度相对更低,是当前商业化推进较快的技术路线。受硬件电路改造约束,数字存算的理论能效上限低于模拟路线,阵列单元面积开销更大,更适合对计算精度有硬性约束的推理业务。
近存融合
近存融合属于广义存算融合范畴,并不在存储单元内部执行运算,依靠 3D 堆叠、芯粒互连等封装手段,缩短存储阵列与计算内核的物理距离,提升访问带宽,降低传输时延。该方案工艺成熟度最高,落地门槛低。但存储与计算依旧保持物理分离,数据搬移行为并未消除,属于向狭义存算一体过渡的中间技术形态。
存储介质
成熟存储器
SRAM 静态随机存储器,是数字存算一体主流载体,读写速度快,工艺兼容性好,单元面积偏大,断电丢失数据,多用于片内高速存算阵列。DRAM 动态随机存储器,单位容量成本低,适合大容量存储扩展,但存储单元改造难度较高。NAND 闪存,存储密度高,成本优势明显,读写速率受限,多用于权重数据存储,难以直接承担高频实时运算。成熟存储器的核心优势是供应链完备,短板在于不具备原生模拟运算能力,需要额外叠加计算逻辑电路。
新型非易失介质
阻变存储器 RRAM,即忆阻器,是模拟存算一体研究最为广泛的器件,依靠电阻状态变化存储信息,可构建交叉阵列,适配模拟矩阵运算,器件一致性、循环耐久度仍是需要持续优化的工程问题。相变存储器 PCRAM 依托材料晶态‑非晶态相变实现阻值切换,阵列集成能力较强,存在阻值漂移、重置功耗偏高问题。磁阻存储器 MRAM 读写速度优异,抗干扰能力强,单元制造成本有待进一步下降。铁电 FET 基于铁电层实现信息存储,具备低功耗潜力,大规模阵列拓展仍面临工程挑战。各类新型介质各有取舍,不存在可以兼顾全部指标的理想器件。
应用领域
边缘智能
边缘终端受功耗、体积约束,云端回传模式存在时延与隐私风险,是存算一体优先落地场景。智能感知摄像头、可穿戴设备、语音终端可在本地完成特征提取与推理,减少数据上传频次。车载感知单元利用存算阵列处理多路传感数据,实现低时延目标识别。在端侧场景,存算一体的价值集中于本地智能处理,降低整机功耗,缓解带宽压力。
云端加速
云端大模型推理过程中,海量权重需要反复读取,数据搬移开销占比极高。存算一体硬件一般不作为独立通用算力,而是作为异构协处理器,承担矩阵运算部分任务,与 GPU、通用 CPU 协同工作,优化集群整体能效。训练场景对精度、动态更新能力要求严苛,存算一体用于云端训练尚处于科研探索阶段,距离规模化部署仍有距离。
神经形态
人脑神经突触具备存储与处理合一的特征,存算一体硬件架构与神经形态计算的物理模型高度契合,为类脑硬件提供实现底座。区别于传统 AI 芯片,神经形态硬件侧重脉冲信号处理,存算阵列可以模拟突触权重更新行为,支撑脉冲神经网络运行,为低功耗类脑系统提供硬件基础。
物联特种
海量物联网节点依靠电池供电,续航是核心约束。存算一体可实现感知、存储、计算紧密耦合,传感器采集原始信号后直接在阵列完成特征筛选,仅上传有效特征,降低通信功耗。航空航天、工业监测等特种场景,部分非易失器件具备抗辐射特性,可以在严苛环境完成本地智能处理,缩减系统体积与功耗。
现存瓶颈
器件非理想效应
模拟路线受器件固有非理想效应制约,器件之间阻值离散、阻值随时间漂移、循环耐久不足,会在阵列运算中累积计算误差。阵列规模越大,误差叠加效应越明显,需要配套算法进行补偿校正。数字路线规避模拟噪声,但存储单元改造会带来面积、功耗之间的权衡,难以同时实现大容量、高速度、低功耗。器件层面的一致性与可靠性,是制约大规模阵列商用的底层工程障碍。
软件栈不完备
现有编译框架、算子库、调试工具均面向冯・诺依曼架构开发。存算一体硬件需要重构算子映射、编译调度、量化适配整套软件体系。硬件性能再优,若缺少易用的开发工具链,会大幅抬高应用开发门槛。当前行业尚未形成统一的编程抽象与接口标准,软件生态建设进度显著滞后于硬件原型迭代,是仅次于器件工艺的关键阻碍。
系统集成难题
存算阵列无法独立完成完整业务,需要和 CPU、外设、内存管理单元协同工作。涉及任务调度、数据一致性管理、结果回写、异常处理等一系列系统层面问题。如何实现传统计算任务与存算加速任务的合理调度,如何兼容现有操作系统与上层软件,是从芯片样片走向可用产品必须攻克的系统工程。
规模化成本约束
新型存储介质需要产线改造,前期研发与流片投入高昂。在阵列规模较小时,存算一体综合成本不一定优于成熟 ASIC。只有当业务算力规模达到阈值,能效收益能够覆盖硬件改造成本,才具备商业可行性。现阶段产品多面向细分垂直场景,通用场景大规模普及需要工艺迭代摊薄制造成本。
发展趋向
异构协同架构
中长期技术演进中,完全摒弃冯・诺依曼体系的纯存算通用系统实现难度极高,异构协同将成为主流路径。依托先进封装技术,将存算阵列、通用计算内核、传统存储芯粒集成于同一系统内部,不同硬件单元各司其职。存算阵列承担高并行矩阵运算,通用内核处理逻辑控制、分支计算等任务,兼顾能效与通用性,是产业落地最现实的技术路线。
软硬协同优化
技术演进不再单一追求硬件器件指标提升,走向器件‑电路‑架构‑算法全栈协同。针对存算硬件带来的噪声、精度损失,设计适配硬件特性的网络量化、权重映射、误差补偿算法,用算法抵消部分器件物理缺陷,降低硬件设计压力。软硬件协同是充分释放存算一体硬件潜力的核心路径。
感存算一体化
技术边界由单纯存储‑计算融合,进一步向感知‑存储‑计算一体化延伸。将传感器采集链路与存算阵列直连,原始传感信号无需多次中转,直接送入阵列完成特征运算,进一步压缩信号传输开销。该方向面向机器人、机器视觉等端侧智能设备,拓展硬件应用边界。
基准体系建设
伴随产业化推进,行业将逐步建立客观统一的性能测试基准。当前部分宣传仅突出单一指标,忽略阵列规模、外围电路开销、实际任务吞吐等综合条件。统一评测基准可以客观衡量不同路线硬件的真实系统性能,推动接口、编程模型逐步规范化,降低软件适配成本,引导行业理性发展。
学术评述
存算一体是后摩尔时代算力范式变迁的代表性方向,但需要客观区分技术价值与概念炒作。该技术的优势高度绑定任务属性,不能将其解读为可以全面替代现有芯片的万能方案。模拟、数字两条技术路线不存在绝对优劣,二者是面向不同应用场景的取舍:模拟路线追求极致能效,需要接受可靠性与精度代价;数字路线换取兼容性与可控精度,需要承担硬件资源开销,未来产业大概率双线并行,而非某一路线完全淘汰另一路线。
在概念辨析层面,评判是否属于狭义存算一体,核心判定标准是运算行为是否发生在存储阵列单元内部,是否真正削减存储‑计算之间的数据搬移,而不是仅依靠封装手段缩短物理距离。
摩尔定律放缓背景下,算力提升逻辑由追求晶体管数量增长,转向减少系统内部无效开销。存算一体代表这一算力演进方向,为超低功耗端侧智能提供新的硬件可能性。但其从实验室原型走向大规模普及,需要器件工艺、电路设计、系统软件、算法模型多链条同步成熟,短期之内仍是现有算力体系的补充,而非完全替代者[1][2][3][4]。
