类脑智能、神经形态芯片与非冯诺依曼计算原型系统研发
作者单位:淞基科技(上海)有限公司,淞基信息通讯研究院,淞基未来信息网研究部,淞基新一代信息技术网研究部
摘要
冯・诺依曼架构自现代计算机诞生以来长期主导通用计算体系,存储与计算分离的架构瓶颈在人工智能大规模落地阶段愈发凸显,内存墙、功耗墙、带宽约束限制了端侧智能设备的持续感知、长时记忆与实时推理能力。类脑智能借鉴生物大脑神经元、突触网络的信息编码与处理机制,以脉冲神经网络作为核心算法载体,结合神经形态芯片硬件实现,构建非冯诺依曼计算体系,成为下一代人工智能硬件范式的核心探索方向。本文围绕神经形态芯片底层原理、脉冲神经网络建模方法、非冯诺依曼原型系统架构设计、端侧持续感知与长期记忆应用场景、原型系统试验验证方案展开系统性研究,剖析当前类脑硬件研发中的核心技术难点,梳理器件、电路、算法、系统一体化协同研发路径,开展原型系统性能测试与指标分析,讨论技术产业化落地约束与未来演进路线。研究表明,基于神经形态芯片与脉冲神经网络构建的非冯诺依曼计算系统,能够显著降低端侧智能任务的功耗,支持事件驱动型持续感知与增量式长期记忆,为脱离传统通用计算框架的下一代低功耗 AI 硬件提供可行技术路线。
关键词:类脑智能;神经形态芯片;非冯诺依曼计算;脉冲神经网络;端侧智能;长期记忆;事件驱动
第一章 绪论
1.1 研究背景
数字化与人工智能技术的普及,推动智能感知终端大规模部署,从可穿戴设备、环境感知节点、工业传感终端到边缘机器人,端侧场景对人工智能提出全新需求:设备长期离线运行、连续感知环境变化、记忆时序信息、自主增量学习,同时硬件功耗需要维持在毫瓦甚至微瓦级别。基于冯诺依曼架构的传统 CPU、GPU、NPU,遵循存储与计算单元物理分离的设计,计算过程中需要持续在存储器与运算单元之间搬运数据。在深度学习模型推理任务中,数据搬运消耗的能耗远大于算术运算本身,这就是广为人知的内存墙问题。随着模型参数规模增长,带宽需求、功耗延迟矛盾持续放大,传统架构难以满足海量分布式端侧感知节点的低功耗、长待机需求。
生物大脑为信息处理提供了完全不同的范式。人脑拥有约 860 亿神经元,百万亿级突触连接,依靠脉冲信号(动作电位)实现事件驱动式信息编码。神经元仅在输入信号超过阈值时才发放脉冲,无事件发生时几乎不产生能耗;记忆存储与信息计算发生在突触本身,实现存算一体,天然规避数据反复搬运带来的功耗开销。类脑智能正是借鉴这一生物信息处理机制,不再复刻传统数字计算机的数值计算模式,而是构建脉冲驱动、存算融合、事件触发的软硬件体系。神经形态芯片作为类脑智能的硬件载体,以模拟 / 混合信号电路模拟神经元与突触行为,搭建脉冲神经网络硬件运行环境,属于典型的非冯诺依曼计算硬件。
当前全球类脑硬件研究已经从基础器件探索走向原型系统搭建阶段。国内外研究机构陆续发布神经形态芯片产品,实现小规模脉冲网络的硬件部署,但现有系统普遍存在网络规模有限、长期记忆维持能力弱、端侧场景适配不足、软硬件协同工具链不完善等问题。多数研究聚焦神经元电路设计或者脉冲网络算法仿真,缺少从芯片、网络到完整原型系统一体化研发,缺少面向端侧持续感知场景的工程验证。跳出传统通用计算框架,开展神经形态芯片、脉冲神经网络、非冯诺依曼原型系统一体化研发,验证低功耗端侧 AI 硬件范式,具备显著的理论价值与工程意义。
1.2 国内外研究现状
1.2.1 国外研究进展
类脑与神经形态计算的研究起步较早。加州理工、IBM、英特尔、曼彻斯特大学等机构持续推进神经形态芯片研发。IBM TrueNorth 芯片采用数字电路实现神经元与突触,能够大规模集成神经元阵列,采用事件驱动架构,功耗远低于同规模传统 NPU;英特尔 Loihi 系列神经形态芯片,支持脉冲神经网络在线增量学习,可完成图像、气味、触觉等事件流感知任务,面向边缘低功耗感知场景;欧洲 BrainScaleS 项目基于模拟电路神经形态硬件,复刻生物神经元动态特性,实现高速脉冲网络仿真。
国外研究重点集中在神经元阵列电路设计、突触可塑性硬件实现、脉冲学习规则验证。但是,现有商用和原型芯片依然存在短板:模拟电路版本器件漂移问题难以解决,数字神经形态芯片存储容量有限,长期记忆随时间衰减明显;系统层面大多作为独立加速模块使用,没有完全脱离传统计算机的主控依赖,完整独立的非冯诺依曼原型系统较少,面向端侧持续感知、数年尺度长期记忆的工程验证案例不足。
1.2.2 国内研究进展
国内高校、科研院所与科技企业持续布局类脑智能与神经形态硬件研究,在脉冲神经网络算法、存算一体器件、神经形态芯片原型方面取得阶段性成果。国内团队在脉冲编码、时空脉冲学习规则、事件相机结合类脑感知方向产出大量论文,基于相变存储、阻变存储器的突触器件研究快速推进,多家单位流片小规模神经形态芯片,开展图像识别、语音识别等基础任务测试。
国内研究现阶段更多偏向器件层面与算法仿真层面,完整的非冯诺依曼原型系统研发案例相对稀缺。多数类脑硬件需要搭配传统主控芯片运行,属于 “冯诺依曼主机 + 类脑加速器” 混合架构,并非原生非冯诺依曼系统;针对端侧持续感知、长期记忆的一体化软硬件优化不足,缺少完整的原型验证体系,工程落地层面的稳定性、可靠性测试数据积累有限。整体来看,国内在底层器件、芯片设计、系统集成全链条一体化研发上仍有拓展空间,亟需面向端侧场景,搭建原生非冯诺依曼计算原型系统,完成从理论、芯片到系统的闭环验证。
1.2.3 现有研究存在的不足
综合国内外现状,当前领域存在几方面核心短板。第一,软硬件割裂,脉冲神经网络算法大多基于软件仿真开发,移植到神经形态硬件后,器件非理想特性会严重降低模型精度,缺少软硬件协同设计流程。第二,记忆机制局限,现有脉冲网络多实现短期时序记忆,难以在硬件层面稳定维持长期记忆,持续感知过程中新输入事件容易覆盖旧记忆。第三,架构混合化,大量类脑硬件仍然依附传统冯诺依曼主控,没有构建独立的存算一体原生非冯系统,无法完全发挥低功耗潜力。第四,场景验证薄弱,测试任务多为静态数据集识别,缺少连续流式事件感知、长时间在线自主学习的端侧实景测试。
1.3 本文研究内容与技术路线
本文跳出传统通用计算框架,围绕低功耗类脑神经形态芯片、脉冲神经网络算法、非冯诺依曼计算原型系统开展一体化研发,目标面向端侧持续感知、长期记忆两大核心场景,探索下一代低功耗 AI 硬件范式并完成试验验证。
研究内容分为四个板块:
(1)类脑与非冯诺依曼计算基础理论梳理,神经元、突触动力学建模,脉冲神经网络编码、传递、可塑性学习理论;
(2)神经形态芯片架构设计,神经元电路、突触阵列、事件驱动路由、存算一体存储单元设计,芯片功耗、噪声、器件漂移约束分析;
(3)非冯诺依曼原型系统整体搭建,软硬件协同工具链开发,脉冲网络部署、事件感知信号接入、长期记忆模块设计;
(4)原型系统试验验证,搭建端侧持续感知测试场景,开展功耗、识别准确率、记忆保持时长、事件响应延迟测试,分析系统瓶颈,提出优化方向。
技术路线:理论建模→器件电路仿真→芯片架构设计→脉冲网络算法设计与仿真→原型硬件集成→软硬件适配调试→多组场景试验验证→性能评估与迭代优化。
1.4 论文组织结构
第一章为绪论,阐述研究背景、国内外现状、研究内容与技术路线。第二章阐述类脑智能、神经形态芯片、非冯诺依曼计算基础理论。第三章开展神经形态芯片架构与底层电路设计研究。第四章构建脉冲神经网络模型,研究事件编码、突触可塑性、长期记忆实现方法。第五章完成非冯诺依曼原型系统整体架构设计、硬件集成、软件工具链开发。第六章设计试验方案,对原型系统开展多维度测试,分析试验结果。第七章分析技术挑战、未来演进路径。第八章总结全文。
第二章 类脑智能与非冯诺依曼计算基础理论
2.1 冯诺依曼架构的固有瓶颈
经典冯诺依曼计算机架构将计算单元与存储单元物理分离,总线作为数据传输通道。程序和数据预先存入存储器,控制器依次读取指令、读取数据,送入运算单元完成计算,再将结果写回存储器。这套架构适合通用可编程数值计算,支撑了数十年计算机产业发展,但在面向持续感知、在线学习的端侧智能任务时存在固有瓶颈。
第一,内存墙。运算单元运算速度持续提升,但存储器带宽与访问延迟提升缓慢。深度学习任务需要反复读写大量参数,数据搬运能耗远超计算能耗。端侧设备电池容量有限,持续运行场景下内存墙带来的功耗问题无法通过工艺简单解决。
第二,时钟驱动,持续能耗。传统数字电路依靠全局时钟同步,无论是否有有效输入数据,时钟电路持续翻转,产生静态与动态功耗。即使没有感知事件输入,硬件依然持续消耗能量,不适合长时间待机的端侧感知节点。
第三,存储与记忆分离。传统存储只是数据的静态存放,记忆不具备动态关联、自主遗忘、增量更新的生物特性。想要学习新信息,需要读取全部模型参数,参与更新计算,再写回,无法实现局部、稀疏的在线学习。
非冯诺依曼计算的核心思想,就是打破存储与计算的物理边界,采用事件驱动替代全局时钟,在存储单元内部完成计算。类脑神经形态计算是非冯架构最重要分支之一,以生物神经系统为参考,实现存算一体、事件触发、稀疏激活。
2.2 生物神经系统信息处理基础
生物神经系统的基础单元为神经元。神经元接收来自上游突触的输入信号,细胞膜电位持续累积,当膜电位超过激发阈值,神经元发放脉冲(动作电位),脉冲沿着轴突传递到下游神经元突触;脉冲到达突触后,释放神经递质,改变下游神经元膜电位。脉冲本身只代表事件发生,信息编码依靠脉冲发放时间、发放频率、脉冲时序相关性,而不是传统计算机的高精度数值。
突触是神经元之间的连接,具备可塑性,突触权重可以根据前后神经元脉冲发放时序发生改变,也就是 STDP(时序依赖突触可塑性)。当上游神经元脉冲先于下游脉冲到达,突触权重增强;反之权重减弱。STDP 是生物实现学习与记忆的底层机制。记忆不是集中存放在独立存储器,而是分布式编码在海量突触权重之中,计算和存储统一在突触阵列上。
生物大脑具备稀疏激活特性:绝大多数神经元在大部分时间保持静息,只有相关事件出现时,少量神经元发放脉冲,整体能耗极低。同时大脑区分短期记忆与长期记忆,短期记忆依靠膜电位动态变化,长期记忆依靠突触结构与权重的长期稳定改变,还存在主动遗忘机制,避免旧信息无限累积。类脑智能就是在硬件上复刻这套脉冲、突触可塑性、分布式存算、稀疏事件驱动机制。
2.3 脉冲神经网络基础理论
脉冲神经网络(SNN, Spiking Neural Network)是类脑智能的算法载体,区别于人工神经网络 ANN。ANN 传递浮点数,全层同步计算;SNN 传递脉冲事件,以脉冲的时间携带信息,神经元状态随时间连续演化,事件到达才更新状态,天然稀疏。
2.3.1 神经元动力学模型
本文采用 LIF(Leaky Integrate-and-Fire,泄漏积分发放)神经元作为基础模型。LIF 神经元模拟细胞膜充放电过程。输入脉冲到达,膜电位增加;没有脉冲输入时,膜电位随时间自然泄漏衰减。当膜电位超过阈值 Vth,神经元发放脉冲,之后膜电位重置到静息电位,进入不应期,短时间内无法再次激发。
LIF 神经元公式:
代表 t 时刻膜电位;
膜时间常数;
静息电位;
突触输入电流。当
,发放脉冲,V 重置。LIF 模型兼顾生物真实性和硬件可实现性,计算开销低,适合神经形态芯片电路实现。
2.3.2 脉冲编码方式
SNN 需要把传感器采集的连续模拟信号转换为脉冲序列,主流编码包含频率编码、时间编码。频率编码依靠单位时间脉冲发放频次表征信号强弱;时间编码依靠脉冲到达的绝对时间或者相对时序编码信息,在事件相机、动态视觉传感器 DVS 场景广泛使用。对于端侧持续感知场景,本文优先采用事件异步编码,传感器产生事件才输出脉冲,无变化时不产生脉冲,最大程度降低数据量与功耗。
2.3.3 突触可塑性与 STDP 学习规则
STDP 是脉冲神经网络在线增量学习核心。突触权重变化由突触前脉冲、突触后脉冲的时间差
决定。
,突触前脉冲先到,权重增加;
,突触后脉冲先发,权重减弱。STDP 实现无监督学习,系统不需要外部标注数据,能够在端侧感知过程中自主学习特征,适配持续感知场景。同时引入可塑性衰减机制,模拟生物遗忘,实现新旧记忆平衡,避免记忆过载。
2.4 神经形态芯片与非冯诺依曼计算体系定义
神经形态芯片,是基于神经动力学模型,用电路器件模拟神经元与突触阵列,实现脉冲信号传输、突触权重存储、局部计算的硬件芯片,属于原生非冯诺依曼硬件。其核心特征:
1. 事件驱动:无脉冲事件,电路保持低功耗静息状态,不需要全局时钟;
2. 存算一体:突触权重存储单元同时完成乘累加计算,不需要大规模数据搬运;
3. 并行分布式:海量神经元独立异步演化,不是指令串行执行;
4. 可塑性硬件化:突触阵列直接实现权重更新规则,支持片上在线学习。
需要区分两类硬件:一类是数字神经形态芯片,用数字电路模拟神经元;一类是模拟 / 混合信号神经形态芯片,使用阻变、相变存储器件作为突触,模拟膜电位连续变化。两种路线各有优劣,数字芯片稳定性强、抗器件漂移,模拟芯片功耗更低、集成密度更高。本研究原型系统采用数模混合架构,兼顾稳定性与低功耗目标。
非冯诺依曼原型系统,指以神经形态芯片为核心,不再以传统 CPU 作为计算核心,传感器直接接入脉冲编码前端,神经形态芯片完成特征提取、学习、记忆、推理,输出感知结果,整套系统不再依赖存储 - 计算分离的指令集计算范式,实现完全跳出传统通用计算框架。
第三章 神经形态芯片架构与底层电路设计
3.1 芯片整体架构目标
本芯片研发目标:面向端侧持续感知、长期记忆场景,低功耗,支持 LIF 神经元阵列、片上 STDP 学习、异步脉冲路由、突触权重存储,作为非冯诺依曼原型系统核心计算单元。
设计指标:神经元阵列规模、突触阵列容量、单脉冲操作功耗、膜电位时间常数可调、突触权重多电平存储,支持事件相机、环境传感信号接入,具备长期记忆权重保持模块。
芯片整体分为五大模块:脉冲输入编码接口模块、神经元阵列模块、突触存算阵列模块、异步脉冲路由网络、配置与读出模块。全部模块采用事件驱动,无脉冲事件时模块进入低功耗待机。
3.2 LIF 神经元电路设计
基于数模混合电路实现 LIF 神经元。采用电容模拟细胞膜,电流源模拟突触输入电流,漏电通路实现膜电位泄漏。比较器监测电容电压,电压超过阈值,生成脉冲输出信号,同时复位电容电压,设置不应期电路,在不应期内屏蔽输入信号,模拟生物神经元 refractory period。
神经元电路参数可配置:膜时间常数、激发阈值、静息电位、不应期时长。不同参数适配不同感知任务:快速响应任务使用小时间常数,长期记忆、慢时序感知任务使用大时间常数。神经元单元采用异步设计,每个神经元独立更新状态,不需要全局时钟同步,大幅降低动态功耗。
电路设计需要考虑非理想效应:晶体管噪声、器件参数失配、温度漂移。芯片设计阶段加入补偿电路,在原型系统测试中对神经元参数进行片上校准,减少器件差异带来网络性能退化。
3.3 突触存算阵列设计
突触阵列是芯片存算一体核心,突触单元同时存储权重,并且在脉冲到达时完成电流输出,实现乘累加操作。本原型芯片采用多电平存储单元,每个突触可以表征多级权重,支持 STDP 在线更新。
突触阵列采用交叉阵列(Crossbar)架构,横向为突触前脉冲输入,纵向连接神经元输入。脉冲到达字线,对应突触单元输出电流,同一列所有突触电流在神经元输入端汇聚,完成并行求和。交叉阵列天然并行,一次脉冲事件完成整列突触的累加,不需要逐个读取权重。
权重存储分为短期动态权重和长期固化权重两部分。短期权重保存在模拟存储单元,快速响应学习;长期记忆模块将关键突触权重定期固化到非易失存储单元,抑制权重随时间漂移,解决长期记忆衰减问题,支撑端侧数月尺度的记忆保存。
3.4 异步脉冲路由网络
神经元产生脉冲之后,需要传递到下游突触阵列。传统总线是同步、全局的,不适合海量异步脉冲。本芯片采用异步片上路由网络,脉冲作为数据包,携带源地址、目标地址,异步传输。只有产生脉冲时,路由节点才激活,没有脉冲传输时路由单元保持低功耗。路由网络支持稀疏脉冲事件传输,避免全局通信功耗。路由网络具备冲突仲裁机制,处理多个脉冲同时到达同一节点的竞争,保障脉冲时序不被打乱,维持 SNN 时序编码的有效性。
3.5 输入编码接口与读出模块
输入编码接口负责把外部传感器的连续模拟信号或者 DVS 事件信号,转换为芯片内部脉冲序列。支持两种输入模式:模拟电压信号转为频率编码脉冲;DVS 事件流直接生成异步脉冲,减少预处理开销,实现传感器与类脑芯片直连,绕过传统 ADC + 主控预处理流程,进一步降低系统功耗。
读出模块采集神经元脉冲输出序列,将脉冲事件读出,用于感知结果输出、网络状态监测。读出模块同样事件驱动,仅在神经元发放脉冲时记录事件,不持续采样。
3.6 芯片功耗分析与约束
神经形态芯片功耗分为静态功耗和动态功耗。静态功耗是电路待机泄漏功耗;动态功耗仅在脉冲激发、突触权重更新时产生。因为稀疏事件驱动,绝大多数单元长期处于静息,整体功耗远低于同等规模传统 NPU。
功耗约束来自几个方面:突触阵列更新功耗、脉冲路由通信功耗、神经元比较器翻转功耗。为适配端侧电池供电场景,电路层面优化晶体管尺寸,降低漏电;算法层面控制脉冲发放稀疏度,减少脉冲数量,从硬件和算法两端协同降低总能耗。
第四章 脉冲神经网络建模、学习规则与长期记忆机制
4.1 面向持续感知的 SNN 网络拓扑
针对端侧持续感知任务,构建多层脉冲神经网络。第一层为编码层,接收传感器事件脉冲;中间特征提取层,使用 LIF 神经元,依靠 STDP 无监督学习,自动提取环境时空特征;记忆层,负责存储长期时序关联;输出层,完成事件分类、异常检测。
网络采用稀疏连接,不是全连接。生物大脑连接是稀疏的,稀疏连接减少突触数量,降低芯片硬件开销,抑制冗余连接带来噪声。网络支持增量学习,系统部署之后,不需要离线重训练,在持续感知过程中,新的事件输入,局部突触权重更新,学习新特征,旧记忆根据可塑性衰减缓慢弱化,不会出现灾难性遗忘。
4.2 STDDP 在线学习规则硬件适配
软件仿真的 STDP 公式是连续函数,但神经形态硬件的突触单元只支持离散权重等级,同时存在器件噪声、写误差。直接照搬理论 STDP 会造成学习效果下降。本文对 STDP 规则做硬件适配,量化权重更新步长,加入更新噪声抑制策略,设计片上学习控制器,根据前后脉冲时序,生成对应突触权重增减信号,直接驱动突触阵列完成权重修改,学习过程在芯片内部完成,不需要外部主控读取权重。
学习模式可切换:无监督 STDP 学习模式、固定权重推理模式。当系统完成特征学习,可冻结部分突触权重,进入低功耗推理模式,不再更新权重,进一步降低功耗,保护已经形成的长期记忆。
4.3 端侧长期记忆实现机制
传统 SNN 大多研究短期时序记忆,在端侧持续感知场景,需要系统保留数周乃至数月感知信息。本文采用分层记忆机制,区分短时记忆与长时记忆。
短时记忆:神经元膜电位动态状态,记录近期时序事件,随泄漏自然衰减;
长时记忆:筛选高重要性突触连接,定期将权重固化到非易失存储阵列。系统内置记忆评估机制,高频重复出现的事件对应的突触连接判定为重要,固化保存;低频、一次性事件对应的突触,随遗忘规则缓慢衰减。
引入可控遗忘机制,模拟生物主动遗忘。遗忘不是简单擦除,而是突触权重缓慢衰减,旧记忆缓慢弱化,给新特征留出学习空间,解决持续在线学习的灾难性遗忘问题。记忆模块可以在低功耗状态下维持权重,系统休眠唤醒之后,记忆信息不会丢失,适配端侧设备间歇供电、长期待机场景。
4.4 事件驱动持续感知任务建模
以动态视觉传感器 DVS 作为典型端侧感知输入。DVS 不输出固定帧率图像,只在像素亮度发生变化时输出事件(坐标、极性、时间),天然和脉冲神经网络事件驱动范式匹配。DVS 输出事件直接编码为脉冲送入神经形态芯片,网络持续提取运动轮廓、物体时序特征,识别目标、检测异常。整个过程不需要采集完整帧图像,数据量大幅下降,延迟更低,功耗显著优于基于帧图像的传统 AI 方案。
除视觉感知外,模型适配多模态传感输入,声音、振动、温湿度等连续传感信号,通过脉冲编码送入网络,实现多模态持续感知。
第五章 非冯诺依曼计算原型系统集成与软硬件工具链
5.1 原型系统整体架构
本原型系统以自研神经形态芯片作为核心计算单元,摒弃传统 CPU 作为主计算核心,搭建原生非冯诺依曼系统。系统组件包含:事件型传感器阵列、脉冲编码前端、神经形态芯片、长期记忆存储单元、脉冲读出接口、低功耗电源管理模块。
信息流路径:环境变化触发传感器产生事件→前端电路转换为异步脉冲序列→送入神经形态芯片突触阵列→LIF 神经元阵列完成特征提取、片上 STDP 学习、记忆编码→神经元脉冲输出代表感知推理结果,直接输出告警、识别结果。整套信息流没有传统帧缓存、没有海量参数搬运,计算发生在突触阵列内部。
系统保留极简辅助控制单元,仅负责芯片配置、电源管理、测试数据导出,不参与智能推理与学习计算,辅助单元不主导系统信息处理,保证核心计算框架为非冯架构。原型系统设计为模块化,传感器模块可替换,支持视觉、声学、环境传感多场景快速适配,方便不同端侧感知试验。
5.2 硬件集成与 PCB 设计
原型硬件 PCB 分为模拟区域与数字区域,严格分区布局,降低数字信号噪声对神经元模拟电路的干扰。电源管理模块提供多档位低功耗供电,支持动态电源门控,当神经形态芯片长时间无脉冲输入时,自动降低电压,进入休眠模式,维持长期记忆权重,等待新事件唤醒。
硬件设计预留测试探针接口,可以观测神经元膜电位、脉冲时序、突触权重,方便试验阶段采集硬件底层信号,分析器件非理想特性对网络的影响。原型板支持外接电池供电,模拟真实端侧设备离线长期运行场景。
5.3 类脑软硬件协同工具链开发
传统深度学习框架面向 ANN,不适合脉冲神经网络和神经形态硬件。本项目配套开发软硬件协同工具链,支撑原型系统开发调试,工具链包含几个部分:
1. SNN 建模仿真模块:在计算机上搭建 LIF 神经元网络,仿真脉冲时序、STDP 学习过程,预先验证网络拓扑,生成网络配置参数;
2. 硬件映射编译器:将仿真好的脉冲网络映射到神经形态芯片神经元阵列、突触交叉阵列,分配神经元地址、突触连接,自动处理硬件资源约束;
3. 在线调试工具:读取芯片脉冲事件、神经元状态,可视化脉冲发放时序,定位硬件噪声、网络学习异常;
4. 任务配置工具:切换学习 / 推理模式,配置神经元参数、记忆固化阈值、遗忘速率。
工具链实现 “仿真 - 映射 - 硬件部署 - 回测” 闭环。软件仿真阶段就带入硬件器件噪声、权重离散误差模型,提前预判硬件上网络精度损失,避免算法在仿真有效、流片之后失效,实现算法与硬件协同设计。
5.4 系统运行模式
原型系统支持三种运行模式:
(1)在线学习模式:传感器持续输入事件,芯片 STDP 规则更新突触,增量学习新特征,同步筛选重要突触固化到长期记忆;
(2)纯推理模式:冻结突触权重,不再更新,仅做脉冲前向推理,功耗最低;
(3)休眠保持模式:降低芯片主供电,仅维持长期记忆存储单元供电,保留记忆,等待事件唤醒。
三种模式可以根据感知事件密度自动切换,事件多的时候开启学习;事件稀少进入推理;长时间无事件进入休眠,最大化延长端侧设备续航时间。
第六章 原型系统试验验证与结果分析
6.1 试验目标与测试指标
试验目标:验证基于神经形态芯片、脉冲神经网络的非冯诺依曼原型系统,在端侧持续感知任务的功能、功耗、时序响应、长期记忆保持能力,验证下一代低功耗 AI 硬件范式可行性。
测试指标分为四类:功能指标、功耗指标、时序指标、记忆指标。
功能指标:事件目标识别准确率、异常事件检出率;
功耗指标:静态待机功耗、单次事件推理功耗、在线学习模式平均功耗;
时序指标:事件输入到脉冲输出响应延迟;
记忆指标:记忆保持时长,新事件学习后旧记忆保留程度,灾难性遗忘程度。
6.2 测试场景设计
搭建两组典型端侧持续感知场景。
场景一:动态视觉事件感知。DVS 事件相机采集场景运动目标,原型系统持续学习目标轮廓特征,识别移动物体,检测异常闯入。系统连续长时间运行,不断接收新事件,在线学习新目标,验证持续感知与长期记忆。
场景二:多模态环境感知。振动、温度、声学传感器产生事件流,监测环境状态,识别异常工况,模拟工业端侧传感节点。
对照组设置:使用传统低功耗 MCU 搭载轻量化 CNN 模型,使用同样传感器输入,对比功耗、延迟、持续运行能力。对照组采用传统帧式采集,冯诺依曼架构。
6.3 试验测试流程
第一步,系统校准:上电后,工具链对神经元阵列参数做片上校准,补偿晶体管失配,统一神经元阈值与时间常数。
第二步,网络部署:将预定义脉冲网络通过编译器映射到神经形态芯片,初始化突触权重。
第三步,在线学习试验:输入连续事件流,开启 STDP 学习,系统自主学习场景特征,记录脉冲发放、权重变化。
第四步,长期记忆测试:学习完成,系统进入低功耗休眠,间隔一段时间唤醒,测试原有特征识别能力,评估记忆衰减。
第五步,性能对比,记录各项指标,分析误差来源。
6.4 试验结果分析
从试验结果看,原型系统可以完成事件驱动端侧持续感知任务,能够在线无监督学习时空特征,在事件稀疏场景下,功耗显著低于同等识别能力的传统 MCU+CNN 方案。系统仅在事件发生时产生脉冲相关能耗,无事件时段待机功耗极低,适合长期电池供电。
系统事件响应延迟为微秒级别,远低于帧式 AI 方案,不需要等待完整图像帧采集,适合快速动态事件检测。长期记忆模块可以保存核心突触权重,休眠唤醒之后,原有特征识别能力保持稳定;在持续学习新特征过程中,旧记忆缓慢衰减,没有出现快速灾难性遗忘。
试验同时发现原型系统现存限制:突触阵列规模有限,复杂多类别任务识别精度低于大型离线 ANN;模拟突触单元存在器件漂移,长时间运行下,需要周期性轻量校准;脉冲路由网络在高密度脉冲并发时存在少量脉冲冲突丢失。这些问题是下一代芯片迭代重点优化方向。
分析误差来源:晶体管噪声、突触权重多级存储量化误差、脉冲传输冲突、LIF 神经元模型简化带来生物细节缺失。测试证明,这套非冯诺依曼架构的技术路线成立,在端侧低功耗持续感知场景具备独特优势,验证了下一代低功耗 AI 硬件范式的可行性。
第七章 技术挑战与未来演进路径
7.1 当前核心技术挑战
第一,器件非理想特性。模拟突触器件存在漂移、噪声、读写非对称,会扭曲 STDP 学习过程,降低网络稳定性。器件层面的缺陷无法完全通过算法消除,需要器件、电路、算法联合协同优化。
第二,网络规模扩展难题。神经形态芯片神经元和突触数量提升,会带来路由拥塞、功耗、面积成本上升。如何在有限芯片面积下扩展神经元阵列,同时维持事件驱动低功耗,是规模化难点。
第三,类脑软件生态薄弱。脉冲神经网络数据集、模型、开发框架远不如 ANN 成熟,缺少标准化开发工具,算法迁移成本高,限制应用落地。
第四,长期记忆的平衡。记忆固化、遗忘、存储开销三者权衡。无限保存所有事件会占用过多存储资源;遗忘过快丢失重要历史信息;遗忘太慢会累积冗余信息,影响新特征学习。记忆机制的动态调控是持续感知场景长期课题。
第五,可靠性与工业级适配。原型芯片在实验室条件验证有效,在宽温度、振动、电磁干扰工业环境下,神经元电路稳定性需要进一步验证。
7.2 未来演进路线
短期:迭代神经形态芯片,扩大神经元与突触阵列规模,优化突触器件抑制漂移,完善软硬件工具链,在更多端侧感知场景做原型部署,优化长期记忆调控算法,完善系统校准方案。
中期:多芯片互联,搭建大规模类脑集群,探索脉冲网络跨芯片异步通信,拓展复杂时序任务能力;开发标准化 SNN 模型库,完善类脑软件生态,推动和事件传感器一体化集成,做成一体化端侧感知芯片模组。
长期:进一步融合生物神经机制,引入更加复杂神经元动力学模型,多层级记忆调控,构建完全脱离传统通用计算框架的类脑智能硬件体系,在分布式物联网节点、自主微型机器人、穿戴式健康感知等场景规模化落地,形成新一代 AI 硬件产业范式。
同时,需要厘清类脑智能定位,类脑神经形态硬件不是用来替代 GPU 等传统通用算力,而是差异化硬件,专门面向事件驱动、低功耗、长待机、端侧在线学习场景,二者互补共存。
7.3 应用场景拓展展望
这套非冯诺依曼类脑系统的落地场景集中在长期无人值守端侧感知节点。工业设备异常振动监测、野外环境监测、安防事件检测、可穿戴生理信号监测、小型自主机器人环境感知。这类场景的共同特征:需要常年电池供电,事件稀疏,重点检测动态变化,需要记住历史时序信息,不需要持续高速高精度数值计算,完美匹配神经形态芯片事件驱动、低功耗、分布式记忆的优势。
第八章 总结
本文跳出传统通用计算框架,系统开展低功耗类脑神经形态芯片、脉冲神经网络、非冯诺依曼计算原型系统一体化研发。梳理类脑与非冯诺依曼计算理论,完成 LIF 神经元电路、突触交叉存算阵列、异步脉冲路由的芯片架构设计;构建适配硬件的脉冲神经网络,基于 STDP 实现片上在线增量学习,设计分层短时 / 长期记忆机制,面向端侧持续感知场景;完成原生非冯诺依曼原型系统硬件集成,开发软硬件协同映射工具链;搭建多组端侧感知试验场景,完成原型系统测试验证。
研究结论:基于神经形态芯片与脉冲神经网络构建的非冯诺依曼计算原型系统,可以实现事件驱动信息处理,具备片上无监督增量学习、长期记忆保持能力,在稀疏事件感知场景拥有突出低功耗优势,验证了下一代低功耗端侧 AI 硬件范式的技术可行性。
研究同时识别当前原型系统的局限,包括阵列规模、器件漂移、脉冲路由冲突、软件生态不足等。后续将围绕器件 - 电路 - 算法 - 系统协同迭代,扩大网络规模,提升硬件稳定性,完善类脑开发工具链,拓展多模态端侧感知场景验证,持续推进非冯诺依曼类脑硬件体系发展,为下一代人工智能硬件探索新路径。
数据来源
1. 原型系统硬件测试原始数据:淞基科技(上海)有限公司,淞基信息通讯研究院内部流片原型板试验采集数据集;
2. 脉冲神经网络仿真数据:淞基未来信息网研究部、淞基新一代信息技术网研究部基于自研 SNN 仿真平台生成的网络仿真结果;
3. 基础理论参考资料:国内外公开类脑智能、神经形态芯片、脉冲神经网络领域学术期刊论文、会议文献、项目公开技术报告;
4. 对照实验数据:同场景传统端侧 AI 方案公开参数与本项目对照实测数据。
免责声明
本文为淞基科技(上海)有限公司、淞基信息通讯研究院、淞基未来信息网研究部、淞基新一代信息技术网研究部内部研究论文,仅用于学术研究、技术研讨,不构成任何产品承诺、商业报价、性能保证或产业化落地承诺。文中原型系统相关性能指标均基于实验室原型环境测试所得,实际工业环境、不同工况下系统性能会受温度、电磁干扰、器件老化、输入信号条件影响产生差异。文中所提出技术方案、架构设计、仿真结果,不代表产品最终规格。本文引用第三方公开文献仅作理论参考,第三方资料的真实性、准确性由原作者负责。未经本单位书面许可,本文内容不得擅自修改、摘录用于商业宣传、产品推介。
上一篇:工业互联网平台、柔性产线与工业智能大模型的深度落地研究
下一篇:没有了




