在人工智能、云计算和高端计算加速落地的今天,算力密度持续攀升,服务器内部的处理器核心、内存通道和高速IO设备愈发复杂。性能狂飙的背后,节点稳定运行正面临严苛考验:一次内存异常、一条PCIe 链路波动,甚至单颗处理器核心故障,都可能引发性能骤降、业务中断,乃至整个集群的震荡。当算力成为核心生产力,需要的不再仅仅是“跑得更快的机器”,更是能够在故障发生后快速发现、精准定位并及时恢复,将故障影响控制在局部、保障业务持续在线的可靠算力底座。
为此,海光信息基于CPU原生RAS能力(RAS 是服务器和高端计算领域的专业术语,特指Reliability、Availability and Serviceability,即可靠性、可用性和可服务性),联动操作系统与硬件,构建BIOS与BMC的系统级协同机制, RAS不再是分散的单项功能,而是一套贯通故障检测、风险预警、资源隔离、恢复处置、故障取证和远程运维的闭环体系。

可靠性:让错误止于局部,从源头守住稳定运行
服务器的可靠性,并不意味着硬件永远不会出现异常,而是能够在错误萌芽阶段及时发现、准确判断,并将影响控制在最小范围内。海光BIOS基于处理器原生错误检测机制和资源拓扑信息,对底层异常进行统一识别、关联与分析,使故障处理从“严重错误发生后再处置”,前移到“风险持续恶劣演化前干预”。
围绕计算、存储与高速互联等关键数据路径,海光BIOS构建了多层次的数据保护与容错能力。处理器缓存可实现单bit纠正、双bit检测,部分关键缓存进一步提升至双bit纠正、三bit检测;内存侧的保护范围则从bit级进一步延伸至DRAM颗粒级和Row级容错。通过不同层级的纠错、容错与隔离机制,尽可能在底层消化异常,保证错误发生时数据仍然正确,并降低故障向业务层扩散的风险。
这些底层能力进一步与海光整机系统级故障管理机制协同,将分散在处理器、内存和IO等部件中的异常统一关联和处置。海光BIOS关注的不只是“是否检测到错误”,更是错误能否被及时纠正、故障能否被限制在局部,以及系统在局部硬件异常情况下能否继续稳定运行。

这些能力带来的直接价值,是将故障管理从“被动响应”前移到“主动预防”,在错误尚未影响业务之前识别风险并降低演变概率。通过硬件检测与BIOS决策协同,海光BIOS将可靠性前移到故障发生和扩散之前,持续延长系统正确运行时间,为客户提升节点稳定性和长期运行质量。
可用性:故障已经发生,关键业务仍可继续
对核心业务而言,难以接受的往往不是硬件损坏,而是业务停摆。可用性的核心,是在故障发生时保留正常资源,将“整机停机”转化为“局部降级”。
海光BIOS围绕计算、内存和IO构建多层次故障恢复机制,并将故障处置从“整机停机”压缩至核心级隔离以及设备/链路级局部降级。处理器单个故障核心退出后,其余正常核心仍可继续承担业务;内存通过在线恢复、风险地址隔离和重启后的持久屏蔽,使故障地址持续退出业务路径,避免同一故障反复影响系统;PCIe设备或链路异常时,可通过 eDPC 隔离、链路重训练和设备复位等机制实现秒级局部恢复,将原本可能引发整机停机的故障影响收敛至单个设备或局部链路。
这些能力不以单项功能独立运行,而是由BIOS统一组织并与BMC、操作系统协同处置。对客户而言,其价值是把“单点故障导致整机退出”转变为“故障资源退出、正常资源继续服务”,减少非计划停机,为业务迁移和计划性维护争取窗口,让算力平台在复杂故障面前依然具备韧性。

可服务性:从复杂底层日志,走向可执行的运维结论
记录故障只是开始,看懂并解决才是关键。底层寄存器与状态位犹如“天书”,尤其在黑屏宕机、OS无法进入时,传统方式往往需要拆机盲查,平均修复时间(MTTR)居高不下。
在此场景下,BMC化身为“黑匣子”,主动识别异常、留存崩溃现场关键数据;而BIOS则扮演了“翻译官”,通过一体化故障编码将底层错误统一映射为EventID,直接关联故障说明与处理建议。配合BMC的SmartHDT远程诊断,运维人员无需下架服务器或携带专用设备,即可远程一键收集CPU、DIMM、PCIe等全量RAS日志。故障定位从“查寄存器”进化为“按图索骥”,从现场排查升级为远程协同,大幅降低运维门槛。
针对黑屏宕机等复杂故障场景,海光BIOS通过黑屏主动分析机制,在故障发生后快速留存关键现场信息,一旦捕获异常,黑屏宕机组件能在1分钟内自动完成硅片级全量数据抓取,大幅度提升研发人员对单个问题的现场信息收集与故障初步定位时间,显著减少人工日志整理和现场排查工作,加快问题闭环。
信息汇聚方面,海光BIOS可一键收集并下载CPU、DIMM、PCIe等RAS日志,以及资产信息、设备资源、PORT80和SOL等数据,为研发、售后和运维提供统一分析输入。配合SEL、Web页面和远程告警机制,故障处理形成,从主动发现、统一表达,到远程诊断和处置建议,让每一次故障都能被看见、被理解、被处理。故障定位从依赖个人经验转向体系化分析,服务方式从现场排查转向远程协同,帮助客户缩短平均修复时间。
RAS实现的底层支撑:原生架构理解与全栈协同
可靠性、可用性、可服务性三大维度对应的故障检测纠正、局部恢复、远程诊断能力,并非各项独立功能的简单堆砌。RAS能力能否真正发挥作用,关键在于BIOS能否准确理解硬件错误、掌握资源拓扑,并让硬件、固件、操作系统和带外管理形成统一的故障处理体系。
海光BIOS基于CPU原生RAS架构开展软硬件协同设计,对处理器核心及缓存、内存及内存控制器、PCIe/CXL和片间互联等关键资源建立统一故障认知。硬件负责及时检测异常,BIOS结合错误类型、资源拓扑和系统状态判断故障影响并制定处置策略,操作系统执行资源隔离和恢复,BMC则在主机OS无法正常工作的情况下继续完成现场保存、告警和远程诊断。
因此,海光RAS不仅能够回答“是否发生错误”,还能够进一步判断“错误在哪里、影响哪些资源、能否继续运行、应该如何恢复以及后续如何维护”,从而形成从故障发现、判断、隔离、恢复到服务的完整闭环。其核心优势可以概括为四点:
更懂系统,基于海光CPU原生能力实现精准故障判断;
更早干预,将故障管理从宕机后处置前移到风险识别和隔离;
更强协同,打通检测、上报、恢复和运维链路;
更易服务,以统一编码、主动崩溃分析和远程诊断降低故障定位门槛
从故障核心隔离、内存故障预测与恢复,到PCIe链路自恢复、SmartHDT和一体化故障编码等RAS功能,海光BIOS将原本分散在不同部件、不同层级的RAS能力汇聚为一套面向业务连续性的系统方案。它不仅关注“能否发现一个错误”,更关注“错误是否扩散、业务是否在线、问题能否快速解决”。
在算力即生产力的今天,RAS已不再是性能的附加项,而是算力持续释放的前提。作为光合组织重点打造的生态成果,海光BIOS以固件为基、以协同为要,正推动服务器从“被动挨打”迈向“主动防御”,为千行百业构建起高可靠、可持续、易运维的坚实算力底座。
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表