从单项测试到综合评价,行业首个智能体安全指数ASI亮相

ASI 将进一步连接不同评测成果,并邀请安全机构、科研团队和开发者参与共建,逐步形成开放、可复核、持续更新的行业安全参考。

2026国家网络安全宣传周期间,智能体安全领域出现了一个新的综合评估参考——智能体安全指数(ASI)。该指数由蚂蚁AI安全实验室与清华大学团队推进,但更值得关注的是,它试图把多项安全评测按业务场景和风险类型重新组织,帮助企业同时看到 AI 的整体安全表现和具体风险。

项目团队提供的一组测试显示,同样的模型,在桌面端有害行为单项benchmark测试中安全表现排名前列,在桌面端隐蔽执行风险测试中却排在后位。按 ASI 本轮综合评估口径,其在桌面场景的安全表现位居第二,环境注入方面的短板也被保留下来。

这一案例说明,单项测试反映的是模型在特定条件下的表现,任何一项排名都不足以支持整体判断。随着智能体开始访问企业数据、操作文件和调用工具,企业需要了解它总体表现如何,也需要知道它在哪些任务上容易出问题。

如果把不同安全评测比作血压、血脂等单项检查,ASI的作用就是将这些检查组织起来,结合具体使用场景进行综合分析。单项检查帮助发现特定问题,综合分析则帮助使用者理解这些问题对实际应用的影响。

为避免不同测试口径造成误读,ASI将深入到具体任务和执行过程,依据明确的评价规则,按业务场景和风险类型重新组织评测证据。企业既能查看综合结果,也能追溯某项短板来自什么测试、发生在哪个操作环节,让模型比较和风险判断更有依据。

这种方式也让已有评测成果获得更多用途。针对同一批测试证据,企业可以按自身需求重点查看敏感信息保护、工具使用或高风险操作等表现,并接入自身业务测试。在此基础上,企业可进一步验证增加审批、收紧权限或部署安全防护后,风险是否降低,正常任务能否继续完成。

目前,项目正围绕32项安全评测基准、8类智能体场景推进复现与整合。通过积累可重复使用的测试环境和结果,ASI 希望降低各机构重复验证的成本,让更多安全研究成果用于实际业务决策。

针对模型和风险的快速变化,ASI 将持续纳入新测试、新模型和新场景,并记录版本及运行条件,帮助使用者追溯结果、理解变化。

此前,蚂蚁已联合高校推出 Agent3σ 等智能体安全评测项目。ASI 将进一步连接不同评测成果,并邀请安全机构、科研团队和开发者参与共建,逐步形成开放、可复核、持续更新的行业安全参考。


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信