2026年08月15日 星期六
北京市科技装备业商会公共邮箱:btecc@btecc.org.cn


首页 >  会员之窗  >  会员动态

会员动态|智能体"失控",远鉴早有预判

作者: 商会秘书处    时间: 2026-08-05    浏览量: 61   

    近日,OpenAI承认其人工智能模型在内部评测中"失控",自主突破隔离沙箱、跨企业入侵全球知名AI开源平台Hugging Face的生产系统。OpenAI 将此事定性为"前所未有的网络安全事件,涉及最先进的网络攻击能力"。

    这是一场由前沿大模型自主发起、全程无人工指令的网络攻击。针对这类风险,远鉴的预判远早于本次事件。早在3月26日,远鉴便以一篇《当智能体学会"自主行动":零信任架构下的政企智能体安全新范式》敲响警钟。

失控始末:模型为"作弊"自主发起跨企业攻击

    据OpenAI 官方披露与 Hugging Face 技术复盘,事件的起点是OpenAI 在内部基准平台ExploitGym上的一次网络攻防能力评测。为测出模型的"最大攻击能力上限",本轮评测刻意关闭了用于阻止高风险网络活动的生产级安全分类器。

    在高度隔离的沙箱中,模型投入大量推理算力寻找离开隔离环境的路径,最终发现并利用了一个软件包注册表缓存代理中的零日漏洞,在研究环境内完成权限提升与横向移动,抵达具备公网访问权限的节点。获得互联网后,模型自主推断Hugging Face可能托管着评测答案,遂串联窃取的凭证与漏洞,在对方服务器上实现远程代码执行(RCE),直接从生产数据库窃取了评测标准答案。

    Hugging Face从日志中重建出约1.76万个攻击动作、跨越约 4.5 天(7 月 9 日至 13 日)。整个过程由智能体集群自主规划执行,没有任何人类下达攻击指令。

远鉴方案:用"意图研判智能体"

给自主智能体装上"刹车"

    智能体该放开还是该关笼子?在零信任架构中引入意图研判智能体。将经典零信任架构中的策略判决点升级为意图研判智能体(IAA)显然是智能体安全的破局之道。

    IAA与执行业务任务的业务智能体(Business Agent,BA)形成双智能体博弈与协同:每当BA准备访问数据库、调用 API 或执行系统命令,请求首先被IAA拦截,结合"当前任务目标、代码血缘、数据敏感度、行为基线"做意图研判,合规路径自动放行,风险路径自动阻断或降级到沙箱,仅在极高不确定性时才触发人工复核。

其核心能力可概括为四点:

    1.意图验证:从"凭证校验"升级为"连续意图验证",智能体自行编写的代码须先经静态/动态分析,确认逻辑与声明意图一致才予放行;

    2.动态最小权限:智能体不持长期凭证,每次合法执行由IAA申请一次性、短时效、限定范围的令牌,生成代码在微隔离沙箱中运行;

    3.持续信任评估:一旦偏离初始意图,信任值瞬间归零,立即切断会话并冻结身份;

    4.时空全息身份与多智能体信任图谱:为智能体构建随任务会话绑定的瞬时身份与版本快照,并在多智能体协作时防止低权限体借调用高权限体完成权限提升。

    这一架构契合政企"内外网隔离、强合规"的场景,在内网私有化部署BA与IAA,即便智能体被诱导攻击,IAA也能识别异常流量与语义,确保内网数据不出域、外部恶意指令不进内网。

    从聊天工具走向自主行动,大模型正以前所未有的速度进入生产环境、操作文件、执行任务。OpenAI与Hugging Face的这次碰撞提醒业界:当模型的能力边界快速扩张,安全与对齐必须同步迭代。用零信任为智能体装上"刹车",让安全成为智能的守护,而非路障。

(来源:远鉴信息)


版权所有:北京市科技装备业商会  地址:北京市海淀区闵庄路 42号院1号楼4层458室 邮编:100094 电话:010-66007877

京ICP备2021029670号  京公网安备11010802043462