随着 AI 工厂逐渐成为企业训练、微调和部署智能体应用的核心基础设施,安全问题也不再局限于传统服务器和软件边界,而是开始覆盖模型、数据、运行时、供应链以及具备越来越高自主权限的 agent 本身。NVIDIA 在这篇文章中提出的核心观点是:面向 agentic AI 的基础设施安全,不能只靠主机侧软件补丁式叠加,而需要把关键防护能力直接下沉到基础设施层。
文章重点介绍了基于 NVIDIA BlueField DPU 与 DOCA 软件栈构建的 in-silicon security 方案。与传统依赖主机系统的软件安全机制不同,BlueField 在独立可信执行域中运行,把监控、策略执行和遥测采集从宿主工作负载中隔离出来。即使主机系统或应用本身被攻破,这些安全功能仍能持续工作,不会被轻易绕过或篡改。对于承载训练、推理和多智能体协作的 AI 工厂来说,这种“安全不与业务同生同死”的设计尤其关键。
在能力层面,NVIDIA 将 DOCA 安全栈分为几个核心组件。DOCA Argus 负责运行时威胁检测,通过直接访问主机内存并结合行为策略分析,在不中断 AI 工作负载的前提下,识别异常进程、运行时漂移、可疑 shell 行为和其他 compromise 指标;DOCA Vault 面向文件型 AI 存储,提供零信任的数据访问控制,确保只有被授权的训练任务、推理服务或 agent 进程,才能以允许的方式访问指定数据;DOCA Flow 则在网络层提供高速策略执行能力,把防火墙、流量过滤和分段控制推进到 BlueField 硬件侧。
文章披露,这套架构可把部分运行时威胁检测速度提升到软件式无 agent 方案的 1000 倍级别,并支持最高 800 Gb/s 的网络与文件访问策略执行能力。更重要的是,它不是零散组件拼装,而是尝试为整个 AI 生命周期提供一致的安全底座:从模型、上下文记忆、训练数据集,到运行中的 agent 行为,都纳入统一的硬件加速安全框架中。这使得 AI 工厂的安全治理,不再只是外围防护,而成为和算力、网络、存储同等级的系统能力。
在 agentic AI 场景下,这种设计的现实意义尤其突出。文章指出,随着自治型 agent 在推理、训练乃至生产流程中获得更高权限,它们本身也会成为新的攻击面。BlueField + DOCA 的目标,正是让安全控制独立于这些 agent 所在的执行环境,并通过持续遥测、行为校验和实时策略收敛,把潜在横向扩散、数据外泄或未授权访问限制在更底层、更硬件化的边界内。
对企业和云端 AI 基础设施建设者而言,DOCA In-Silicon Security 传递出的信息很明确:未来 AI 工厂的竞争,不仅是 GPU 更强、互连更快,还包括谁能把安全能力做成可扩展、不中断性能、能够随 agent 规模增长而同步放大的基础设施组件。随着 AI 工作负载越来越持续、越来越自治,把安全嵌入 BlueField 这类基础设施层,正在成为比传统主机侧防护更适合下一代 AI 平台的方向。
WeChat
Profile