工业机械产生的告警数量,远超技术人员能够逐条分诊的能力。对于每一条需要跟进的告警,技术人员都要翻出历史上下文、确定正确的处置规程、检查专项信号是否印证该故障模式,最后撰写一份建议。NVIDIA 指出,这一过程具有高度一致性,非常适合交给 AI 智能体完成。
NVIDIA 介绍了一个用 NVIDIA NeMo 库构建、以 NVIDIA Nemotron 开放模型提供智能、并运行在 NVIDIA OpenShell 安全运行时中的逐条告警分析智能体。给定一条告警及其传感器数据帧,该智能体会汇聚上下文(历史记录、手册、相似历史案例)、执行专项检查(例如使用 NVIDIA nv-tesseract 做异常检测指标分析、用 NeMo Retriever 对扫描版手册做 OCR),并输出一份结构化证据包:观察、根因假设、补救措施与推荐动作。
该智能体端到端由 GPU 加速,并且隐藏在一个 HTTP 端点之后,上游任何组件——无论是流内过滤器还是操作界面上的一个点击按钮——都以同样方式调用它。NVIDIA 强调,工具与模型大脑同等重要。
从机器互联的趋势看,从汽车、火车到电梯与工业电机,互联程度不断提升,服务人员与工程团队需要处理的数据量持续增加。与此同时,技术人员还必须从 SCADA 或 IoT 系统不断推送的信息中筛选出真正重要的信号:往往每小时有数百条告警、数千条传感器读数,以及格式各异、说明该如何处置的文档。
以一条告警为例,技术人员通常必须跨多个数据源、工具与文档来回答几个问题:该资产或该类别此前是否触发过这条告警?当时做了什么、什么措施解决了问题?针对这个错误码、这座工厂和这个位置,具体手册要求怎么做?信号是真实的吗——对于一条泛泛的高温告警,它是异常还是趋势的一部分,当时是否有维护作业正在进行?回答完这些问题之后,技术人员还必须撰写建议(通常是一张工单),以便他人据此行动并从中学到经验。
NVIDIA 认为,这整体上是一项投入密集型工作,需要广泛经验以及同多种系统交互的能力;而一个能够处理这些通用步骤的助手可以显著加速该过程。过滤相关信号、汇聚相关知识并起草可复用的建议,可以释放时间,让人员专注于更复杂的问题并更快处理其他待办事件。
在实现上,当人员请求某条告警的上下文时,智能体会连接不同系统汇聚知识,必要时调用专项工具做深度分析,最终起草一份可执行的动作,整个过程运行在沙箱之内。它的输入是一条告警负载(含传感器数据帧与资产元数据),输出是一份证据包(观察、根因假设、补救措施、推荐动作)以及支撑性轨迹,延迟预算是秒级而非分钟级——因为操作员正等着这一行状态变绿,每一步都必须尽可能快。
为完成这项工作,智能体需要三样东西:做什么的指令、由 NVIDIA Nemotron 开放模型提供的推理能力,以及用于与其他系统交互的编排工具。指令是一批告警加上表述智能体目标的提示词,发送给 Nemotron——一个开放权重、开放训练数据与配方、面向构建专用 AI 智能体而设计的模型家族。具体而言,该助手使用 Nemotron 3 Nano 处理简单的编排任务、使用 Nemotron 3 Super 处理复杂推理;这些模型以优化后的 NIM 容器形式部署在靠近产线处以实现低延迟推理,或部署在云端。
WeChat
Profile