本发明涉及工业工厂中的监控和故障诊断,其中操作技术ot依赖于信息技术it。
背景技术:
1、在实行流程的工业工厂中,操作技术ot设备在物理上与流程的实行相互影响。例如,阀门控制流经工厂的物质流量,加热器控制物质的温度,搅拌器用于混合不同的物质。许多工厂使用具有上级管理系统的分布式控制系统dcs和较低级别控制器。例如,上级管理系统决定流程中某些特性(诸如温度或压力)需要保持在哪个设置点上。然后,较低级别控制器以保持感兴趣特性处于设置点的方式致动ot设备。
2、以这种方式操作工业工厂需要大量信息技术it基础设施,诸如通信网络。ep 2823 366 b1公开了一种用于直观呈现使工业工厂的技术设备互连的通信网络的方法。
3、发明目的
4、本发明的目的是促进通过分布式控制系统以及操作技术ot和信息技术it的混合对工业工厂中的故障进行诊断和补救。
5、该目的通过根据独立权利要求所述的方法得以实现。在从属权利要求中对其他有利实施例进行详述。
技术实现思路
1、本发明提供了一种计算机实现方法,用于确定给定工业工厂中的给定操作技术ot设备的部件对信息技术it设备的依赖关系。
2、具体地,ot设备是在物理上与工业过程的实行相互影响的任何设备,诸如泵、电机、阀门、搅拌器、传感器或其他现场装置。ot设备还包括直接与现场装置通信的较低级别控制器。这种通信通常经由i/o通道执行。it设备是在无需直接使得与在物理上工业流程的实行相互影响的情况下处理、存储和输送数据的任何设备,诸如允许上级管理系统和较低级别控制器之间通信的网络部件、较低级别控制器从中获取数据的数据库或其他数据源、或托管软件定义控制器的硬件平台。
3、在该方法的过程中,从工业工厂的分布式控制系统dcs查询多个控制器中的哪个控制器负责给定ot设备的部件。通常,ot设备的每个部件都恰好由一个控制器提供服务。可能会有较高级别控制器与该控制器相互影响,但去往ot设备的部件的最终控制输入通常是与一个控制器的特定i/o通道的点对点连接。
4、然后,根据工业工厂的信息技术it景观的表示,确定控制器的正确运转所依赖的it设备的部件。it景观的表示可以呈任何合适的机器可读形式。例如,表示可以是it网络的图形,其中边缘表示物理点对点连接,而节点表示这种点对点连接的相应端部处的装置。
5、可以以任何合适方式获得it景观的表示。例如,使用基于建模语言(诸如tosca或camp)的控制系统的系统规范,协调器程序可以基于软件部件的需求来在可用计算机主机上部署软件部件。在协调器程序中注册的最终部署状态类似于it拓扑结构的当前状态。该表示包含配置节点集合和正在运行的软件部件以及状态和监控信息(运行、停止、故障……)。
6、具体地,使用来自系统规范和发现机制(诸如lldp或ssdp/redfish)的信息,可以创建具有主机路由器、交换机和电缆敷设的网络拓扑结构。
7、控制器的正确运转所依赖的it设备的部件被确定为给定ot设备的部件所依赖的信息技术景观的子集。这基于以下技术考虑:负责给定ot设备的部件的控制器的正确运转是ot设备正确运转不可或缺的一部分:即使ot设备的部件本身正常工作,除非有ot设备的控制器的指令,否则它也不会采取任何行动。控制器和ot设备的组合使ot设备在工业工厂中发挥其预期功能。
8、控制器反过来又依赖于更多的it资源。例如,工厂的某些数目或特性保持处于的设置点值需要来自dcs中的上级管理系统。此外,控制器中的控制软件可能需要访问工业工厂中的其他数据源。如果控制器无法获得其控制决策所依据的数据,则任何其他控制决策都可能基于过时信息和/或错误信息。因此,控制器以及该控制器负责的ot设备的部件可以被视为无法运转。
9、对这些依赖关系的自动化分析极大地促进了在工业工厂进行排查。工厂操作员的主要任务是观察和处理ot设备中出现的警报。这种警报最初表明该ot设备的特定部件有问题。但是,由于所提及的ot和it之间复杂的相互依赖关系,所以根本原因可能在it领域的某个地方。例如,计算ot设备的部件的控制输出所需的单个数据暂时不可用可能是这种根本原因。
10、此外,该分析促进了对it设备的维护,因为可以检查it设备的部件的暂时不可用是否会导致当前对实行工业流程至关重要的ot设备的任何部件无法运转。许多工业流程在不同的阶段中实行,在这些不同的阶段中,ot设备的不同子集可能至关重要。
11、在较旧的工业工厂中,因为所有部件都硬连接到网络,并且在工业工厂的操作期间,始终处于网络中的同一位置,所以ot和it之间的相互依赖关系可以被视为静态的。但是,在较新的工厂中,相互依赖关系不能再被视为静态的,原因有很多。例如,较低级别控制器的功能现在经常体现在可以容易地更新的控制软件中。如果这种更新使得控制软件使用来自另一数据源的输入,则控制软件的正确运转也依赖于该数据源的可用性。此外,控制软件和其他软件并不总是与特定硬件平台静态绑定。例如,这种软件可能会被容器化,并且会被调集到在当前可获得所需处理能力的某个硬件平台上运行的实行景观。所有这些动态改变都无法手动跟踪。
12、该方法可以利用可用于工厂的dcs的任何种类的系统规范。具体地,这种规范可以包括以下实体和要求(例如,呈tosca、camp或其他符号):
13、·控制功能:控制功能基于传感器数据来控制生产流程中的致动器集合。在系统规范中,控制功能被描述为具有输入(=传感器)信号和输出(=致动器)信号以及对应标签名称的功能块组。它必须指定所需功能块实行引擎以及cpu和存储器要求和配置选项。
14、·实行服务:软件部件要托管在计算机上并且被设计为用于实行功能块。实行服务必须使用所需处理器架构、操作系统以及cpm和存储器需求进行指定,以使协调程序才可以相应地部署它。
15、协调器使用tosca规范来部署应用和配置可用硬件。只有在运行时才知道控制系统的最终细节,因此,在运行时确定ot设备的部件对ot设备的部件的依赖关系是有利的。具体地,针对这个问题,可以利用以下信息源中的一个或多个信息源:
16、·tosca规范;
17、·协调器;
18、·p&id数据(dexpi);
19、·工厂图(dexpi、nlp);
20、·来自流程的实时数据(opc ua);
21、·来自控制系统的状态信息;以及
22、·网络拓扑结构。
23、例如,可以基于以下信息源中的一个或多个信息源来确定网络拓扑结构:
24、·关于协调器所完成的节点发现流程的信息
25、·tosca规范中包括的网络细节;
26、·网络拓扑结构的yang模型;以及
27、·使用lldp获得的网络发现数据。
28、在一个特别有利的实施例中,处于报警状态和/或非运转状态的ot设备的部件被选取为其对it设备的部件的依赖关系被确定的ot设备的部件。然后,ot设备的部件所依赖的所确定的it景观的子集中的it设备的部件被确定为ot设备的部件的报警状态和/或非运转状态的潜在原因。这允许快速检查最初在ot方面发现的问题是否实际上是一个ot问题或这个问题的根本原因是否在it方面。通常,工业工厂的it景观太大,以致无法对可能会导致当前ot问题的问题进行详尽调查。诸如交换机、路由器、硬件平台和物理网络连接之类的it设备的部件的绝对数目太多,无法在合理时间内得出结论。此外,如果发现了it方面的问题,则可能会放弃对根本原因的搜索,但这与当前的ot问题无关。至少出于这些原因,确定给定ot设备的部件所依赖的it景观的子集是有利的。
29、具体地,可以对潜在原因的集合中的it设备的部件中的至少一个部件执行至少一个补救动作。这种补救动作的目标是恢复it设备的相应部件的功能,以使负责ot设备的部件的控制器能够访问其所需要的所有it资源。即使没有检查it设备的具体部件是否实际上无法运转,也可以执行一些补救动作。针对其他补救动作,首先执行这种检查可能更有益。
30、补救动作的示例包括:
31、·重新启动、重新设置和/或重新配置it设备的部件;
32、·切换到it设备的部件的冗余实例;以及
33、·向工业工厂的操作员输出指令以更换it设备的部件。
34、在另一特别有利的实施例中,对潜在原因的集合中的it设备的至少一个部件执行诊断动作。如果该诊断操作的结果是it设备的部件运转,则可能会从潜在原因的集合中删除it设备的该部件。诊断动作可以具有任何合适深度。例如,粗略检查可以测试it设备的部件是否做出响应和/或检查it设备的该部件是否正在发出任何警报或正在报告任何问题。例如,更深入的检查可能会使得it设备的部件实行自检例程和/或向其提供一些测试输入或调整并且确定这是否会引发一些待预期响应。
35、在另一特别有利的实施例中,针对潜在原因的集合中的it设备的至少一个部件,确定其正确运转依赖于it设备的至少一个部件的it设备或ot设备的至少一个其他部件。然后,确定it设备或ot设备的该其他部件是否正确运转。如果是这种情况,则当前正在被调查的潜在原因的集合中的it设备的一个部件被证明为运转。因此,从潜在原因的集合中删除it设备的该部件。如果目前正在被调查的it设备的一个部件无法运转,则依赖该it设备的部件的it设备或ot设备的其他部件就无法运转。被排除在潜在原因的集合之外的it设备的每个部件都有助于将其他诊断努力的重点更好地放在剩余潜在原因上。
36、在另一特别有利的实施例中,针对潜在原因的集合中的it设备的至少一个其他部件,确定it设备的至少一个部件正确运转所依赖的it设备的至少一个其他部件。然后,确定it设备的该其他部件是否正确运转。如果不是这种情况,则从潜在原因的集合中删除当前正在被调查的it设备的至少一个部件。原因在于,如果目前正在被调查的it设备的部件正确运转的先决条件未被满足,则仅这一点就足以成为it设备的该部件无法运转的原因。也就是说,目前正在被调查的it设备的部件不可能是当前ot问题的根本原因。如果存在it方面的根本原因,则它必须在更上游的地方。
37、如之前所讨论的,控制器无需以硬件实现,也可以以软件体现。如果是这种情况,则这会对it设备的部件产生附加依赖关系。因此,在另一特别有利的实施例中,控制器包括在计算实例上运行的软件。控制器正确运转所依赖的it设备的部件至少包括硬件平台和计算实例的网络连接,该计算实例正在硬件平台上运行。
38、在另一特别有利的实施例中,可能原因集合按it设备的相应部件发生故障的概率进行排序。关于这些概率的知识可能来自任何合适的来源。以这种方式,减少了追踪问题的根本原因所需的时间。
39、在一个示例中,可以至少部分基于it设备的这些部件的维护历史和/或故障历史来确定it设备的部件发生故障的概率。例如,如果it设备的特定部件在过去出现过问题,则该it设备的该部件很可能再次成为问题的罪魁祸首。
40、当确定负责ot设备的某一部件的控制器的正确运转依赖于哪些it设备的部件时,可以利用控制器、ot设备的部件和it设备的部件之间的任何合适关系。
41、例如,如果控制器需要it设备的部件才能从任何所需数据源获得数据,则控制器的正确运转可以被视为依赖于it设备的这些部件。如果没有所需数据,就不能保证控制器能够计算出事实上适合当前情形的决策。
42、在另一示例中,如果控制器需要it设备的部件来接触其负责的ot设备的任何部件,则控制器的正确运转可以被视为依赖于it设备的这些部件。如果控制输出没有到达ot设备,则在工厂上实行的工业流程不能从正在在控制器上计算的控制输出的计算中受益。
43、在另一示例中,如果控制器需要多个it设备的部件与dcs中的上级管理系统通信,则控制器的正确运转可以被视为依赖于it设备的这些部件。如果控制器不能从dcs接收新设置点值或其他指令,则其控制决策可能基于不再准确的信息。同样,如果控制器无法将工业流程中的任何传感器数据或其他信息报告回给dcs,则dcs可能基于对来自工厂的过时信息做出的较高级别控制决策。
44、在另一特别有利的实施例中,创建了至少一个超链接,该超链接从ot景观的表示中的ot设备的至少一个部件到该ot设备所依赖的it景观的表示的it设备的至少一个部件。以这种方式,可以更容易地从ot设备的部件开始访问这些依赖关系。例如,响应于确定ot设备的部件无法运转,可以自动抓取it设备的部件上的依赖关系树,以搜索根本原因。但是,也可以直观呈现这些依赖关系,以帮助工厂操作员排查问题。
45、ot景观的表示可以以任何合适方式创建。例如,使用系统规范中的控制功能和信号的规范(例如,tosca/camp符号),可以创建流程的功能视图。该功能视图可以使用p&id信息(例如,dexpi/iso15926或automationml/iec62714符号)进行充实,以创建与控制功能有关的流程部件(例如,电机、储罐等)和管道的表示,包括来自流程的测量值。
46、使用最终部署状态(由协调器程序完成),可以创建分配视图,该分配视图显示哪些控制功能正在计算机托管的服务上运行以及相应状态和性能信息。
47、使用来自cad工具(诸如smartplant或ebase)的空间信息,可以创建显示系统的装置的位置细节的视图。具体地,可以使用如dexpi/iso15926之类的标准格式或通过对文本规范使用nlp(自然语言处理)技术从cad图中提取空间信息。
48、例如,ot景观的表示可以包括控制功能及其各自的输入信号和输出信号。可以添加来自p&id的图形信息。为了创建这种表示,可以在tosca中检查可从控制功能中获得的关于标签和信号的信息,并且与p&id和工程信息(plc open)中包含的信息进行交叉检查。算法可以匹配两个数据库中的实体的名称,从而识别p&id内与系统规范中的标签和信号匹配的区域。然后,它可以将这些区域包括在表示中。拓扑结构视图的扩展可以包括关于硬件和服务上的控制功能的关系以及性能信息的细节,从而创建分配视图。
49、因为它是计算机实现的,所以本方法可以以软件的形式体现。因此,本发明还涉及一种具有机器可读指令的计算机程序,这些机器可读指令当由一个或多个计算机和/或计算实例实行时,使得一个或多个计算机和/或计算实例执行上文所描述的方法。计算实例的示例包括云中的虚拟机、容器或无服务器实行环境。本发明还涉及一种具有计算机程序的机器可读数据载体和/或下载产品。下载产品是具有计算机程序的数字产品,例如,该数字产品可以在网上商店中出售以立即完成并下载到一个或多个计算机。本发明还涉及一种或多种具有计算机程序和/或机器可读数据载体和/或下载产品的计算实例。
1.一种计算机实现方法(100),用于确定给定工业工厂(1)中的给定操作技术ot设备的部件(2)对信息技术it设备(4)的依赖关系,包括以下步骤:
2.根据权利要求1所述的方法(100),其中
3.根据权利要求2所述的方法(100),还包括:对潜在原因的集合(6)中的所述it设备的所述部件(4)中的至少一个部件执行(150)至少一个补救动作。
4.根据权利要求3所述的方法(100),其中所述补救动作包括以下各项中的一项或多项:
5.根据权利要求2至4中任一项所述的方法(100),还包括:
6.根据权利要求2至5中任一项所述的方法(100),还包括:
7.根据权利要求2至6中任一项所述的方法(100),还包括:
8.根据权利要求2至7中任一项所述的方法(100),其中
9.根据权利要求2至8中任一项所述的方法(100),还包括:通过所述it设备的相应部件(4)发生故障的概率来对所述潜在原因的集合(6)进行排序(141)。
10.根据权利要求9所述的方法(100),其中所述it设备的部件(4)发生故障的所述概率至少部分基于所述it设备的这些部件(4)的维护历史和/或故障历史而被确定(141a)。
11.根据权利要求1至10中任一项所述的方法(100),其中所述控制器(3)正确运转所依赖的it设备的部件(4)包括(121)以下的it设备的部件(4):
12.根据权利要求1至11中任一项所述的方法(100),还包括:将至少一个超链接(7)插入(240)到所述工业工厂(1)的所述ot景观的表示(2a)中,所述至少一个超链接(7)从ot设备的至少一个部件(2)到所述ot设备的所述部件(2)所依赖的所述it景观的所述表示(4a)中的it设备的至少一个部件(4)。
13.一种计算机程序,包括机器可读指令,所述机器可读指令当在一个或多个计算机和/或计算实例上实行时,使得所述一个或多个计算机和/或计算实例执行根据权利要求1至12中任一项所述的方法(100)。
14.一种非暂态机器可读数据载体和/或下载产品,具有根据权利要求13所述的计算机程序。
15.一种或多种计算机和/或计算实例,具有根据权利要求13所述的计算机程序和/或根据权利要求14所述的机器可读数据载体和/或下载产品。
