Webpage access behavior detection method and device, storage medium and electronic equipment
By constructing a dual-dimensional prediction model based on historical URLs and web data, the problem of low accuracy in malicious attack detection in existing technologies is solved, and accurate identification and security protection of web page access behavior are achieved.
Patent Information
- Application Number
- CN202511298805.3
- Authority / Receiving Office
- CN · China
- Patent Type
- Applications(China)
- Current Assignee / Owner
- Filing Date
- 2025-09-11
- Publication Date
- 2025-12-12
AI Technical Summary
Existing methods for detecting webpage access behavior rely on single-dimensional data, resulting in low accuracy in detecting malicious attacks and an inability to effectively identify complex malicious attacks and abnormal access patterns.
By constructing a second set of data using historical URL data and historical web data, a first prediction model and a second prediction model are trained. These models reflect malicious attacks and abnormal access patterns from the dual dimensions of static character features and dynamic behavioral features. The first prediction model accurately predicts malicious attack behavior, while the second prediction model identifies abnormal access behavior.
It improves the accuracy of detecting malicious attacks on web pages, reduces the rate of missed and false detections, ensures the security of web page data and user access, and achieves comprehensive detection of malicious attacks and abnormal access.
Smart Images

Figure CN121125232A_ABST
Abstract
Description
Technical Field
[0001] This application relates to the field of Internet security technology, and in particular to a method, apparatus, storage medium and electronic device for detecting web page access behavior. Background Technology
[0002] With the rapid development of Internet technology, web page access has become increasingly frequent, and various malicious attacks (such as SQL injection and cross-site scripting attacks) have also surged, posing a serious threat to web page data security and user access security.
[0003] Currently, most mainstream methods for detecting web browsing behavior rely on single-dimensional data, which results in low accuracy in detecting malicious attacks. Summary of the Invention
[0004] In view of this, this application provides a method, apparatus, storage medium, and electronic device for detecting web page access behavior, which can improve the detection accuracy against malicious attacks.
[0005] Firstly, this application provides a method for detecting webpage access behavior, including: Based on the URL data of the Uniform Resource Locator (URL) to be detected and the Web data of the web page access traffic to be detected, the first data is determined; The first data is input into the first prediction model to obtain the first prediction result; the first prediction result is used to characterize the degree of correlation between the data to be detected and the malicious attack. The first prediction model is trained based on the second data; the second data is determined based on historical URL data and historical Web data.
[0006] Secondly, this application provides a webpage access behavior detection device, comprising: The determination module is configured to determine the first data based on the URL data of the Uniform Resource Locator (URL) to be detected and the Web data of the web page access traffic to be detected. The prediction module is configured to input the first data into a first prediction model to obtain a first prediction result; the first prediction result is used to characterize the degree of correlation between the webpage access behavior corresponding to the first data and the malicious attack behavior. The first prediction model is trained based on the second data; the second data is determined based on historical URL data and historical Web data.
[0007] Thirdly, this application provides a computer-readable storage medium having a computer program stored thereon, which, when executed by a processor, implements the method described in the first aspect.
[0008] Fourthly, this application provides an electronic device including a storage medium, a processor, and a computer program stored on the storage medium and executable on the processor, wherein the processor executes the computer program to implement the method described in the first aspect.
[0009] By employing the above technical solutions, this application provides a method, apparatus, storage medium, and electronic device for detecting webpage access behavior. Compared with existing webpage access behavior detection methods, the embodiments of this application utilize second data obtained from historical URL data and historical Web data to train a first prediction model. Historical URL data provides static character features such as URL character structure and parameter configuration. Historical Web data provides dynamic behavioral features such as access traffic fluctuations and access intervals. The second data constructed using historical URL data and historical Web data can reflect malicious attack patterns from both static character features and dynamic behavioral features. By using the first prediction model to learn the correlation between the second data and malicious attack patterns, the correlation between the webpage access behavior corresponding to the first data and the malicious attack behavior can be accurately predicted, yielding a prediction result. The embodiments of this application avoid missed detections and false detections caused by relying on single-dimensional data, and fully explore the malicious attack patterns hidden in historical webpage access behavior, thereby improving the accuracy of webpage malicious attack detection and ensuring webpage data security and user access security.
[0010] The above description is only an overview of the technical solution of this application. In order to better understand the technical means of this application and to implement it in accordance with the contents of the specification, and to make the above and other objects, features and advantages of this application more obvious and understandable, the following are specific embodiments of this application. Attached Figure Description
[0011] The accompanying drawings, which are incorporated in and form part of this specification, illustrate embodiments consistent with this application and, together with the description, serve to explain the principles of this application.
[0012] To more clearly illustrate the technical solutions in the embodiments of this application or the prior art, the drawings used in the description of the embodiments or the prior art will be briefly introduced below. Obviously, for those skilled in the art, other drawings can be obtained based on these drawings without creative effort.
[0013] Figure 1 This illustrates the applicable implementation environment for a webpage access behavior detection method provided in this application embodiment; Figure 2 This illustration shows a schematic diagram of a server structure to which a webpage access behavior detection method provided in an embodiment of this application is applicable; Figure 3This illustration shows a schematic diagram of a server structure to which a webpage access behavior detection method provided in an embodiment of this application is applicable; Figure 4 A flowchart of a webpage access behavior detection method provided in an embodiment of this application is shown; Figure 5 A flowchart of a webpage access behavior detection method provided in an embodiment of this application is shown; Figure 6 This document illustrates an example flowchart of training a first prediction model to be trained, provided by an embodiment of this application. Figure 7 This document illustrates an example flowchart of training a second prediction model according to an embodiment of this application. Figure 8 A schematic diagram of a webpage access behavior detection device provided in an embodiment of this application is shown. Detailed Implementation
[0014] To facilitate the explanation of the embodiments of this application, some application scenarios and related technical terms will be introduced below.
[0015] Currently, websites face a variety of security threats, mainly including malicious attacks and abnormal access.
[0016] Malicious attacks refer to diverse behaviors that exploit web page vulnerabilities or tamper with related data to achieve purposes such as disrupting functionality or stealing information. Types of malicious attacks include: SQL injection attacks, cross-site scripting (XSS) attacks, distributed denial-of-service (DDoS) attacks, and malicious web crawler attacks. These malicious attacks typically exhibit the following characteristics: SQL injection attacks insert abnormal code fragments into URL data; XSS attacks contain unfiltered script tags; DDoS attacks are accompanied by high-frequency access requests within a short period; and malicious web crawler attacks show high-frequency, evenly spaced access requests. These characteristics are often reflected simultaneously in both URL data (such as specific character structures) and web data (such as traffic fluctuations and access frequency).
[0017] Abnormal access typically manifests as behavior that differs significantly from normal access. For example, abnormal access may include: high-frequency requests from the same IP address within a short period of time, abnormally hopping access paths, and data transfer volumes far exceeding normal limits.
[0018] In some cases, malicious attack detection methods rely solely on web data for judgment, failing to incorporate URL data into the protection system. Even when some malicious attack detection methods do incorporate URL data, they often use single-dimensional data for matching (such as identifying only specific malicious character fragments). Regardless of the specific method used, malicious attack detection fails to effectively identify malicious attacks, resulting in serious threats to web page data security and user access security.
[0019] In another scenario, anomaly detection methods primarily rely on fixed thresholds or simple rules from a single dimension for anomaly assessment. For example, this might involve setting a limit on the number of accesses per minute from a single IP address (e.g., 50 times), or simply judging anomalies based on whether the source IP is on a suspicious list. This approach, based on fixed thresholds or simple rules from a single dimension, not only struggles to accurately capture complex anomaly patterns but may also misclassify special access events within normal business scenarios (such as concentrated access during e-commerce platform promotions or batch data synchronization within an enterprise) as anomalies, exacerbating false alarms.
[0020] This application embodiment uses a second set of data constructed from historical URL data and historical Web data to train a first prediction model. Historical URL data provides static character features such as URL character structure and parameter configuration. Historical Web data provides dynamic behavioral features such as access traffic fluctuations and access intervals. The second set of data constructed using historical URL data and historical Web data can reflect malicious attack patterns from both static character features and dynamic behavioral features. By using the first prediction model to learn the correlation between the second set of data and malicious attack patterns, the degree of correlation between the webpage access behavior corresponding to the first set of data and malicious attack behavior can be accurately predicted, thus obtaining the prediction result. This application embodiment avoids missed detections and false detections caused by relying on single-dimensional data, and fully explores the malicious attack patterns hidden in historical webpage access behavior, thereby improving the accuracy of webpage malicious attack detection and ensuring webpage data security and user access security.
[0021] The following describes some implementation environments related to the embodiments of this application.
[0022] Figure 1 This is a schematic diagram illustrating the applicable implementation environment for a webpage access behavior detection method provided in this application embodiment. For example... Figure 1 As shown, the implementation environment includes a terminal device 100 and a server 200. The terminal device 100 and the server 200 interact with each other via a network.
[0023] The terminal device 100 can be a mobile phone, computer, wearable device (smartwatch, smart glasses), etc. The terminal device 100 runs applications with network access capabilities, such as: web browsing applications (browsers), applications with embedded web functions (social applications, news applications, office applications), and automated web access tools (web crawlers, API calling tools, etc.).
[0024] Server 200 can detect malicious attacks in web page access behavior by analyzing the URL data and web data of the terminal device 100's application. For example... Figure 2 As shown, server 200 includes a data acquisition module 210, a data processing module 220, a first prediction model 230, and an execution module 250. It should be noted that server 200, in detecting malicious attacks during webpage access behavior, includes a model training phase and a real-time detection phase. Specifically: During the model training phase, the data acquisition module 210 collects historical URL data and historical Web data, and constructs second data for training the first prediction model 230 based on the historical URL data and historical Web data.
[0025] The data processing module 220 preprocesses the historical URL data to obtain intermediate URL data. Then, it aligns the first temporal feature of the historical Web data with the character features of the intermediate URL data to obtain a temporal feature vector in Cartesian coordinates. Finally, it transforms the temporal feature vector to obtain the target temporal feature vector in polar coordinates.
[0026] In some embodiments, the first prediction model 230 to be trained includes at least a dimension transformation layer, an attention mechanism layer, a temporal analysis layer, a fully connected layer, and a decision layer.
[0027] The dimension transformation layer is used to perform dimension transformation on the target temporal feature vector, converting it into two-dimensional image data (secondary data). This transformation involves mapping linear character features to the row dimension of a two-dimensional matrix and mapping temporal information such as access timestamps and frequencies (first temporal features) to the column dimension, resulting in two-dimensional image data that includes both static character features and dynamic behavioral features. In some examples, Gramian Angular Field (GAF) can be used as the core implementation method for the dimension transformation layer. It is also known that Markov Transition Field (MTF), Recurrence Plot (RP), and Short-Time Fourier Transform (STFT) can be used as core implementation methods for the dimension transformation layer.
[0028] The attention mechanism layer focuses on local regions in 2D image data that are highly correlated with malicious attack patterns, while downplaying irrelevant information. In some examples, the attention mechanism layer calculates the correlation between each region in the 2D image data (such as a matrix block containing character combinations) and known malicious attack patterns (such as the "UNION SELECT" fragment in SQL injection attacks, cross-site scripting...). <script>”标签)的相似度。根据相似度结果,将二维图像数据划分为高匹配度区域和低匹配度区域,并为高匹配度区域分配更高注意力权重,从而精准提取如异常代码字符片段、高频访问时间窗口等局部区域特征,减少无关信息对训练待训练第一预测模型230的干扰。在一些示例中,可以采用多头注意力机制(Multi-Head Attention)、时序注意力机制(Temporal Attention)等作为注意力机制层的核心实现实现方式。
[0029] 时序分析层,用于提取局部区域特征在时间维度上的特征(第二时序特征)。在一些示例中,时序分析层分别沿第二数据的访问时间正序、逆序提取正向时序特征、逆向时序特征。然后,将正向时序特征和逆向时序特征进行特征合并得到第二时序特征。在一些示例中,可以采用双向门控制单元(Bidirectional Gated Recurrent Unit,Bi-GRU)、双向长短期记忆(Bidirectional Long Short-Term Memory,Bi-LSTM)等作为时序分析层的核心实现方式。
[0030] 全连接层,用于将时序分析层输出的第二时序特征与二维图像数据进行特征整合处理,得到核心第二数据。并且,全连接层将核心第二数据映射到第一样本标签空间,得到表征所述核心第二数据对应的网页访问行为与第一样本标签空间中的恶意攻击标签关联程度的第一映射关系。其中,第一样本标签空间包括与恶意攻击模式对应的恶意攻击标签,以及与正常访问模式对应的正常访问标签。恶意攻击标签用于标记核心第二数据对应的网页访问行为属于恶意攻击行为。当核心第二数据与某种恶意攻击模式的特征高度匹配的情况下,全连接层会将该核心第二数据映射到对应的恶意攻击标签下。其中,恶意攻击标签例如包括:"SQL注入攻击”、"跨站脚本攻击”、"分布式拒绝服务攻击”、"恶意爬虫攻击”等标签。正常访问标签用于标记核心第二数据对应的访问行为属于正常访问,也即,非恶意攻击。当核心第二数据未表现出与已知恶意攻击模式相关的特征时,全连接层会将该核心第二数据映射到正常访问标签下。
[0031] 决策层,基于全连接层传递的第一映射关系,针对输入的核心第二数据输出初步的预测概率分布(核心第二数据属于恶意攻击或正常访问的概率值)。随后,将该预测概率分布与真实标签(即人工标注的恶意攻击标签、正常访问标签)进行对比,通过损失函数(如交叉熵损失)计算两者的差异,得到训练误差。在一些实施例中,决策层将训练误差通过反向传播算法逐层传递至待训练第一预测模型230的前序网络(如全连接层、时序分析层、注意力机制层等)。各前序网络依据训练误差调整网络参数以优化特征提取,决策层则基于优化后的各前序网络输出更精准的预测结果(概率分布),形成迭代训练。在多次迭代训练中,通过训练误差反馈不断修正各前序网络的网络参数,使决策层的预测结果与真实标签的差异逐渐缩小,直至待训练第一预测模型230收敛(即误差低于预设阈值),得到第一预测模型230。在一些示例中,可以采用Elman网络作为决策层的核心实现方式。Elman网络通过隐含层到上下文层的反馈连接,能有效捕捉核心第二数据中时序特征的动态依赖关系(如恶意访问的时间间隔规律、流量波动的前后关联性等),精准识别恶意攻击的时序模式(如分布式拒绝服务攻击的短时间高频请求)。进一步的,Elman网络还可以使输出的预测结果更贴合恶意攻击的动态行为特征,同时在反向传播中精准传递时序相关误差,有利于前序网络针对性调整网络参数,优化特征提取,提升第一预测模型230整体检测精度。
[0032] 在实时检测阶段,数据获取模块210实时捕获终端设备100应用程序产生的待检测URL数据和待检测Web数据,并将待检测URL数据和待检测Web数据组成基础检测数据。
[0033] 数据处理模块220根据待检测Web数据对待检测URL数据进行去重、脱敏、字符串切割、字符特征提取等预处理,得到待检测的URL特征数据(第一数据)。第一数据为第一预测模型230的输入数据。
[0034] 将第一数据输入至第一预测模型230,得到表征第一数据对应的网页访问行为与恶意攻击关联程度的第一预测结果。
[0035] 执行模块250根据第一预测结果采取相应措施。例如,若第一预测结果为恶意攻击行为,生成控制指令。
[0036] 服务器200将控制指令发送至终端设备100。终端设备100响应于控制指令,终止所述第一数据所属应用程序进程的网络访问权限。
[0037] 在一些实施例中,服务器200还可以检测网页访问行为中是否存在异常访问行为。如图3所示,服务器200包括数据获取模块210、数据处理模块220、第一预测模型230、第二预测模型240、执行模块250。需要说明的是,针对第一预测模型230的模型训练阶段已在上述实施例中介绍,这里不再赘述。本实施例仅示例性介绍针对第二预测模型240的模型训练阶段,以及第一预测模型230和第二预测模型240共同作用的实时检测阶段。
[0038] 在针对第二预测模型240的模型训练阶段,数据处理模块220在得到第二数据后,根据第二数据,对历史Web数据进行结构化转换处理,得到历史Web矩阵(中间Web数据)。进一步的,数据处理模块220根据历史Web矩阵各行向量之间的相关度,对历史Web矩阵进行冗余信息过滤,得到过滤后的历史Web矩阵。之后,对过滤后的历史Web矩阵的各个矩阵参数进行归一化处理,得到归一化后的历史Web矩阵(第四数据)。第四数据用于训练待训练第二预测模型240。
[0039] 在一些实施例中,待训练第二预测模型240至少包括多层深度置信神经网络层、时序分析层、全连接层和决策层。其中:多层深度置信神经网络层,用于对第四数据进行逐层处理,得到与异常访问行为相关的中间第四数据。在一些示例中,多层深度置信神经网络层通过底层网络捕捉第四数据的基础特征(如单条访问的IP、请求类型、数据量),中层网络提炼关联模式(如同一IP的访问频次、不同请求的组合规律),上层网络挖掘深层异常特征(如隐性IP集群的协同访问、跨时段的流量异常关联),最终输出整合了与异常访问行为(如非授权高频访问、异常流量波动)高度相关的抽象特征集合(中间第四数据)。在一些示例中,可以采用多层受限玻尔兹曼机(Restricted Boltzmann Machine,RBM)为多层深度置信神经网络层的核心实现方式。
[0040] 时序分析层,用于提取中间第四数据在时间维度上的特征(核心第四数据)。
[0041] 在一些示例中,时序分析层通过对中间第四数据进行时间序列建模,捕捉其在连续时间窗口内的动态变化规律(核心第四数据)。动态变化规律例如包括:访问频率的骤升骤降、周期性异常峰值出现的时间间隔等。
[0042] 在一些示例中,时序分析层可以对中间第四数据进行双向时序特征提取。也即,时序分析层分别沿中间第四数据的访问时间正序提取正向时序特征,沿中间第四数据的访问时间逆序提取逆向时序特征。然后,时序分析层将正向时序特征和逆向时序特征进行特征合并得到核心第四数据。
[0043] 在一些示例中,待训练第二预测模型240的时序分析层核心实现方式可以与上述待训练第一预测模型230的时序分析层核心实现相同。也即,采用Bi-GRU或者Bi-LSTM作为时序分析层的核心实现方式。
[0044] 全连接层,用于将时序分析层输出的核心第四数据映射到第二样本标签空间,得到表征核心第四数据对应的网页访问行为与第二样本标签空间中异常访问行为标签关联程度的第二映射关系。可选地,待训练第二预测模型240的全连接层核心实现方式可以与待训练第一预测模型230的全连接层核心实现方式相同,这里不再赘述。
[0045] 决策层,基于全连接层传递的第二映射关系,针对核心第四数据输出初步的预测概率分布。例如,输出核心第四数据属于异常访问行为或正常访问的概率值。随后,将该预测概率分布与真实标签(即人工标注的异常访问标签、正常访问标签)进行对比,通过损失函数(如交叉熵损失)计算两者的差异,得到训练误差。进一步的决策层产生的训练误差通过反向传播算法逐层传递至待训练第二预测模型240的前序网络(如全连接层、时序分析层、深度深度置信神经网络层等)。可选地,待训练第二预测模型240决策层的核心实现可以与待训练第一预测模型230决策层的核心实现方式相同。也即采用Elman网络作为待训练第二预测模型240决策层的核心实现方式。
[0046] 在一些实施例中,在决策层将训练误差通过反向传播算法逐层传递至待训练第二预测模型240的前序网络后,各前序网络依据训练误差调整网络参数以优化特征提取,决策层则基于优化后的各前序网络输出更精准的预测结果(概率分布),形成迭代训练。在多次迭代训练中,通过训练误差反馈不断修正各前序网络的网络参数,使决策层的预测结果与真实标签的差异逐渐缩小,直至待训练第二预测模型240收敛(即误差低于预设阈值),得到第二预测模型240。
[0047] 在针对第一预测模型230和第二预测模型240共同作用的实时检测阶段,数据获取模块210实时捕获终端设备100应用程序产生的待检测URL数据和待检测Web数据,并将待检测URL数据和待检测Web数据组成基础检测数据。
[0048] 在一些示例中,数据处理模块220根据待检测Web数据对待检测URL数据进行去重、脱敏、字符串切割、字符特征提取等预处理,得到待检测的URL特征数据(第一数据)。第一数据用于第一预测模型230的输入数据。
[0049] 在一些示例中,数据处理模块220根据第一数据,对待检测Web数据进行结构化转换、冗余信息过滤、归一化等预处理,得到待检测的Web特征数据(第三数据)。第三数据用作第二预测模型240的输入数据。
[0050] 在一些示例中,将第一数据输入至第一预测模型230,得到表征第一数据对应的网页访问行为与恶意攻击关联程度的第一预测结果。
[0051] 在一些示例中,将第三数据输入至第二预测模型240,得到表征第三数据的网页访问行为与异常访问行为关联程度的第二预测结果。
[0052] 执行模块250根据第一预测结果和第二预测结果采取相应措施。例如,若第一预测结果为恶意攻击行为,生成控制指令。
[0053] 服务器200将控制指令发送至终端设备100。终端设备100响应于控制指令,终止所述第一数据所属应用程序进程的网络访问权限。若第二预测结果为异常访问行为则生成警告指令,并持续监控。若异常访问行为数量超过预设阈值则生成控制指令。服务器200将警告指令发送至终端设备100,终端设备100响应于警告指令,显示警告信息。所述警告信息包括提示当前网页访问行为是异常访问行为的提示信息。
[0054] 在一些示例中,可以同时将数据处理模块220输出的第一数据输入至第一预测模型230、将第三数据输入至第二预测模型240。实现第一预测模型230和第二预测模型240同时对网络访问行为进行预测。
[0055] 这样,使得网页访问行为检测能同时覆盖恶意攻击和异常访问行为检测,避免单一模型漏检,提升检测全面性。且无需串行等待,保障实时性,还能依据两类结果快速实现风险分级(如恶意攻击高风险、异常行为中低风险),提升处置效率。
[0056] 在一些示例中,还可以在第一预测模式输出第一预测结果为正常访问行为的情况下,将数据处理模块220输出的第三数据输入至第二预测模型240。
[0057] 这样,通过即时拦截恶意攻击加分级预警异常行为加阈值触发强化防护的递进式设计,既确保了对明确恶意行为的快速阻断,又通过警告和阈值机制平衡了防护强度与用户体验,形成了多层次的安全闭环,有效提升网页数据安全和用户访问安全。
[0058] 可以知道的是,本申请实施例的方法同样支持在终端设备100本地执行。第一预测模型、第二预测模型及执行模块等核心组件均可部署于终端设备100,实现全流程本地化运行,实际部署方式本申请不再赘述。
[0059] 下面将参照附图更详细地描述本申请的实施例。需要说明的是,在不冲突的情况下,本申请中的实施例及实施例中的特征可以相互组合。
[0060] 本实施例提供了一种网页访问行为检测方法,如图4所示,该方法包括:S101、基于待检测统一资源定位符URL数据和待检测网页访问流量Web数据,确定第一数据。
[0061] 其中,URL数据是指用于定位互联网上资源(如网页、图片、文件)的标准化地址格式。URL数据规定了如何访问资源以及资源所在的位置。URL数据的标准化地址格式包括静态字符特征。例如,字符结构、配置参数等。
[0062] 在本申请实施例中,URL数据按时序可以分为待检测URL数据和历史URL数据。其中,待检测URL数据例如是指当前需要判断是否与恶意攻击关联的URL数据,是第一预测模型的输入数据之一。历史URL数据例如是指产生于待检测URL数据之前的URL数据。例如,历史网页访问记录中的URL数据。历史URL数据是第一预测模型的样本数据之一。
[0063] Web数据是指网页在被访问过程中产生的,反映访问动态行为与流量规模的结构化数据。Web数据包括单位时间内的访问请求数、数据传输字节数、访问来源IP、访问间隔、访问频次、访问路径及用户与网页的交互信息等。
[0064] 在本申请实施例中,Web数据按时序可以分为待检测Web数据和历史Web数据。其中,待检测Web数据是指与待检测URL数据同步产生的实时Web访问流量数据,是第一预测模型的输入数据之一。历史Web数据是指产生于待检测Web数据之前的Web访问流量数据,是第一预测模型的样本数据之一。
[0065] 在一些示例中,可以根据上述实施例中提到的数据处理模块执行预处理操作,得到第一数据。
[0066] 示例性的,首先,数据处理模块根据相同待检测URL数据对应的待检测Web数据,去除完全重复的访问记录,保留同一待检测URL数据在不同访问操作(如不同时间、不同来源IP、不同请求参数)下的待检测URL数据。然后,对去重后的待检测URL数据进行数据脱敏处理,遮掩或去除待检测URL数据中包含的用户身份标识(如账号、手机号)、隐私参数(如Session ID、Token)等敏感信息。再然后,对脱敏后的待检测URL数据进行字符串切割处理,按其结构特征(如分隔符" / ”、"?”等)拆分出字符串片段。最后,对这些字符串片段进行字符特征提取处理得到第一数据。
[0067] 在一些实施方式中,服务器200在确定第一数据之前,获取待检测URL数据和待检测Web数据。
[0068] 示例性的,待检测URL数据和待检测Web数据可以是终端设备100通过应用程序提供的内置接口实时采集的。终端设备100将采集得到应用程序的待检测URL数据和待检测Web数据上传至服务器200。服务器200在获取待检测URL数据和待检测Web数据后,执行确定第一数据的步骤。
[0069] S102、将第一数据输入第一预测模型,得到第一预测结果。
[0070] 其中,第一预测结果用于表征第一数据对应的网页访问行为与恶意攻击行为的关联程度。
[0071] 其中,第一预测模型基于第二数据训练得到。第二数据基于历史URL数据和历史Web数据确定。
[0072] 在一些示例中,确定第二数据的方式与上述确定第一数据的方式类似,这里不再赘述。
[0073] 在一些实施例中,以上述示例中的服务器200为例对本申请实施例提供的网页访问行为检测方法进行示例性介绍:服务器200将第一数据输入至第一预测模型。第一预测模型在得到第一数据后进行以下推理:首先,第一预测模型的维度转换层将第一数据包括的字符特征映射为包括字符特征和访问时序特征(第一时序特征)的二维图像数据。然后,第一预测模型的注意力机制层聚焦二维图像数据中与恶意攻击模式高度相关的局部区域,提取二维图像数据中的局部区域特征。再然后,第一预测模型的时序分析层对局部区域特征进行双向时序特征提取,得到局部区域特征的第二时序特征。再然后,第一预测模型的全连接层对第二时序特征和原始的二维图像数据进行特征整合得到核心第一数据,并将核心第一数据映射到第一样本标签空间。最后,第一预测模型的决策层计算核心第一数据与第一样本标签空间的恶意攻击标签的匹配度,输出第一预测结果。
[0074] 第一预测结果以概率值或评分形式量化表征第一数据对应的网页访问行为与恶意攻击的关联程度。例如,当用户访问某网页时,第一数据中待检测URL数据的字符特征包含跨站脚本攻击典型标签"<script>”,且对应的待检测Web数据显示该待检测URL数据在10秒内被同一IP连续请求20次(符合恶意攻击的高频访问特征)。第一预测模型根据第一数据进行如上述所示的推理过程。通过比对从第一数据提取出的核心第一数据与恶意攻击标签的匹配度,输出概率值0.91(0~1之间),表明第一数据对应的网页访问行为与恶意攻击的关联程度极高。
[0075] 若第一数据中待检测URL数据的字符特征符合正常网页参数规范(如无异常特殊字符),且待检测Web数据显示其访问频次、流量规模均处于历史正常访问波动范围内(如单IP每分钟访问3次,数据传输量稳定),第一预测模型则可能输出概率值0.08,表明该第一数据与恶意攻击的关联程度极低,更倾向于正常访问行为。
[0076] 这种量化结果直观反映了访问行为的风险等级,便于服务器200快速决策是否采取防御措施。
[0077] 本申请实施例利用历史URL数据和历史Web数据训练得到第一预测模型。由于历史URL数据可提供URL字符结构、参数配置等静态字符特征。历史Web数据可提供访问流量波动、访问间隔等动态行为特征。利用历史URL数据以及历史Web数据构建的第二数据可从静态字符特征与动态行为特征的双重维度反映恶意攻击模式。利用第一预测模型学习第二数据与恶意攻击模式的关联规律,可精准预测第一数据对应的网页访问行为与恶意攻击行为的关联程度,得到预测结果。本申请实施例既避免了依赖单一维度数据导致的漏检、误检,又充分挖掘了历史网页访问行为中隐含的恶意攻击模式,进而能够提升网页恶意攻击检测精度,保障网页数据安全与用户访问安全。
[0078] 下面,对本申请实施例提供的一种网页访问行为检测方法方法进行详细说明。
[0079] 如图5所示,本申请实施例还提供了识别第三数据对应的网页访问行为是否为异常访问行为的实施方式,包括以下步骤:S201、根据第一数据,对待检测Web数据进行预处理,得到第三数据。
[0080] 在一些示例中,根据第一数据,对待检测Web数据进行预处理至少包括:结构化转换、冗余信息过滤、以及归一化处理。
[0081] 示例性的,首先,以第一数据为基准,将待检测Web数据非结构化的实时访问流量信息(如零散的请求日志、响应数据)转换为结构化的中间Web数据。例如构建包含(访问时间戳、来源IP、请求方法、数据传输字节数、访问间隔、URL关联标识)等特征参数的Web矩阵(中间Web数据)。然后,通过计算Web矩阵不同行向量(每条访问记录)之间的相关度,剔除Web矩阵中高度相似的冗余信息。例如,若两条待检测Web数据的来源IP、请求方法、访问间隔等特征的相关系数超过0.7,表明其为重复或近似的网页访问行为,仅保留其中一条以减少Web矩阵的数据体量。同时,过滤掉与异常访问检测无关的冗余字段(应用程序版本号等)。最后,对过滤冗余信息后的Web矩阵包括的不同量级的特征参数进行归一化处理,得到归一化后的Web矩阵(第三数据)。第三数据用于第二预测模型的输入数据。
[0082] S202、将第三数据输入第二预测模型,得到第二预测结果。
[0083] 第二预测结果用于表征第三数据对应的网页访问行为与异常访问行为的关联程度。
[0084] 其中,所述第二预测模型是基于所述第四数据训练得到的。所述第四数据是根据所述第二数据,对所述历史Web数据进行预处理得到的。
[0085] 可以知道的是确定第四数据的方式,与上述确定第三数据的方式类似,这里不再赘述。
[0086] 在一些实施例中,以上述示例中的服务器200为例对本申请实施例提供的识别第三数据对应的网页访问行为是否为异常访问行为的实施方式进行示例性介绍:服务器200将第三数据输入至第二预测模型。第二预测模型在得到第三数据后进行以下推理:首先,第二预测模型的多层深度置信神经网络层将第三数据包括的与异常访问相关的基础特征(如访问来源IP、请求类型、数据传输量、访问频次等)进行逐层处理,输出整合了与异常访问行为高度相关的中间第三数据。然后,第二预测模型的时序分析层对中间第三数据进行双向时序特征提取,得到中间第三数据在时间维度的核心第三数据。再然后,第二预测模型的全连接层对核心第三数据映射到第二样本标签空间。最后,第二预测模型的决策层计算核心第三数据与第二样本标签的异常访问行为标签的匹配度,输出第二预测结果。
[0087] 与第一预测结果相同,第二预测结果同样以概率值或评分形式量化表征第三数据对应的网页访问行为与恶意攻击的关联程度。具体不再赘述。
[0088] 本申请实施例利用第四数据训练得到第二预测模型。由于第四数据既保留了历史Web数据中与异常访问相关的动态行为特征,又关联了历史URL数据的静态字符特征,能够从静态字符特征与动态行为特征双重维度反映异常访问模式。利用第二预测模型学习第四数据与异常访问行为的关联规律,可精准捕捉异常访问的深层特征与时间维度的动态依赖关系,有效识别复杂异常模式(如伪装成正常流量的低频协同攻击、跨URL的异常跳转序列),既降低了对正常业务访问的误判率,又能与第一预测模型形成协同防护,全面提升网页访问行为检测的准确性与全面性。
[0089] 在一些实施例中,本申请还提供了根据第一预测结果执行安全防护策略的实施方式,包括:在第一预测结果为恶意攻击行为的情况下,生成控制指令。其中,控制指令被配置为终止第一数据所属应用程序进程的网络访问权限。
[0090] 在一些示例中,当第一预测模型输出的第一预测结果指示网页访问行为为恶意攻击行为时,服务器200生成控制指令并将控制指令发送至终端设备100。终端设备100接收到控制指令后,通过操作系统进程管理接口定位第一数据所属的应用程序进程(如触发恶意访问的浏览器进程),强制终止该进程的网络访问权限。例如,切断其与目标服务器200的TCP连接,或在防火墙层面拦截该进程的所有网络请求,防止恶意攻击代码进一步传输或执行(如阻止SQL注入代码对数据库的非法操作、跨站脚本对用户cookie的窃取)。同时,终端设备100可弹窗提示("检测到恶意访问,已终止该程序的网络连接”),确保用户知晓防护操作。
[0091] 在一些实施例中,本申请还提供了根据第二预测结果执行安全防护策略的实施方式,包括:在第二预测结果为异常访问行为的情况下,生成警告指令。
[0092] 在一些示例中,当第二预测模型输出的第二预测结果指示网页访问行为为异常访问行为时,服务器200生成警告指令并推送至终端。终端设备100接收到警告指令后,在对应的应用程序界面弹出("当前访问行为异常,请注意账号安全”)提示用户当前网页访问行为存在一定风险。
[0093] 在一些实施例中,记录异常访问行为数量。在预设时间窗口内,若检测到异常访问行为数量大于预设阈值,生成控制指令。
[0094] 在一些示例中,若服务器200在预设时间窗口(如10分钟)内累计记录的异常访问行为数量超过阈值(如同一IP的异常访问达5次),则自动触发控制指令。例如,某IP在10分钟内针对多个URL发起异常访问。当累计次数超过预设阈值后,服务器200生成控制指令并将控制指令发送至终端设备100。终端设备100接收到控制指令后,通过操作系统进程管理接口定位第一数据所属的应用程序进程(如触发异常访问的浏览器进程),强制终止该进程的网络访问权限。同时,终端设备100可弹窗提示"检测到异常访问行为,已终止该程序的网络连接”,确保用户知晓防护操作。
[0095] 在一些示例中,当判断网页访问行为为恶意攻击行为,或异常访问行为的数量超过预设阈值且情节严重(如多次尝试非法入侵、批量传播恶意代码)时,服务器200在生成控制指令的同时,还可将该行为对应的用户信息(如用户账号、关联手机号、注册邮箱等)加入黑名单。
[0096] 上述安全防护策略通过即时拦截恶意攻击加分级预警异常行为加阈值触发强化防护的递进式设计,既确保了对明确恶意行为的快速阻断,又通过警告和阈值机制平衡了防护强度与用户体验,形成了多层次的安全闭环,有效提升网页数据安全和用户访问安全。
[0097] 本申请实施例提供了确定第二数据的实施方式,包括以下步骤:S301、基于所述历史Web数据对所述历史URL数据进行预处理,得到中间URL数据。
[0098] 其中,所述中间URL数据包括字符特征。
[0099] 在一些示例中,预处理包括数据去重、数据脱敏、字符串切割以及字符特征提取处理。
[0100] 示例性的,对比相同历史URL数据对应的历史Web数据,去除完全重复的访问记录,保留同一历史URL数据在不同访问操作(如不同时间、不同来源IP、不同请求参数)下的历史URL数据。然后,对去重后的历史URL数据进行敏感数据脱敏,遮掩或去除其中包含的用户身份标识(如账号、手机号)、隐私参数(如Session ID、Token)等敏感信息,得到脱敏后的历史URL数据集。所述脱敏后的历史数据集包括至少一条脱敏后的历史URL数据。
[0101] 示例性的,对脱敏后的历史URL数据进行字符串切割处理,得到历史URL字符串S串=[S1、…Si、…Sn]。其中,i为字符指示量。n为字符总量。对历史URL字符串S串进行字符特征提取处理,得到历史URL特征数据。其中,P1为长度异常值、P2为字符分布异常值、P3为异常类型相关系数、P4为关联系数。
[0102] 在一些示例中,可以采用下式对历史URL字符串S串进行字符特征提取,得到长度异常值P1:;式中,为切比雪夫函数。
[0103] 为切比雪夫不等式;为历史URL字符串S串的长度;为历史URL字符串S串的长度均值;为历史URL字符串S串的标准差个数;为脱敏后的历史URL数据集中的各历史URL字符串S串的标准差。
[0104] 上式基于切比雪夫不等式,先统计历史URL字符串S串长度的均值与标准差,构建概率约束关系。借由概率约束关系界定历史URL字符串S串长度偏离均值超k倍标准差这一事件的概率上限,以此量化判定历史URL字符串S串的长度是否异常,输出P1。
[0105] 在一些示例中,可以采用下式提取历史URL字符串S串的字符分布异常值P2。
[0106] ;式中,为历史URL字符串S串中第i、k个字符为的概率值;为历史URL字符串S串中第k个字符为的概率值;为预处理后历史URL数据集(中间URL数据)中历史URL字符串S串的第i个字符为的概率值均值;i、k均为指示量。
[0107] 上式利用正常URL的字符概率分布相对稳定(偏离度小,P2小),异常 URL(如含恶意参数、特殊编码)的字符概率会明显偏离均值(偏离度大,P2大)的特点,量化历史URL的字符分布异常值P2。
[0108] 示例性的,首先,对每个历史URL字符串S串,统计每个字符出现的概率值。然后,对所有的历史URL字符串S串,统计同一个字符的概率,求得平均值。再然后,对每个字符,用计算相对偏离度,再把所有字符的偏离度相加得到P2。最后,判断P2的值,P2值越大,说明历史URL字符串S串的字符分布和正常访问行为的差异越大,表明其可能为恶意URL。
[0109] 在一些示例中,可以采用下式提取历史URL字符串S串的异常类型相关系数P3:;式中,为线性递增函数;为预处理后历史URL数据集中历史URL字符串S串的计数函数;为与的协方差函数;为方差函数;上式通过协方差和方差构建指标,捕捉URL字符异常类型间的线性关联关系,输出P3。例如,若URL中SQL注入字符频繁出现(值大),且对应的URL字符串S串的长度也显著增加(值大),通过协方差计算得到正相关结果,结合方差归一化后,P3值较高。说明,URL字符串S串的长度与SQL注入字符存在强线性关系。P3值可辅助识别SQL注入攻击的恶意攻击模式。
[0110] 在一些示例中,采用下式提取历史URL字符串S串的关联系数P4:;式中,为历史URL字符串S串中字符(S)出现的频率;例如,历史URL字符串S串的总字符数为100,字符(a)出现10次,则为0.1。
[0111] 为历史URL字符串S串中字符(S)的逆向文本频率;例如,字符(@)在恶意URL中高频出现,在正常URL中出现的频率则较低。
[0112] 为字符(S)的类间离散因子;类间例如为正常URL和恶意URL之间的离散因子。
[0113] 为字符(S)的类内离散因子;类内例如为正常URL之间的离散因子、恶意URL之间的离散因子。
[0114] 上式通过衡量历史URL字符串S串连续三个字符(Si-1,Si,Si+1)的关联紧密性,挖掘异常字符序列模式。
[0115] 另外,为字符概率,通过融合、、、四类特征,突出异常字符序列模式。利用调整字符概率,放大类内稳定、类间差异大的字符权重。例如,恶意URL特有的字符,在恶意URL内出现稳定,和正常URL差异大,那么这部分字符特征会被突出。
[0116] 在一些示例中,下式还介绍了类间离散因子的计算方式:;式中,为字符(S)的类间离散因子;为字符(S)的标准差;为历史URL字符串S串中字符(S)出现的频率;为脱敏后的历史URL数据集中字符(S)出现的频率;标准差越大表示字符(S)在不同历史URL字符串S串中的频率波动越大,类间离散度越高。例如,字符(&)在正常URL字符串中出现少,在恶意URL字符串中出现多,那么标准差就大。
[0117] 在一些示例中,下式还介绍了类内离散因子的计算方式:;式中,为字符(S)的类内离散因子;为预处理后历史URL数据集(中间URL数据)中出现字符(S)的概率;为出现字符(S)的历史URL字符串S串;为预处理后的历史URL数据总数;越大,表示字符(S)在URL类内的频率越异常,类内离散度越高。例如,正常URL字符串里字符(id)出现稳定,恶意URL字符串里字符(id)出现频率忽高忽低,相应的就大。
[0118] 在一些示例中,若脱敏处理后的历史URL数据集中包括多条脱敏后的历史URL数据,则采用上述S302步骤对每一条历史URL数据进行字符串切割、字符特征提取处理,直至完成对全部脱敏后的历史URL数据进行字符串切割和字符特征提取处理,得到历史URL特征数据集(也即,中间URL数据)。
[0119] S302、将历史Web数据的第一时序特征,与中间URL数据的字符特征进行时序特征对齐、并对进行时序特征对齐得到的时序特征向量进行坐标系转换得到目标时序特征向量。
[0120] 在一些示例中,根据历史Web数据的第一时序特征(例如,访问时间戳、频次等),与历史URL数据的字符特征(长度异常值P1、字符分布异常值P2、异常类型相关系数P3、字符串关联系数P4等)进行时序特征对齐,得到笛卡尔坐标系下的时序特征向量。利用反余弦函数将笛卡尔坐标系下的时序特征向量映射到极坐标系,得到极坐标系下的时序特征向量(目标时序特征向量)。
[0121] 示例性的,可以采用下式对笛卡尔坐标系下的时序特征向量进行极坐标系的映射,完成坐标系转换,得到极坐标系下的时序特征向量(目标时序特征向量)。
[0122] ;式中,为第二数据的反余弦参数;为第二数据的距离参数;为第二数据的时间步长,;为正则化极坐标系统扩张常数因子;j为指示量;N为历史URL特征数据集(中间URL数据)中的历史URL特征数据总数。
[0123] S303、对目标时序特征向量进行维度转换处理,得到第二数据。
[0124] 将极坐标系下的时序特征向量分别放入格拉曼角差场与格拉曼角和场中,将极坐标系下的时序特征向量转换为N×N的二维图像数据(第二数据),该二维图像数据的像素值融合了P1~P4的字符特征和第一时序特征。
[0125] 其中,格拉曼角差场与格拉曼角和场公式为:;式中,为格拉曼角差场函数与格拉曼角和场函数。
[0126] I为单位行向量。
[0127] 为的导数;为的导数;GADF突出数据间的差异特征。例如,P1~P4异常值突变、时序特征的波动差,可捕捉恶意攻击的突发异常模式(某时刻字符分布异常骤增)。
[0128] GASF强调数据间的协同特征。例如,P1~P4异常的连续关联、时序特征的趋势同步,能识别恶意攻击的持续异常模式(如高频请求+异常字符的组合时序)。
[0129] 本申请实施例还提供了利用第二数据训练待训练第一预测模型的实施方式,包括以下步骤:S401、利用注意力机制,确定第二数据的局部区域特征;其中,局部区域特征与恶意攻击模型相关。
[0130] 在一些示例中,如上述实施例中介绍的第一预测模型的注意力机制层的处理方式所示,计算二维图像数据中每个区域(如字符组合所在的矩阵区块)与已知恶意攻击模式(如SQL注入的"UNION SELECT”片段、跨站脚本的"<script>”标签)的相似度。并且,为高匹配度区域分配更高注意力权重,从而精准提取如异常代码字符片段、高频访问时间窗口等局部区域特征。
[0131] 在一些实施方式中,注意力机制可以是指多头注意力机制,多头注意力机制的数学表达形式可以参考下式所示:;式中,为多头注意力函数;为拼接函数;为单头注意力值;为单头注意力函数;为第h个二维图像数据的向量、向量、向量;为方向、方向、方向的值。
[0132] 为对应的权重;上式首先将每个二维图像数据拆分为一组(、、)向量。然后,对每组向量乘以对应权重。再然后,利用单头注意力函数计算相似度。最后,利用拼接函数拼接所有单头结果,得到融合多维度关联的特征,突出和异常攻击模式相关的局部区域特征。
[0133] S402、基于双向时序分析算法,对局部区域特征进行双向时序特征提取,得到局部区域特征对应的第二时序特征。
[0134] 在一些示例中,如上述实施例中介绍的第一预测模型的时序分析层的处理方式所示。分别沿第二数据的访问时间正序、逆序提取正向时序特征、逆向时序特征。然后,将正向时序特征和逆向时序特征进行特征合并得到第二时序特征。
[0135] 进一步的,本申请实施例还提供了对所述第二数据进行双向时序特征提取,得到所述局部区域特征的第二时序特征的实施方式:根据所述第二数据的访问时间顺序,提取所述局部区域特征的正向时序特征。根据所述第二数据的访问时间逆序,提取所述局部区域特征的逆向时序特征。对所述正向时序特征和所述逆向时序特征进行特征合并得到所述局部区域特征的第二时序特征。
[0136] 在一些实施例中,以双向时序分析算法的实现载体为双向门控单元Bi-GRU为例。双向门控单元包括两个常规的GRU(GRU1、GRU-2)和一个融合层。其中,GRU-1根据第二数据的访问时间顺序,提取所述局部区域特征的正向时序特征。GUR-2根据第二数据的访问时间逆序,提取所述局部区域特征的逆向时序特征。然后融合层将GUR-1输出的正向时序特征和GUR-2输出的逆向时序特征进行合并,输出第二时序特征。
[0137] S403、将第二时序特征和第二数据进行特征合并得到核心第二数据。
[0138] 在一些示例中,首先,对第二时序特征(经双向时序分析算法提取,含局部区域特征的正向 / 逆向时序信息)与二维图像数据(含P1~P4字符特征、第一时序特征的图像化数据)进行维度适配。通过全连接层的线性变换,将两类特征映射到相同维度的特征空间(例如均转换为512维特征向量),消除维度差异对合并的影响。然后,将维度统一后的第二时序特征与二维图像数据特征进行拼接,形成包含"动态时序异常信息(第二时序特征)+静态字符与基础时序异常信息(二维图像数据)”的联合特征向量。最后,通过全连接层的激活函数(如ReLU函数)对联合特征向量进行非线性变换,强化两类特征间的关联信息,最终输出整合后的高维特征(核心第二数据)。
[0139] S404、将核心第二数据映射到第一样本标签空间,得到第一映射关系。
[0140] 其中,所述第一映射关系表征所述核心第二数据对应的网页访问行为与第一样本标签空间包括的恶意攻击标签的关联程度。
[0141] 在一些示例中,如上述实施例中介绍的第一预测模型全连接层的处理方式所示,通过线性变换(如矩阵乘法运算),将核心第二数据映射到预设的第一样本标签空间。其中,第一样本标签空间包含恶意攻击标签(如"SQL注入攻击”"跨站脚本攻击”"分布式拒绝服务攻击”"恶意爬虫攻击”标签)及正常访问标签,每个标签对应一类网页访问行为模式。
[0142] S405、根据第一映射关系,对待训练第一预测模型进行训练,得到第一预测模型。
[0143] 在一些示例中,如上述实施例中介绍的第一预测模型的训练方式所示:首先,将第一映射关系(核心第二数据与各标签的匹配概率分布),与人工标注的真实标签进行对比,通过损失函数计算两者的差异,得到训练误差。
[0144] 然后,将计算出的训练误差,通过反向传播算法逐层传递至待训练第一预测模型的前序网络层(包括全连接层、时序分析层、注意力机制层、维度转换层),各层根据误差反馈调整自身参数(如注意力机制层的权重、时序分析层Bi-GRU / Bi-LSTM的门控参数、维度转换层的维度映射参数)。
[0145] 重复"输入核心第二数据、生成第一映射关系、计算误差、反向传播调参”的迭代过程,使得待训练第一预测模型预测结果与真实标签的误差逐渐减小,当误差低于预设阈值(如0.01)或迭代次数达到设定上限时,待训练第一预测模型收敛,最终得到第一预测模型。
[0146] 本申请实施例还提供了确定第四数据的实施方式,包括:S501、根据所述第二数据,对所述历史Web数据进行结构化转换处理,得到中间Web数据。
[0147] 在一些示例中,首先,提取第二数据中的字符特征。包括P1(长度异常值)、P2(字符分布异常值)、P3(异常类型相关系数)、P4(字符关联系数),以及关联的第一时序特征(访问时间戳、访问频次),明确矩阵构建的基础数据维度。
[0148] 然后,以历史Web访问的单次请求为矩阵行索引(即每行对应一次独立的Web访问行为),以第二数据特征项+时序特征项为矩阵列索引(如列1为P1、列2为P2、列3为P3、列4为P4、列5为访问时间戳、列6为访问频次等),确定历史Web访问流量数据矩阵(以下简称历史Web矩阵)的结构框架。
[0149] 最后,将单次Web访问对应的P1~P4特征及时序特征,按行 / 列对应关系填充至矩阵中。对矩阵内所有特征值进行归一化处理,消除不同特征量级差异,最终形成历史Web矩阵,该矩阵即为中间Web数据的核心表现形式。
[0150] S502、对中间Web数据进行冗余信息过滤、归一化处理,得到第四数据。
[0151] 在一些示例中,获取历史Web矩阵行向量之间的行向量相关系数,并根据行向量相关系数,对历史Web矩阵进行数据筛选,得到筛选后历史Web矩阵。
[0152] 采用下式获取行向量相关系数:;式中,为历史Web矩阵行向量的行向量相关系数。
[0153] 为的具体值;为的均值;为的标准差;为的指示量;若历史Web数据行向量的行向量相关系数大于0.7,则将其中一条进行删除,实现冗余信息过滤。
[0154] 对筛选后历史Web矩阵进行归一化处理,得到预处理后历史Web矩阵。
[0155] 为历史Web矩阵行向量。其中,v为指示量、V为历史Web矩阵行向量维度,为中第v个参数。
[0156] 可以采用下式对筛选后历史Web矩阵进行归一化处理:;式中,为归一化处理后历史Web矩阵行向量的第v个参数;为的均值。
[0157] 如图7所示,本申请实施例还提供了训练待训练第二预测模型的实施例,包括以下步骤:S601、基于多层深度置信神经网络对第四数据进行逐层处理,得到与异常访问行为相关的中间第四数据。
[0158] 在一些示例中,多层深度置信神经网络的实现方式可以为五层受限玻尔兹曼机(RBM)。
[0159] 多层学习目标函数的公式为:;式中,为RBM的能量函数;为RBM相关参数;为可见层与隐含层的神经元之间的连接权值;分别为隐含层、可见层的偏置参数;分别为可见层神经元能量、隐含层神经元能量;均为神经元指示量,其中,;多层深度置信神经网络(五层RBM)通过能量函数描述可见层和隐含层神经元能量关系,经过逐层堆叠RBM,对比散度优化参数,从第四数据中提取与异常访问关联的深度特征,最终输出中间第四数据。
[0160] S602、基于双向时序分析算法,对中间第四数据进行双向时序特征提取,得到中间第四数据在时间维度的核心第四数据。
[0161] 在一些示例中,可采用双向长短期记忆(Bi-LSTM)算法对中间第四数据进行双向时序特征提取。
[0162] 首先,将中间第四数据按历史Web访问的时间戳顺序排列,形成时序特征序列。然后,将时序特征序列输入Bi-LSTM网络,正向LSTM分支从访问时间正序方向学习时序依赖,逆向LSTM分支从访问时间逆序方向学习时序关联。两个分支分别输出正向时序特征与逆向时序特征。最后,将Bi-LSTM输出的正向、逆向时序特征进行拼接与非线性变换(如通过激活函数整合),得到同时包含双向时序信息的核心第四数据。
[0163] S603、将核心第四数据映射到第二样本标签空间,得到第二映射关系。
[0164] 第二映射关系表征核心第四数据对应的网页访问行为与异常访问行为模式的关联程度。
[0165] 在一些示例中,如上述实施例中介绍的第二预测模型全连接层的处理方式所示:通过线性变换(如矩阵运算),将核心第四数据映射到预设的第二样本标签空间。其中,第二样本标签包括异常访问行为标签(例如,"暴力破解访问”"恶意爬虫访问”"异常IP高频访问”"跨站请求伪造访问”等),这些标签分别对应不同类型的异常网页访问行为模式,与正常访问标签共同构成完整的第二样本标签空间。
[0166] S604、根据第二映射关系,对待训练第二预测模型进行训练,得到第二预测模型。
[0167] 在一些示例中,如上述实施例中介绍的第二预测模型的训练方式所示:首先,将第二映射关系(核心第四数据与各标签的匹配概率分布)与人工标注的真实标签进行对比,采用交叉熵损失函数计算两者的误差(预测值与真实值的差异)。
[0168] 然后,将计算出的误差通过反向传播算法,逐层传递至第二预测模型的各前序网络(时序分析层、多层深度置信神经网络层、全连接层),各前序网络根据误差反馈调整自身网络参数(如时序分析层的Bi-LSTM的门控参数、多层深度置信神经网络层RBM的连接权值、全连接层的映射权重)。
[0169] 重复"输入核心第四数据、生成第二映射关系、计算误差、反向传播调参”的迭代过程,直至待训练第二预测模型预测误差低于预设阈值或迭代次数达到设定上限。最终得到第二预测模型。
[0170] 进一步的,本实施例提供了一种网页访问行为检测装置,如图8所示,该装置包括:确定模块810、预测模块820,其中:确定模块810,被配置为基于待检测统一资源定位符URL数据和待检测网页访问流量Web数据,确定第一数据;预测模块820,被配置为将第一数据输入第一预测模型,得到第一预测结果;第一预测结果用于表征第一数据对应的网页访问行为与恶意攻击的关联程度;其中,第一预测模型基于第二数据训练得到;第二数据基于历史URL数据和历史Web数据确定。
[0171] 在一些示例中,确定模块810还被配置为对历史URL数据进行预处理,得到中间URL数据;中间URL数据包括字符特征;将历史Web数据的第一时序特征,与中间URL数据的字符特征进行时序特征对齐;并对进行时序特征对齐得到的时序特征向量进行坐标系转换得到目标时序特征向量;对目标时序特征向量进行维度转换处理,得到第二数据。
[0172] 在一些示例中,预测模块820还被配置为利用注意力机制,确定第二数据的局部区域特征;局部区域特征与恶意攻击模式相关;基于双向时序分析算法,对局部区域特征进行双向时序特征提取,得到局部区域特征对应的第二时序特征;将第二时序特征和第二数据进行特征合并得到核心第二数据;将核心第二数据映射到第一样本标签空间,得到第一映射关系;第一映射关系表征核心第二数据对应的网页访问行为与第一样本标签空间包括的恶意攻击标签的关联程度;根据第一映射关系,对待训练第一预测模型进行训练,得到第一预测模型。
[0173] 在一些示例中,预测模块820还被配置为根据第二数据的访问时间顺序,提取局部区域特征的正向时序特征;根据第二数据的访问时间逆序,提取局部区域特征的逆向时序特征;对正向时序特征和逆向时序特征进行特征合并得到局部区域特征对应的第二时序特征。
[0174] 在一些示例中,确定模块810还被配置为根据第一数据,对待检测Web数据进行预处理,得到第三数据;预测模块820还被配置为,将第三数据输入第二预测模型,得到第二预测结果;第二预测结果用于表征第三数据对应的网页访问行为与异常访问行为的关联程度;其中,第二预测模型是基于第四数据训练得到的;第四数据是根据第二数据,对历史Web数据进行预处理得到的。
[0175] 在一些示例中,预测模块820还被配置为基于多层深度置信神经网络对所述第四数据进行逐层处理,得到与异常访问行为相关的中间第四数据;基于双向时序分析算法,对所述中间第四数据进行双向时序特征提取,得到所述中间第四数据在时间维度的核心第四数据;将所述核心第四数据映射到第二样本标签空间,得到第二映射关系;所述第二映射关系表征所述核心第四数据对应的网页访问行为与所述第二样本标签空间包括的异常访问行为标签的关联程度;根据所述第二映射关系,对待训练第二预测模型进行训练,得到所述第二预测模型。
[0176] 在一些示例中,装置还包括执行模块,执行模块被配置为在第一预测结果为恶意攻击行为的情况下,生成控制指令;控制指令被配置为终止第一数据所属应用程序进程的网络访问权限。
[0177] 在一些示例中,执行模块还被配置为在第二预测结果为异常访问行为的情况下,生成警告指令。
[0178] 在一些示例中,执行模块还被配置为记录检测到异常访问行为的数量;在预设时间窗口内,若检测到异常访问行为的数量大于预设阈值,则生成控制指令。
[0179] 需要说明的是,本实施例提供的一种网页访问行为检测装置所涉及各功能单元的其它相应描述,可以参考上述实施例对网页访问行为检测方法的描述,在此不再赘述。
[0180] 基于上述实施例所示的网页访问行为检测方法,相应的,本实施例还提供了一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时实现上述如上述实施例所示的方法。
[0181] 基于上述实施例所示方法,相应的,本实施例还提供了一种计算机程序产品,其上存储有计算机程序,该计算机程序产品被处理器执行时实现上述如上述实施例所示的方法。
[0182] 基于这样的理解,本申请的技术方案可以以软件产品的形式体现出来,该软件产品可以存储在一个非易失性存储介质(可以是CD-ROM,U盘,移动硬盘等)中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器200,或者网络设备等)执行本申请各个实施场景的方法。
[0183] 基于上述实施例所示的方法,以及图8所示的虚拟装置实施例,为了实现上述目的,本申请实施例还提供了一种电子设备,如终端设备100等,该电子设备包括存储介质和处理器;存储介质,用于存储计算机程序;处理器,用于执行该计算机程序以实现上述实施例所示的方法。
[0184] 可选的,上述实体设备还可以包括用户接口、网络接口、摄像头、射频(RadioFrequency,RF)电路,传感器、音频电路、WI-FI模块等等。用户接口可以包括显示屏(Display)、输入单元比如键盘(Keyboard)等,可选用户接口还可以包括USB接口、读卡器接口等。网络接口可选的可以包括标准的有线接口、无线接口(如WI-FI接口)等。
[0185] 本领域技术人员可以理解,本实施例提供的上述实体设备结构并不构成对该实体设备的限定,可以包括更多或更少的部件,或者组合某些部件,或者不同的部件布置。
[0186] 存储介质中还可以包括操作系统、网络通信模块。操作系统是管理上述实体设备硬件和软件资源的程序,支持信息处理程序以及其它软件和 / 或程序的运行。网络通信模块用于实现存储介质内部各组件之间的通信,以及与信息处理实体设备中其它硬件和软件之间通信。
[0187] 通过以上的实施方式的描述,本领域的技术人员可以清楚地了解到本申请可以借助软件加必要的通用硬件平台的方式来实现,也可以通过硬件实现。与目前相关技术相比,本申请实施例利用历史URL数据和历史Web数据训练得到第一预测模型。由于历史URL数据可提供URL字符结构、参数配置等静态字符特征。历史Web数据可提供访问流量波动、访问间隔等动态行为特征。利用历史URL数据以及历史Web数据构建的第二数据可从静态字符特征与动态行为特征的双重维度反映恶意攻击模式。利用第一预测模型学习第二数据与恶意攻击模式的关联规律,可精准预测第一数据对应的网页访问行为与恶意攻击行为的关联程度,得到预测结果。本申请实施例既避免了依赖单一维度数据导致的漏检、误检,又充分挖掘了历史网页访问行为中隐含的恶意攻击模式,进而能够提升网页恶意攻击检测精度,保障网页数据安全与用户访问安全。
[0188] 进一步的,本申请实施例利用第四数据(包含历史URL数据和历史Web数据)训练得到第二预测模型。由于第四数据既保留了历史Web数据中与异常访问相关的动态行为特征(如访问频次、流量波动、IP集群协同规律),又关联了历史URL数据的静态字符特征(如异常参数结构、恶意跳转链接的字符模式),能够从静态字符特征与动态行为特征双重维度完整刻画异常访问模式。利用第二预测模型学习第四数据与异常访问行为的关联规律,可精准捕捉异常访问的深层特征与时间维度的动态依赖关系,有效识别复杂异常模式(如伪装成正常流量的低频协同攻击、跨URL的异常跳转序列),既降低了对正常业务访问的误判率,又能与第一预测模型形成协同防护,全面提升网页访问行为检测的准确性与全面性。
[0189] 需要说明的是,在本文中,诸如"第一”和"第二”等之类的关系术语仅仅用来将一个实体或者操作与另一个实体或操作区分开来,而不一定要求或者暗示这些实体或操作之间存在任何这种实际的关系或者顺序。而且,术语"包括”、"包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、物品或者设备不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、物品或者设备所固有的要素。在没有更多限制的情况下,由语句"包括一个……”限定的要素,并不排除在包括所述要素的过程、方法、物品或者设备中还存在另外的相同要素。
[0190] 以上所述仅是本申请的具体实施方式,使本领域技术人员能够理解或实现本申请。对这些实施例的多种修改对本领域的技术人员来说将是显而易见的,本文中所定义的一般原理可以在不脱离本申请的精神或范围的情况下,在其它实施例中实现。因此,本申请将不会被限制于本文所述的这些实施例,而是要符合与本文所申请的原理和新颖特点相一致的最宽的范围。< / script>
Claims
1. A method for detecting webpage access behavior, characterized in that, include: Based on the URL data of the Uniform Resource Locator (URL) to be detected and the Web data of the web page access traffic to be detected, the first data is determined; The first data is input into the first prediction model to obtain the first prediction result; the first prediction result is used to characterize the degree of correlation between the webpage access behavior corresponding to the first data and the malicious attack behavior. The first prediction model is trained based on the second data; The second data is determined based on historical URL data and historical web data.
2. The method according to claim 1, characterized in that, The method includes: The historical URL data is preprocessed to obtain intermediate URL data; the intermediate URL data includes character features. The first temporal feature of the historical Web data is aligned with the character feature of the intermediate URL data; and the temporal feature vector obtained by temporal feature alignment is transformed into a coordinate system to obtain the target temporal feature vector. The target temporal feature vector is subjected to dimensionality transformation to obtain the second data.
3. The method according to claim 2, characterized in that, The method includes: An attention mechanism is used to determine local region features of the second data; these local region features are related to malicious attack patterns. Based on the bidirectional temporal analysis algorithm, bidirectional temporal feature extraction is performed on the local region features to obtain the second temporal feature corresponding to the local region features; The second time-series feature and the second data are combined to obtain the core second data; The core second data is mapped to the first sample tag space to obtain a first mapping relationship; the first mapping relationship characterizes the degree of association between the webpage access behavior corresponding to the core second data and the malicious attack tags included in the first sample tag space; Based on the first mapping relationship, the first prediction model to be trained is trained to obtain the first prediction model.
4. The method according to claim 3, characterized in that, The method of performing bidirectional temporal feature extraction on the second data to obtain the second temporal feature of the local region features includes: Based on the access time order of the second data, extract the positive temporal features of the local region features; Based on the reverse access time of the second data, the reverse temporal features of the local region are extracted; The positive and negative temporal features are merged to obtain the second temporal feature corresponding to the local region feature.
5. The method according to any one of claims 1-4, characterized in that, The method further includes: Based on the first data, the Web data to be detected is preprocessed to obtain the third data; The third data is input into the second prediction model to obtain the second prediction result; the second prediction result is used to characterize the degree of correlation between the webpage access behavior and the abnormal access behavior corresponding to the third data. The second prediction model is trained based on the fourth data; the fourth data is obtained by preprocessing the historical Web data based on the second data.
6. The method according to claim 5, characterized in that, The method includes: The fourth data is processed layer by layer based on a multi-layer deep belief neural network to obtain intermediate fourth data related to abnormal access behavior. Based on the bidirectional time series analysis algorithm, bidirectional time series features are extracted from the intermediate fourth data to obtain the core fourth data in the time dimension of the intermediate fourth data. The core fourth data is mapped to the second sample tag space to obtain a second mapping relationship; the second mapping relationship characterizes the degree of correlation between the webpage access behavior corresponding to the core fourth data and the abnormal access behavior tags included in the second sample tag space; Based on the second mapping relationship, the second prediction model to be trained is trained to obtain the second prediction model.
7. The method according to claim 6, characterized in that, The second prediction result includes abnormal access behavior and normal access behavior; the method includes: If the second prediction result indicates the abnormal access behavior, a warning instruction is generated; Record the number of such abnormal access behaviors detected; If the number of abnormal access behaviors detected within a preset time window exceeds a preset threshold, the control command is generated.
8. A webpage access behavior detection device, characterized in that, include: The determination module is configured to determine the first data based on the URL data of the Uniform Resource Locator (URL) to be detected and the Web data of the web page access traffic to be detected. The prediction module is configured to input the first data into a first prediction model to obtain a first prediction result; the first prediction result is used to characterize the degree of correlation between the webpage access behavior corresponding to the first data and the malicious attack behavior. The first prediction model is trained based on the second data; The second data is determined based on historical URL data and historical web data.
9. A computer-readable storage medium having a computer program stored thereon, characterized in that, When the computer program is executed by a processor, it implements the method of any one of claims 1 to 7.
10. An electronic device comprising a storage medium, a processor, and a computer program stored on the storage medium and executable on the processor, characterized in that, When the processor executes the computer program, it implements the method of any one of claims 1 to 7.
Citation Information
Patent Citations
Hierarchical phishing website detection method based on deep learning
CN110602113A
Web application attack detection method
CN110798488A
Malicious URL detection method based on URL imaging technology
CN111159588A
Malicious machine traffic identification method and system
CN114422168A
Webpage security monitoring method, computer program product, equipment and storage medium
CN119760717A