HTML information extraction method, device, equipment and medium based on multi-LoRA cascade strategy
Through the HTML information extraction method of multi-LoRA cascade strategy, combined with table processing and key information extraction adapter, the information extraction problem of semi-structured HTML documents under dynamic web page templates is solved, efficient and accurate data extraction and integration is achieved, and JSON format data that conforms to business logic is generated.
Patent Information
- Application Number
- CN202510757602.X
- Authority / Receiving Office
- CN · China
- Patent Type
- Patents(China)
- Current Assignee / Owner
- Filing Date
- 2025-06-09
- Publication Date
- 2025-08-22
- Estimated Expiration
- 2045-06-09
AI Technical Summary
The prior art is difficult to adapt to dynamically changing web templates when processing semi-structured HTML documents, with high maintenance costs, insufficient generalization capabilities of machine learning models, and lack of cross-label area association understanding, resulting in incomplete information extraction and weak contextual reasoning capabilities.
The multi-LoRA cascade strategy is adopted, and the LoRA adapter is extracted through a large language model by combining table processing LoRA adapter and key information, and the multi-dimensional table and text mixing structure is dynamically processed to generate multi-layer nested JSON format data that conforms to business logic.
It improves the accuracy and completeness of information extraction, enhances the adaptability to dynamic web templates, reduces the need for manual intervention, facilitates file storage and subsequent business system calls, and improves data availability and processing efficiency.
Smart Images

Figure CN120296275B_ABST
Abstract
Description
Technical Field
[0001] The present invention relates to the technical field of HTML information extraction, and in particular to a method, device, equipment and medium for extracting HTML information based on a multi-LoRA cascade strategy. Background Art
[0002] Information extraction from semi-structured HTML documents is a key research area in natural language processing, with increasing demand for applications in industries such as biomedicine and finance. These documents often contain complex nested tables, mixed text structures, and multi-dimensional data formats, requiring the extraction of logically related key-value pairs from non-pure text elements. With the surge in internet data volumes, effectively handling dynamically changing web page templates while maintaining the integrity of extraction results has become a pressing technical challenge in practical applications.
[0003] Current mainstream approaches include rule-based matching, machine learning, and deep learning. Rule-based approaches extract domain-specific information by manually designing matching rules for text snippets, while machine learning methods such as KNN-IE utilize structural similarity metrics and K-nearest neighbor techniques to build classification frameworks. Deep learning architectures, such as the Transformer, map input text to structured outputs through end-to-end learning. Models such as ERNIE3.0TITAN improve relation extraction performance through self-supervised contrastive learning. These methods enable the extraction of structured data in various scenarios.
[0004] Existing technologies still have significant limitations in practical applications. Traditional rule-based methods require customized matching rules for different web page templates, making it difficult to adapt to dynamically changing page structures, resulting in excessively high maintenance costs. Machine learning models rely on large amounts of manually annotated data, lack generalization capabilities when dealing with new HTML structures, and face the risk of truncation when processing long texts. Although deep learning methods can capture local semantic features, they lack the ability to understand cross-label region correlations, and are prone to missing key information when processing mixed multidimensional table and text data. In addition, existing solutions generally have weak contextual reasoning capabilities, making it difficult to effectively integrate semantic information scattered across different levels of HTML. Summary of the Invention
[0005] The present invention provides an HTML information extraction method, apparatus, device and medium based on a multi-LoRA cascade strategy to improve at least one of the above technical problems.
[0006] In a first aspect, the present invention provides an HTML information extraction method based on a multi-LoRA cascade strategy, which is suitable for execution by a large language model equipped with a text processing logic module, a table processing LoRA adapter, a key information extraction LoRA adapter and a nested structured generation module.
[0007] The information extraction method comprises:
[0008] S1. Get the HTML document and input it into the large language model.
[0009] S2. The large language model determines whether the HTML document contains a table.
[0010] S3. If the HTML document contains a table, the table processing LoRA adapter is called to perform structured extraction on the table content and convert it into a pseudo-natural language description, and the text processing logic module is called to extract the adjacent text context of the table, and then perform semantic integration to obtain the first text information.
[0011] S4. If the HTML document does not contain a table, the text processing module of the table processing LoRA adapter is called to extract the text content and retain the original paragraph structure to obtain the first text information.
[0012] S5. Call the key information extraction LoRA adapter to extract structured key-value pairs from the first text information based on a predefined field list, and generate flattened JSON data according to the structured key-value pairs.
[0013] S6. Call the nested structured generation module to convert the JSON data into a target sequence in a multi-layer nested JSON format that conforms to the business logic, so as to store it in the file system to support subsequent business system calls.
[0014] As a further solution of the present invention, the text processing logic module is used to perform the following steps:
[0015] Parse the HTML structure, identify and remove non-text elements and additional information irrelevant to semantics. Non-text elements include <script>和<style>标签内的内容。附属信息包括广告、导航栏和版权声明。
[0016] 提取主体结构中的文本节点,保留与语义关联紧密的内容,以及结构清晰的纯文本片段,作为后续模型处理的输入。
[0017] 作为本发明的进一步方案,表格处理LoRA适配器的微调过程为:
[0018] 加载预训练大语言模型(LLM)并冻结其基础权重,仅启用表格处理LoRA适配器的低秩矩阵参数和进行训练。其中,为分解后的基矩阵、为分解后的系数矩阵、为表格处理LoRA适配器的权重矩阵。
[0019] 输入第一训练数据和第一训练指令。
[0020] 以将多维度交叉的表格内容转换为符合逻辑的文本信息为优化目标,采用反向传播更新表格处理LoRA适配器参数。
[0021] 作为本发明的进一步方案,反向传播更新表格处理LoRA适配器参数的步骤为:
[0022] 根据所述第一训练数据、第一训练指令,以及模型输出的内容,生成第一序列概率分布。。式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素。
[0023] 根据所述第一序列概率分布计算第一损失函数。。式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注。
[0024] 根据所述第一损失函数更新和。。式中,为学习率、表示偏微分。
[0025] 根据更新后的和,更新启用表格处理LoRA适配器的大语言模型的权重。。式中,为启用表格处理LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第一训练数据。
[0026] 作为本发明的进一步方案,键信息提取LoRA适配器的微调过程包含:
[0027] 加载预训练大语言模型(LLM)并冻结其基础权重,仅激活关键信息提取LoRA适配器的低秩矩阵参数和进行微调。其中,为分解后的基矩阵、为分解后的系数矩阵、为键信息提取LoRA适配器的权重矩阵。
[0028] 输入第二训练数据和第二训练指令。
[0029] 以提高关键信息字段的提取准确率,以及确保输出符合格式规范为优化目标,通过真实标注字段与模型输出对比,反向传播更新键信息提取LoRA适配器参数。
[0030] 作为本发明的进一步方案,反向传播更新键信息提取LoRA适配器参数的步骤为:
[0031] 根据第二训练数据、第二训练指令,以及模型输出的内容,生成第二序列概率分布。
[0032] 。
[0033] 式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素。
[0034] 根据所述第二序列概率分布计算第二损失函数。。式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注。
[0035] 根据所述第二损失函数更新和。。式中,为学习率、表示偏微分。
[0036] 根据更新后的和,更新激活了关键信息提取LoRA适配器的大语言模型的权重。。式中,为激活了关键信息提取LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第二训练数据。
[0037] 作为本发明的进一步方案,第一训练数据为半结构化HTML格式的表格数据。第一训练数据包含多维度交叉的表格内容和结构信息。
[0038] 第一训练数据的预处理步骤包括:
[0039] 去除非文本元素。其中,所述非文本元素包括脚本、样式表和注释。
[0040] 删除重复或无关的HTML标签以及空白。
[0041] 检查数据是否完整,对于缺失的数据,根据网站原文的实际情况进行填充、删除或标记。
[0042] 作为本发明的进一步方案,第二训练数据为根据HTML文档训练数据提取得到的第一文本信息。第二训练数包含表格和上下文相关的文本信息。
[0043] 第二训练数据的预处理步骤包括:
[0044] 检测并修正删除文本中的乱码,识别并剔除多余的空格、换行符和无用的空白段落。
[0045] 对简短或不完整的句子或者段落,根据原始网站信息进行重构或扩展保证句子或者段落的逻辑连贯性。同时,确保文本遵循统一的格式标准。
[0046] 对于包含在文本中复杂的多维表格数据进行逻辑重构。
[0047] 确保数据集中的关键信息完整,对缺失的答案或文本信息进行补充或标记,并分析文本数据的逻辑一致性,确保文本内容在语义上连贯。
[0048] 作为本发明的进一步方案,第一训练指令包括F1至F5。
[0049] F1、仔细阅读表格内容,理解表格的结构和数据含义。
[0050] F2、分析表格中各属性及其关系,确定表格中的数值。
[0051] F3、根据属性键,将表格中的数据准确填入JSON格式,要求信息与原文一致,不改变原句。
[0052] F4、检查JSON格式的正确性,确保保留所有表格信息。
[0053] F5、全部使用中文,禁止生成表格数据以外的文字。
[0054] 作为本发明的进一步方案,第二训练指令包括角色定位、背景、目标、语义判断和工作流程。
[0055] 角色定位:信息抽取专家与数据结构化工程师。
[0056] 背景:用户需要从大量文本中精准提取预设领域的关键数据,并以标准JSON格式输出。
[0057] 目标:精确抽取35个预定义字段,输出标准JSON格式,同时保证字段顺序和格式严格符合规范,不生成多余字段,缺失字段填充null。
[0058] 语义判断:通过上下文判断字段相似词,确保抽取信息与字段定义完全匹配。
[0059] 工作流程:读取输入文本,进行预处理,按字段列表依次抽取信息,组织提取结果,格式化输出JSON。
[0060] 第二方面、本发明提供了一种半结构化HTML的信息抽取装置,用以执行第一方面任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法,其包含文档获取模块、表格判断模块、第一处理模块、第二处理模块、第三处理模块和第四处理模块。
[0061] 文档获取模块,用于获取HTML文档并输入大语言模型。
[0062] 表格判断模块,用于所述大语言模型判断HTML文档是否包含表格。
[0063] 第一处理模块,用于若HTML文档包含表格,则调用所述表格处理LoRA适配器对表格内容进行结构化提取并转换为伪自然语言描述,以及调用文本处理逻辑模块提取表格的相邻文本上下文,然后进行语义整合,获取第一文本信息。
[0064] 第二处理模块,用于若HTML文档不包含表格,则调用表格处理LoRA适配器的文本处理模块提取文本内容并保留原始段落结构,获取第一文本信息。
[0065] 第三处理模块,用于调用关键信息提取LoRA适配器,基于预定义的字段列表从所述第一文本信息中提取结构化键值对,并根据所述结构化键值对生成扁平化的JSON数据。
[0066] 第四处理模块,用于调用所述嵌套结构化生成模块,将所述JSON数据转化为符合业务逻辑的多层嵌套JSON格式的目标序列,以存储至文件系统支持后续业务系统调用。
[0067] 第三方面、本发明提供了一种半结构化HTML的信息抽取设备,其包括处理器、存储器,以及存储在所述存储器内的计算机程序。所述计算机程序能够被所述处理器执行,以实现第一方面任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法。
[0068] 第四方面、本发明提供了一种计算机可读存储介质。所述计算机可读存储介质包括存储的计算机程序,其中,在所述计算机程序运行时控制所述计算机可读存储介质所在设备执行如第一方面任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法。
[0069] 通过采用上述技术方案,本发明可以取得以下技术效果:
[0070] 本发明的基于多LoRA级联策略的HTML信息提取方法显著提升了半结构化HTML文档信息提取的准确性和完整性。通过多LoRA级联策略动态加载表格处理适配器和关键信息提取适配器,有效处理多维表格与文本混合结构,确保跨标签区域的语义关联信息被充分捕捉。大语言模型的上下文推理能力得到强化,解决了传统规则方法维护成本高和机器学习模型泛化不足的问题,输出连贯的伪自然语言描述和结构化键值对。
[0071] 该方法增强了系统对动态网页模板的适应能力,降低了人工干预需求。最终生成符合业务逻辑的多层嵌套JSON格式数据,便于文件存储和后续业务系统调用,提升了数据可用性和处理效率。整体上,该方法在生物医疗、金融等领域应用中实现了高效可靠的信息抽取性能。附图说明
[0072] 为了更清楚地说明本发明的技术方案,下面将对本发明的具体实施方式中所需要使用的附图作简单地介绍,应当理解,以下附图仅示出了本发明的某些具体实施方式,因此不应被看作是对范围的限定,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他相关的附图。
[0073] 图1是HTML信息提取方法的流程示意图。
[0074] 图2是HTML信息提取方法的逻辑框图。
[0075] 图3是HTML信息提取模型的训练逻辑图。具体实施方式
[0076] 下面将参照本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述。
[0077] 实施例一、请参阅图1至图3,本发明第一实施例提供一种基于多LoRA级联策略的HTML信息提取方法,其适于通过配备有文本处理逻辑模块、表格处理LoRA适配器、关键信息提取LoRA适配器和嵌套结构化生成模块的大语言模型来执行。
[0078] 优选的,文本处理逻辑模块用以执行步骤A1至步骤A2。A1、对HTML结构进行解析,识别并剔除非文本元素和与语义无关的附属信息。其中,非文本元素包括<script>和<style>标签内的内容。附属信息包括广告、导航栏和版权声明。A2、提取主体结构中的文本节点,保留与语义关联紧密的内容,以及结构清晰的纯文本片段,作为后续模型处理的输入。
[0079] 所述信息提取方法包含步骤S1至步骤S6。
[0080] S1、获取HTML文档并输入大语言模型。
[0081] S2、所述大语言模型判断HTML文档是否包含表格。
[0082] S3、若HTML文档包含表格,则调用所述表格处理LoRA适配器对表格内容进行结构化提取并转换为伪自然语言描述,以及调用文本处理逻辑模块提取表格的相邻文本上下文,然后进行语义整合,获取第一文本信息。
[0083] S4、若HTML文档不包含表格,则调用表格处理LoRA适配器的文本处理模块提取文本内容并保留原始段落结构,获取第一文本信息。
[0084] S5、调用关键信息提取LoRA适配器,基于预定义的字段列表从所述第一文本信息中提取结构化键值对,并根据所述结构化键值对生成扁平化的JSON数据。
[0085] S6、调用所述嵌套结构化生成模块,将所述JSON数据转化为符合业务逻辑的多层嵌套JSON格式的目标序列,以存储至文件系统支持后续业务系统调用。
[0086] 假设给定一个由个词组成的输入文本,所要提取的信息通常对应于文本段落中的一段连续的词或句子,表示为,其中和分别为该段连续词或句子的起始和结束位置,且。其中,表示第个词组、和分别表示第个和第个词组。
[0087] 对于每个输入文本(即:HTML文档),本实施例的一种基于LLMs的多LoRA级联策略的HTML信息提取方法的目标是从半结构化HTML中提取关键信息,并将其组织为一组具有逻辑关联的键值对,这些键值对最终被格式化为一个标准的JSON对象。每个键值对由预定义的键和提取的值组成。其中,是一个预定义的键标签集合。键集合表示为,值集合表示为。其中,表示第个键,表示第个值。每个JSON对象包含多个键值对,表示为。
[0088] 本实施例通过构建双通道处理机制,在大语言模型(简称:LLMs)的推理阶段,根据任务类型动态加载对应的子模型 / 模块。推理阶段模型输入的是原始的HTML文档,HTML文档包含文本信息(如段落、标题等非结构化内容)和 / 或以标签定义的表格数据(包括行、列及表头信息)。
[0089] 具体的,大语言模型首先通过解析HTML结构判断文档中是否存在表格标签。
[0090] 若检测到表格,模型调用表格处理LoRA适配器对表格内容进行结构化提取,将其转换为伪自然语言描述。例如,将"招标人:XXX”解析为"表格中‘招标人’字段对应的值为‘XXX’”。并调用文本处理逻辑模块提取表格的相邻文本上下文。然后将表格信息的伪自然语言描述及其相邻文本上下文进行语义整合,生成连贯的段落(如"工程名称为XXXXXX,招标人信息如下:XXX,联系人为XX”)(即:第一文本信息)。若未检测到表格,模型则直接提取文本内容并保留原始段落结构,确保输出(即:第一文本信息)的语义完整性。
[0091] 上述过程表示为:
[0092] 。
[0093] 式中,表示第一文本信息、表示第一整合操作、表示指令、表示输入文本。
[0094] 整合后的语义段落(即:第一文本信息)被输入至关键信息提取LoRA适配器进行关键信息提取模块。关键信息提取LoRA适配器基于预定义的字段列表(如"工程名称”"招标人”"招标联系人”等),从文本中提取结构化键值对。例如,工程名称匹配工程名称对应的值,并对表格解析后的伪自然语言进行上下文消歧义,解决字段重复或冲突问题(如多个招标人场景下基于位置或语义优先级合并)。然后,根据结构化键值对生成扁平化的标准JSON数据。其中,标准JSON数据包含明确的键值对信息,例如{"工程名称": "XXXXX", "招标人": "XXX"}。具体的,将第一文本信息输送给模型生成扁平化的JSON数据。
[0095] 关键信息提取LoRA适配器为:
[0096] 。
[0097] 式中,为扁平化的JSON数据、表示关键信息提取模型(即:关键信息提取LoRA适配器)、为第一文本信息。
[0098] 关键信息提取LoRA适配器专注于从文本处理逻辑模块和表格处理LoRA适配器整合产生的第一文本信息中抽取关键信息。通过关键信息提取LoRA适配器在有限的数据资源下完成半结构化HTML信息抽取任务。
[0099] 最后模型通过嵌套结构化生成模块将扁平化的标准JSON数据转换为符合业务逻辑的层级化格式。转换完成后,嵌套JSON数据将被持久化存储至文件系统,支持后续业务系统调用。具体的,该模块依据预定义的字段分组规则(如将"招标人”和"招标联系人”归入"招标人组”父字段),将键值对按层级关系重组。例如,输入{"键2": "值3", "键3": "值4", "键4": "值5"}可映射为嵌套结构{"父字段": {"键2": "值3", "子字段组": {"键3": "值4", "键4": "值5"}}}。
[0100] 整个过程通过异常处理机制(如复杂表格的备用解析策略、字段缺失日志记录)保障鲁棒性,确保从原始HTML到结构化输出的完整性与可靠性。
[0101] 这一结构化过程表示为:
[0102] 。
[0103] 式中,表示输出的层级化格式、表示第二整合操作、表示预设字段列表模板、为扁平化的JSON数据。
[0104] 扁平化的JSON数据转换成符合要求的多层嵌套JSON格式的层级化格式,这一结构化过程不仅确保了输出内容的准确性和完整性,而且使得最终生成的JSON数据结构丰富,语义信息充沛,极大地提升了数据的可用性和共享性,为后续的数据分析和应用提供了便利。
[0105] 传统基于规则方法在面对复杂页面结构时,无法灵活处理不同的网页模板,需为每种网页模板单独设计规则的问题。此外,传统模型在处理复杂文本时,模型无法理解文本的上下文关系,难以抽取跨标签、跨区域关联信息,从而破坏数据完整性。
[0106] 针对上述不足,本实施例提出了一种基于LLMs的多LoRA级联策略的HTML信息提取方法(简称:CMLAS方法)。该方法通过两个专门设计的多个子模型分别处理多维表格与文本整合处理任务和文本信息抽取任务,有效提升模型对多样化HTML文本数据、不同数据格式和结构的理解能力。
[0107] 本实施例构建双通道处理机制,根据任务类型动态加载对应的子模型。多维表格与文本整合处理任务激活表格处理LoRA适配器处理HTML文档的多维结构特征。文本信息抽取任务则启用关键信息提取LoRA适配器进行关键信息提取。同时融入指令提示,提升模型对于半结构化HTML文本信息的理解能力,从而高效地完成信息抽取任务。
[0108] 本实施例利用LLMs的丰富语义理解能力,充分挖掘LLMs的上下文推理能力与关系推理优势,有效捕捉文本信息存在的逻辑关联与依赖关系,从而实现跨标签、跨区域的关键信息提取。
[0109] 本实施例提出了一种专门为半结构化HTML信息抽取任务设计的模型框架,如图2和图3所示。模型框架基于本实施例提出的基于多LoRA级联策略的HTML信息提取方法(简称:CMLAS方法),其依赖于流式输出的问答模式。
[0110] 具体来说,本实施例为多维表格和文本信息抽取任务分别设计独立的表格处理LoRA适配器和关键信息提取LoRA适配器。LoRA适配器通过结合特定的Prompt,在训练时,冻结大部分预训练权重,同时结合低秩矩阵更新少部分参数,从而实现梯度更新。表格处理LoRA适配器用于处理输入的原始半结构化HTML文档信息的对多维的表格数据进行处理,文本处理逻辑模块用于对原始半结构化HTML文档信息的文本数据进行处理,二者处理后的数据整合为完整的第一文本信息输入到关键信息提取LoRA适配器。关键信息提取LoRA适配器专注于从第一文本信息中抽取关键信息。
[0111] 通过构建双通道处理机制,根据任务类型动态加载表格处理LoRA适配器,实现模型对半结构化HTML进行关键信息提取。然后采用预设字段列表模板,将模型预测输出的扁平化的JSON数据转换成符合要求的多层嵌套JSON格式的输出目标序列。
[0112] 在上述实施例的基础上,本发明的一个可选地实施例中,所述表格处理LoRA适配器和所述关键信息提取LoRA适配器通过微调训练得到。
[0113] 如图3所示,为了提升LLMs对信息抽取任务的表现,模型微调训练分为两个不同阶段。在LLMs微调训练的第一阶段,对表格处理LoRA适配器进行微调训练。在LLMs微调训练的第二阶段,对关键信息提取LoRA适配器进行训练。
[0114] 表格处理LoRA适配器的微调过程包含步骤B1至步骤B3。
[0115] B1、加载预训练大语言模型(LLM)并冻结其基础权重,仅启用表格处理LoRA适配器的低秩矩阵参数和进行训练。其中,为分解后的基矩阵、为分解后的系数矩阵、为表格处理LoRA适配器的权重矩阵。
[0116] 具体的,权重矩阵可以通过两个较小的矩阵和的乘积来近似表示,即:。捕捉了原始权重矩阵中的主要变化方向或模式。决定了这些基如何组合以最佳地近似原始权重矩阵。
[0117] B2、输入第一训练数据和第一训练指令。
[0118] B3、以将多维度交叉的表格内容转换为符合逻辑的文本信息为优化目标,采用反向传播更新表格处理LoRA适配器参数。优选的,步骤B3具体包括步骤S31至步骤B34。
[0119] B31、根据所述第一训练数据、第一训练指令,以及模型输出的内容,生成第一序列概率分布。
[0120] 。
[0121] 式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素。
[0122] B32、根据所述第一序列概率分布计算第一损失函数。
[0123] 。
[0124] 式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注。
[0125] B33、根据所述第一损失函数更新和。
[0126] 。
[0127] 式中,为学习率、表示偏微分。
[0128] B34、根据更新后的和,更新启用表格处理LoRA适配器的大语言模型的权重。。式中,为启用表格处理LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第一训练数据。
[0129] 表格处理LoRA适配器的微调训练的目标是使表格处理LoRA适配器能够准确理解并结构化复杂表格内容。从而能够对输入HTML表格数据处理,然后后生成的标准JSON格式文本,完整且结构化地表达表格中的所有信息。
[0130] 键信息提取LoRA适配器的微调过程包含步骤C1至步骤C3。
[0131] C1、加载预训练大语言模型(LLM)并冻结其基础权重,仅激活关键信息提取LoRA适配器的低秩矩阵参数和进行微调。其中,为分解后的基矩阵、为分解后的系数矩阵、为键信息提取LoRA适配器的权重矩阵。
[0132] C2、输入第二训练数据和第二训练指令。
[0133] C3、以提高关键信息字段的提取准确率,以及确保输出符合格式规范为优化目标,通过真实标注字段与模型输出对比,反向传播更新键信息提取LoRA适配器参数。优选的,步骤C3具体包括步骤C31至步骤C34。
[0134] C31、根据第二训练数据、第二训练指令,以及模型输出的内容,生成第二序列概率分布。
[0135] 。
[0136] 式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素。
[0137] C32、根据所述第二序列概率分布计算第二损失函数。
[0138] 。
[0139] 式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注。
[0140] C33、根据所述第二损失函数更新和。
[0141] 。
[0142] 式中,为学习率、表示偏微分。
[0143] C34、根据更新后的和,更新激活了关键信息提取LoRA适配器的大语言模型的权重。。式中,为激活了关键信息提取LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第二训练数据。
[0144] 具体的,通过上述微调训练引导关键信息提取LoRA适配器生成符合期望的扁平化的JSON数据。在本实施例中,关键信息提取LoRA适配器输出的标准JSON格式的关键信息抽取结果,包含35个字段及对应内容,缺失字段为null。
[0145] 本发明实施例通过上述微调训练,使得LLMs会根据给定的Prompt学习任务范式和输出格式,构建端到端的序列预测能力。在推理阶段,模型能够有效解析输入文本的语义特征,生成符合逻辑结构的连贯输出,从而提升复杂文档处理场景下的信息抽取性能。
[0146] 由于LLMs在生成内容时采用的是自回归方式,且每个新元素的生成仅依赖于已生成的部分。因此,本实施例在模型微调训练时采用输入文本和指令,输出目标内容和来生成序列概率分布。上述第一损失函数和第二损失函数为根据序列概率分布计算得到的交叉熵损失函数。然后使用梯度更新根据损失值对低秩矩阵参数进行更新。最后根据更新后的低秩矩阵参数更新模型权重。
[0147] 在上述实施例的基础上,本发明的一个可选地实施例中,第一训练数据为半结构化HTML格式的表格数据。第一训练数据包含多维度交叉的表格内容和结构信息。
[0148] 在本实施例中,第一训练数据的预处理步骤包括D1至D3。
[0149] D1、去除非文本元素。其中,所述非文本元素包括脚本、样式表和注释等内容,这些内容通常不包含需要被抽取的信息。
[0150] D2、删除重复或无关的HTML标签以及大量空白,以简化文档结构及长度。
[0151] D3、检查数据是否完整,对于缺失的数据,根据网站原文的实际情况进行填充、删除或标记,以保证数据的完整性和逻辑一致性。
[0152] 具体的,对原始半结构化HTML的文本数据进行预处理的主要目标是清洗和转换原始HTML文本,以便从中提取有价值的信息。
[0153] 在上述实施例的基础上,本发明的一个可选地实施例中,第二训练数据为根据HTML文档训练数据提取得到的第一文本信息。第二训练数包含表格和上下文相关的文本信息。
[0154] 第二训练数据的预处理步骤包括步骤E1至步骤E4。
[0155] E1、检测并修正删除文本中的乱码,识别并剔除多余的空格、换行符和无用的空白段落。
[0156] E2、对简短或不完整的句子或者段落,根据原始网站信息进行重构或扩展保证句子或者段落的逻辑连贯性。同时,确保文本遵循统一的格式标准,例如日期、时间、货币和数值的表示方法。
[0157] E3、对于包含在文本中复杂的多维表格数据进行逻辑重构,以符合人类思维逻辑,以便于模型提取和分析。
[0158] E4、确保数据集中的关键信息完整,对缺失的答案或文本信息进行补充或标记,并分析文本数据的逻辑一致性,确保文本内容在语义上是连贯的。
[0159] 对于模型训练的第二训练数据,其预处理直接影响到抽取关键字段的质量和可靠性。具体来说,文本数据可能会存在乱码空白、无意义内容、格式错误和信息缺失等问题,有效的预处理能够提高数据的可用性和分析的准确性。
[0160] 本实施例提出多LoRA级联应用策略的信息提取方法,基于该方法构建了一个半结构化HTML信息抽取模型框架。模型需要理解多样式表格数据并且学习从输入序列中提取关键信息。模型微调时的指令Prompt依赖于指令微调框架,通过自然语言指令引导LLMs进行预测输出。
[0161] 具体来说,通过文字构成的句子级信息作为指令来指导LLMs处理任务,在微调训练LLMs过程中,为LLMs提供Prompt,指导模型按照期望输出格式进行预测输出。为了帮助LLMs更好的理解半结构化HTML文本数据中存在的表格数据以及文本与文本之间存在的对应关系,本实施例基于指令微调框架,针对多维表格内容结构化提取任务和文本信息抽取任务设计了不同指令Prompt。
[0162] 第一训练指令包括F1至F5。
[0163] F1、仔细阅读表格内容,理解表格的结构和数据含义。
[0164] F2、分析表格中各属性及其关系,确定表格中的数值。
[0165] F3、根据属性键,将表格中的数据准确填入JSON格式,要求信息与原文一致,不改变原句。
[0166] F4、检查JSON格式的正确性,确保保留所有表格信息。
[0167] F5、全部使用中文,禁止生成表格数据以外的文字。
[0168] 第二训练指令包括角色定位、背景、目标、语义判断和工作流程。
[0169] 角色定位:信息抽取专家与数据结构化工程师。
[0170] 背景:用户需要从大量文本中精准提取预设领域的关键数据,并以标准JSON格式输出,以便于后续的数据处理和分析。
[0171] 目标:精确抽取35个预定义字段,输出标准JSON格式,同时保证字段顺序和格式严格符合规范,不生成多余字段,缺失字段填充null。其中,以招投标领域为例,35个预定义字段包括:1工程名称,2招标人,3招标联系人,4招标联系电话,5招标人地址,6招标时间,7招标金额,8代理机构,9资金来源,10代理机构联系人,11代理机构联系电话,12中标人,13中标联系人,14中标金额,15工期,16下浮率,17人员名称,18职位,19投标人名称,20投标报价,21经评审,22排名,23投标保证金,24投标保证金缴纳方式,25履约保证金,26履约保证金缴纳方式,27招标内容,28投标人资质要求,29人员要求,30投标文件递交地址,31最高限价,32招标方式,33项目名称,34标题名称,35项目编码。
[0172] 语义判断:通过上下文判断字段相似词(例如"中标价”是否属于"中标金额”),确保抽取信息与字段定义完全匹配。
[0173] 工作流程:读取输入文本,进行预处理(清洗、格式化),按字段列表依次抽取信息,组织提取结果,格式化输出JSON。
[0174] 实施例二、本发明提供了一种半结构化HTML的信息抽取装置,用以执行实施例一任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法,其包含文档获取模块、表格判断模块、第一处理模块、第二处理模块、第三处理模块和第四处理模块。
[0175] 文档获取模块,用于获取HTML文档并输入大语言模型。
[0176] 表格判断模块,用于所述大语言模型判断HTML文档是否包含表格。
[0177] 第一处理模块,用于若HTML文档包含表格,则调用所述表格处理LoRA适配器对表格内容进行结构化提取并转换为伪自然语言描述,以及调用文本处理逻辑模块提取表格的相邻文本上下文,然后进行语义整合,获取第一文本信息。
[0178] 第二处理模块,用于若HTML文档不包含表格,则调用表格处理LoRA适配器的文本处理模块提取文本内容并保留原始段落结构,获取第一文本信息。
[0179] 第三处理模块,用于调用关键信息提取LoRA适配器,基于预定义的字段列表从所述第一文本信息中提取结构化键值对,并根据所述结构化键值对生成扁平化的JSON数据。
[0180] 第四处理模块,用于调用所述嵌套结构化生成模块,将所述JSON数据转化为符合业务逻辑的多层嵌套JSON格式的目标序列,以存储至文件系统支持后续业务系统调用。
[0181] 实施例三、本发明提供了一种半结构化HTML的信息抽取设备,其包括处理器、存储器,以及存储在所述存储器内的计算机程序。所述计算机程序能够被所述处理器执行,以实现实施例一任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法。
[0182] 实施例四、本发明提供了一种计算机可读存储介质,所述计算机可读存储介质包括存储的计算机程序,其中,在所述计算机程序运行时控制所述计算机可读存储介质所在设备执行如实施例一任意一段所述的一种基于多LoRA级联策略的HTML信息提取方法。
[0183] 显然,前面描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
[0184] 在本发明实施例所提供的几个实施例中,应该理解到,所揭露的装置和方法,也可以通过其它的方式实现。以上所描述的装置和方法实施例仅仅是示意性的,例如,附图中的流程图和框图显示了根据本发明的多个实施例的装置、方法和计算机程序产品的可能实现的体系架构、功能和操作。在这点上,流程图或框图中的每个方框可以代表一个模块、程序段或代码的一部分,所述模块、程序段或代码的一部分包含一个或多个用于实现规定的逻辑功能的可执行指令。也应当注意,在有些作为替换的实现方式中,方框中所标注的功能也可以以不同于附图中所标注的顺序发生。例如,两个连续的方框实际上可以基本并行地执行,它们有时也可以按相反的顺序执行,这依所涉及的功能而定。也要注意的是,框图和 / 或流程图中的每个方框、以及框图和 / 或流程图中的方框的组合,可以用执行规定的功能或动作的专用的基于硬件的系统来实现,或者可以用专用硬件与计算机指令的组合来实现。
[0185] 另外,在本发明各个实施例中的各功能模块可以集成在一起形成一个独立的部分,也可以是各个模块单独存在,也可以两个或两个以上模块集成形成一个独立的部分。
[0186] 所述功能如果以软件功能模块的形式实现并作为独立的产品销售或使用时,可以存储在一个计算机可读取存储介质中。基于这样的理解,本发明的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以软件产品的形式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,电子设备,或者网络设备等)执行本发明各个实施例所述方法的全部或部分步骤。而前述的存储介质包括:U盘、移动硬盘、只读存储器、随机存取存储器、磁碟或者光盘等各种可以存储程序代码的介质。需要说明的是,在本文中,术语"包括”、"包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、物品或者设备不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、物品或者设备所固有的要素。在没有更多限制的情况下,由语句"包括一个……”限定的要素,并不排除在包括所述要素的过程、方法、物品或者设备中还存在另外的相同要素。
[0187] 在本发明实施例中使用的术语是仅仅出于描述特定实施例的目的,而非旨在限制本发明。在本发明实施例和所附权利要求书中所使用的单数形式的"一种”、"所述”和"该”也旨在包括多数形式,除非上下文清楚地表示其他含义。
[0188] 应当理解,本文中使用的术语"和 / 或”仅仅是一种描述关联对象的关联关系,表示可以存在三种关系,例如,A和 / 或B,可以表示:单独存在A,同时存在A和B,单独存在B这三种情况。另外,本文中字符" / ”,一般表示前后关联对象是一种"或”的关系。
[0189] 取决于语境,如在此所使用的词语"如果”可以被解释成为"在……时”或"当……时”或"响应于确定”或"响应于检测”。类似地,取决于语境,短语"如果确定”或"如果检测(陈述的条件或事件)”可以被解释成为"当确定时”或"响应于确定”或"当检测(陈述的条件或事件)时”或"响应于检测(陈述的条件或事件)”。
[0190] 实施例中提及的"第一\第二”仅仅是区别类似的对象,不代表针对对象的特定排序,可以理解地,"第一\第二”在允许的情况下可以互换特定的顺序或先后次序。应该理解"第一\第二”区分的对象在适当情况下可以互换,以使这里描述的实施例能够以除了在这里图示或描述的那些内容以外的顺序实施。
[0191] 以上所述仅为本发明的优选实施例而已,并不用于限制本发明,对于本领域的技术人员来说,本发明可以有各种更改和变化。凡在本发明的精神和原则之内,所作的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。< / script>
Claims
1. A method for extracting HTML information based on a multi-LoRA cascade strategy, characterized in that: Suitable for execution by a large language model equipped with a text processing logic module, a table processing LoRA adapter, a key information extraction LoRA adapter and a nested structured generation module; The information extraction method comprises: Get the HTML document and input it into the large language model; The large language model determines whether the HTML document contains a table; If the HTML document contains a table, the table processing LoRA adapter is called to perform structured extraction on the table content and convert it into a pseudo-natural language description, and the text processing logic module is called to extract the adjacent text context of the table, and then perform semantic integration to obtain the first text information; If the HTML document does not contain a table, the text processing module of the table processing LoRA adapter is called to extract the text content and retain the original paragraph structure to obtain the first text information; Calling a key information extraction LoRA adapter to extract structured key-value pairs from the first text information based on a predefined field list, and generating flattened JSON data according to the structured key-value pairs; Calling the nested structured generation module to convert the JSON data into a target sequence in a multi-layer nested JSON format that conforms to the business logic, to store it in the file system to support subsequent business system calls; The fine-tuning process of the table processing LoRA adapter is: Load a pre-trained Large Language Model (LLM) and freeze its base weights , only enables table processing of low-rank matrix parameters for LoRA adapter and Conduct training; among them, for The decomposed basis matrix, for The coefficient matrix after decomposition, Process the weight matrix of LoRA adapter for the table; inputting first training data and a first training instruction; The optimization goal is to convert the multi-dimensional cross-table content into logical text information, and back propagation is used to update the table to process the LoRA adapter parameters; The steps for backpropagation updating the table to process LoRA adapter parameters are: Generate a first sequence probability distribution according to the first training data, the first training instruction, and the content output by the model; Where, Represents probability, Indicates the location The target content that has been generated, Indicates input text, Indicates instructions, and are the serial numbers of two different phrases, Output target content elements; Calculating a first loss function according to the first sequence probability distribution; Where, is the loss function, The number of elements in the output target content, For the real labeled sequence, Indicates the location The true marking of the content; Update according to the first loss function and ; Where, is the learning rate, represents partial differential; According to the updated and , updates the weights of the large language model that enables table processing LoRA adapter; Where, To enable table processing of the large language model weights of the LoRa adapter, The basic weight of the large language model 、 is the first training data.
2. The HTML information extraction method based on a multi-LoRA cascade strategy according to claim 1 is characterized in that: The text processing logic module is used to perform the following steps: Parse the HTML structure, identify and remove non-text elements and ancillary information irrelevant to semantics; non-text elements include <script>和<style>标签内的内容;附属信息包括广告、导航栏和版权声明;提取主体结构中的文本节点,保留与语义关联紧密的内容,以及结构清晰的纯文本片段,作为后续模型处理的输入。3.根据权利要求1所述的一种基于多LoRA级联策略的HTML信息提取方法,其特征在于,键信息提取LoRA适配器的微调过程包含:加载预训练大语言模型(LLM)并冻结其基础权重,仅激活关键信息提取LoRA适配器的低秩矩阵参数和进行微调;其中,为分解后的基矩阵、为分解后的系数矩阵、为键信息提取LoRA适配器的权重矩阵;输入第二训练数据和第二训练指令;以提高关键信息字段的提取准确率,以及确保输出符合格式规范为优化目标,通过真实标注字段与模型输出对比,反向传播更新键信息提取LoRA适配器参数;反向传播更新键信息提取LoRA适配器参数的步骤为:根据第二训练数据、第二训练指令,以及模型输出的内容,生成第二序列概率分布; ;式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素;根据所述第二序列概率分布计算第二损失函数; ;式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注;根据所述第二损失函数更新和; ;式中,为学习率、表示偏微分;根据更新后的和,更新激活了关键信息提取LoRA适配器的大语言模型的权重; ;式中,为激活了关键信息提取LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第二训练数据。4.根据权利要求1所述的一种基于多LoRA级联策略的HTML信息提取方法,其特征在于,第一训练数据为半结构化HTML格式的表格数据;第一训练数据包含多维度交叉的表格内容和结构信息;第一训练数据的预处理步骤包括:去除非文本元素;其中,所述非文本元素包括脚本、样式表和注释;删除重复或无关的HTML标签以及空白;检查数据是否完整,对于缺失的数据,根据网站原文的实际情况进行填充、删除或标记。5.根据权利要求4所述的一种基于多LoRA级联策略的HTML信息提取方法,其特征在于,第二训练数据为根据HTML文档训练数据提取得到的第一文本信息;第二训练数包含表格和上下文相关的文本信息;第二训练数据的预处理步骤包括:检测并修正删除文本中的乱码,识别并剔除多余的空格、换行符和无用的空白段落;对简短或不完整的句子或者段落,根据原始网站信息进行重构或扩展保证句子或者段落的逻辑连贯性;同时,确保文本遵循统一的格式标准;对于包含在文本中复杂的多维表格数据进行逻辑重构;确保数据集中的关键信息完整,对缺失的答案或文本信息进行补充或标记,并分析文本数据的逻辑一致性,确保文本内容在语义上连贯。6.根据权利要求5所述的一种基于多LoRA级联策略的HTML信息提取方法,其特征在于,第一训练指令包括F1至F5;F1、仔细阅读表格内容,理解表格的结构和数据含义;F2、分析表格中各属性及其关系,确定表格中的数值;F3、根据属性键,将表格中的数据准确填入JSON格式,要求信息与原文一致,不改变原句;F4、检查JSON格式的正确性,确保保留所有表格信息;F5、全部使用中文,禁止生成表格数据以外的文字;第二训练指令包括角色定位、背景、目标、语义判断和工作流程;角色定位:信息抽取专家与数据结构化工程师;背景:用户需要从大量文本中精准提取预设领域的关键数据,并以标准JSON格式输出;目标:精确抽取35个预定义字段,输出标准JSON格式,同时保证字段顺序和格式严格符合规范,不生成多余字段,缺失字段填充null;语义判断:通过上下文判断字段相似词,确保抽取信息与字段定义完全匹配;工作流程:读取输入文本,进行预处理,按字段列表依次抽取信息,组织提取结果,格式化输出JSON。7.一种半结构化HTML的信息抽取装置,用以执行如权利要求1至6任意一项所述的一种基于多LoRA级联策略的HTML信息提取方法,其特征在于,包含:文档获取模块,用于获取HTML文档并输入大语言模型;表格判断模块,用于所述大语言模型判断HTML文档是否包含表格;第一处理模块,用于若HTML文档包含表格,则调用所述表格处理LoRA适配器对表格内容进行结构化提取并转换为伪自然语言描述,以及调用文本处理逻辑模块提取表格的相邻文本上下文,然后进行语义整合,获取第一文本信息;第二处理模块,用于若HTML文档不包含表格,则调用表格处理LoRA适配器的文本处理模块提取文本内容并保留原始段落结构,获取第一文本信息;第三处理模块,用于调用关键信息提取LoRA适配器,基于预定义的字段列表从所述第一文本信息中提取结构化键值对,并根据所述结构化键值对生成扁平化的JSON数据;第四处理模块,用于调用所述嵌套结构化生成模块,将所述JSON数据转化为符合业务逻辑的多层嵌套JSON格式的目标序列,以存储至文件系统支持后续业务系统调用;表格处理LoRA适配器的微调过程为:加载预训练大语言模型(LLM)并冻结其基础权重,仅启用表格处理LoRA适配器的低秩矩阵参数和进行训练;其中,为分解后的基矩阵、为分解后的系数矩阵、为表格处理LoRA适配器的权重矩阵;输入第一训练数据和第一训练指令;以将多维度交叉的表格内容转换为符合逻辑的文本信息为优化目标,采用反向传播更新表格处理LoRA适配器参数;反向传播更新表格处理LoRA适配器参数的步骤为:根据所述第一训练数据、第一训练指令,以及模型输出的内容,生成第一序列概率分布; ;式中,表示概率、表示在位置已经生成的目标内容、表示输入文本、表示指令、和分别为不同的两个词组的序号、为输出目标内容中的第个元素;根据所述第一序列概率分布计算第一损失函数;;式中,为损失函数、输出目标内容的元素数量、为真实标注序列、表示到位置的内容的真实标注;根据所述第一损失函数更新和; ;式中,为学习率、表示偏微分;根据更新后的和,更新启用表格处理LoRA适配器的大语言模型的权重; ;式中,为启用表格处理LoRA适配器的大语言模型的权重、为大语言模型的基础权重、为第一训练数据。8.一种半结构化HTML的信息抽取设备,其特征在于,包括处理器、存储器,以及存储在所述存储器内的计算机程序;所述计算机程序能够被所述处理器执行,以实现如权利要求1至6任意一项所述的一种基于多LoRA级联策略的HTML信息提取方法。9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括存储的计算机程序,其中,在所述计算机程序运行时控制所述计算机可读存储介质所在设备执行如权利要求1至6任意一项所述的一种基于多LoRA级联策略的HTML信息提取方法。< / script>
Citation Information
Patent Citations
Universal method for converting power unstructured data into structured data
CN115757596A
A Transferable Neural Architecture for Structured Data Extraction From Web Documents
US20230014465A1