项目简介:基于对档案业务的深刻理解和自然语言理解技术应用研究经验,针对重复性强、规则复杂的业务场景,探索从档案内容语义角度理解和学习档案工作流程,通过大规模档案文本解析提取业务知识,建立业务规则知识库,构建档案业务自动处理模型,面向档案密级鉴定和开放审控等任务提供智能化服务。OCR原文解析:针对档案文件手写体、印刷体、表格、印章混合问题,自研专用OCR图片识别模型,准确识别各类元素,还原档案原文;密件标识识别:涉密档案通常包含密件标识,通过研究大量密级标识案例,构建密级标识数据集并针对性优化模型,大大提升了模型的密件标识识别能力;文本理解:为准确判别出无标识涉密档案,需从语义角度对档案内容进行全文检查和理解,基于预训练模型强大的自然语言理解能力,对档案文本进行解析比对,识别涉密文件和敏感内容;开放审核规则知识库:对档案开放审核政策法规进行系统性训练学习,并根据档案馆档案特性个性化定制控制词库,通过元知识抽取和语义关联建立开放控制规则知识库;语义分析引擎:对档案原文进行全文识别和解析,并通过篇章级的文本语义理解,提取档案文件语义含义,结合规则知识库进行综合分析判断;控制类别精准识别:针对档案控制理由类别多样,且类别间文本特征差异较大的问题,专门为每个类别构建了数据集和识别模型,能够精准识别出档案控制类别输出控制理由。

