基于异构神经网络的会计异常检测算法研究

会计审计论文 电算会计 作者:佚名 约 7 分钟
本文聚焦基于异构神经网络的会计异常检测算法,梳理该领域理论基础与国内外研究进展,针对传统方法处理多源异构会计数据效率低、漏报率高的痛点,设计融合CNN与时序LSTM的双分支异构模型。经标准化数据集实证验证,该算法相较传统及单模态模型,异常识别精度显著提升,可降低人工稽核成本,为企业搭建智能财务风险预警体系提供技术范式,助力会计行业数字化转型。
本文目录

需要完整成稿?

PaperTan 一键生成全文 · 开题 · 降重

一键写论文

第一章 引言

伴随着大数据和人工智能技术的迅猛发展,会计数据处理也正在发生着由传统的手工核算向智能化自动审核的转变。在此情况下,以异构神经网络为基础的会计异常检测算法研究,就是试图用深度学习的方法来克服传统审计手段在处理大量数据的时候效率低、覆盖面小的问题。该算法的基本定义就是将多种不同的神经网络模型结合在一起,利用各个模型在特征提取方面的优势,对复杂的财务数据进行综合分析。核心原理就是用多源异构数据并行处理的方式,去发现会计数据里隐藏的非线性关系以及潜在的风险模式,进而准确找到违背会计准则或者出现异常波动的数据点[1]。

该技术先对多维会计数据做标准化预处理,再建立卷积神经网络、循环神经网络等异构模型结构,用混合学习的方法自动提取出重要的风险特征,最后给出异常概率评分。该种技术的应用价值非常明显,它不但可以大大提高审计工作的自动化程度,减少由于人为失误造成的审计风险,而且可以帮助企业实时监控财务状况,保证会计信息的真实性、完整性[5]。对于专科层次的会计实践来说,掌握了这个技术流程之后,就可以了解智能化审计的基本原理,为以后从事高附加值的会计数据分析工作打下良好的基础。

第二章 会计异常检测的理论基础与研究现状

2.1 核心概念与基础理论界定

会计异常检测就是借助信息技术手段,对大量的会计数据展开系统的检查,目的在于找出不符合既定会计准则或者正常业务逻辑的异常情况。该领域要准确界定异常类型,常规会计偏差一般是由计算失误或者凭证录入错误造成的,具有随机性和非主观性;主观错报是管理层由于误判而进行的违规操作;恶意会计舞弊则是通过虚构交易、隐瞒负债等方式故意粉饰报表,具有隐蔽性和系统性危害。在实际使用时,必须要明确这三种特征才能建立有效的检测模型。异构神经网络是核心技术支撑,它试图冲破单个模型处理繁杂数据时的束缚。其核心就是将卷积神经网络(CNN)和长短期记忆网络(LSTM)的优点结合起来,CNN可以提取出多维会计凭证中局部的空间特征和关键指标模式,LSTM可以利用门控机制很好地捕捉到资金流的时间序列依赖关系,两者通过多模态模块协同实现特征级融合。另外会计数据具有异构性,即结构化财务数据和非结构化审计文本并存,这就需要算法具有多源数据对齐的能力。在评价体系当中,除准确率、召回率之外,精确率、F1分数以及ROC曲线下面积(AUC)一同成为评判模型好坏的重要标准,给后续算法设计的检验赋予了统一的理论参照。

表1 会计异常检测核心概念与基础理论界定

类别概念/理论名称核心内涵界定在会计异常检测中的应用价值
核心概念会计异常指偏离正常会计核算规则、违背经营业务逻辑或存在舞弊嫌疑的财务数据异动,涵盖虚增营收、关联方非公允交易、异常成本操控等多类表现形式明确检测目标的边界与范畴,为后续异构神经网络的特征提取提供标注基准依据
核心概念异构神经网络融合不同结构神经网络单元(如用于时序特征提取的LSTM、用于关联图谱特征挖掘的GNN、用于局部模式识别的CNN)的复合型深度学习架构,适配多模态会计数据的异构特性打破传统单一模型对结构化财务数据、非结构化业务文本、关联交易图谱的适配局限,提升异常特征的挖掘深度
基础理论财务舞弊三角理论由压力、机会、合理化三要素构成,指出异常会计行为的产生需要同时满足三类前置条件为异常特征工程提供语义层面的特征维度补充,将企业经营压力、内控缺陷等非量化因素纳入检测体系
基础理论信号传递理论指企业内部经营状态的异动会通过财务数据、业务关联交互等多路径向外释放差异化信号支撑多源异构会计数据的关联特征构建,提升对隐蔽性协同异常行为的识别准确率
基础理论异常值挖掘理论统计与数据挖掘领域中针对偏离整体分布的小概率样本的识别框架,涵盖监督式、半监督式与无监督式三类技术路径为异构神经网络的训练范式选择提供理论支撑,适配会计异常样本标注稀缺的现实业务场景

2.2 会计异常检测领域国内外研究进展

会计异常检测领域国内外的研究进展,大体上是沿着从传统方法到智能算法的技术路线发展的。早期研究大多采用基于规则匹配和统计建模的方法,比如本福特定律、回归分析等,主要依靠事先设定好的财务指标阈值或者统计分布特征来发现偏差。例如用最小二乘法建立线性回归模型,用残差来评价会计数据的合规性,关键运算过程为

y^=β0+β1x \hat{y} = \beta_0 + \beta_1 x

,其中 y^\hat{y} 为预测值。但是这些方法不能很好地反映非线性复杂的关系,并且过于依靠专家的经验。随着数据量越来越大,国内外学者开始把研究重点放在了单个深度学习模型和机器学习结合的方法上,用随机森林、支持向量机等方法对高维数据进行处理,大大提高了检测速度。目前神经网络技术的应用成为研究热点,代表性文献用自动提取深层特征的方法,克服了传统方法特征工程繁琐的缺点。虽然已经取得了精度上的突破,但是对于会计数据特有的异构性以及样本不平衡问题,现有的通用神经网络模型还存在着不足,为之后创建专门的异构检测算法留下了研究空间。

2.3 现有主流检测算法的局限与异构神经网络的适配性分析

目前会计异常检测主流算法对于多源异构数据存在着明显的不足。传统的统计方法依靠事先设定好的阈值来工作,不能很好地处理结构化财务数据里复杂的非线性时序依赖关系,而基于规则的方法对于非结构化附注文本的语义信息挖掘比较浅显,不能理解深层次的财务风险,另外,单模态模型不能兼容异质数据特征空间,造成多源数据利用率低,漏报率高。异构神经网络由于具有特殊的结构设计,可以很好地解决以上问题。该技术用并行适应不同模态数据特征提取的需求,把多源数据映射到一个共同的特征空间里进行融合。其核心融合过程可表示为

F=σ(Wf[H1,H2,,Hn]+bf) F = \sigma(W_f \cdot [H_1, H_2, \dots, H_n] + b_f)

,其中 Hi Hi 代表第 i i 种模态数据的隐藏层特征,Wf Wf 与 bf b_f 为融合层的权重矩阵与偏置项,σ \sigma 为非线性激活函数。从数据维度适配性来说,该算法可以同时处理数值型和文本型数据;从性能增益潜力来说,多模态互补特征明显提高了检测精度;从场景需求匹配来说,端到端的特征学习能力完全满足会计异常检测对于全面性和准确性的高要求,这说明本研究选择该技术路线是合理的、必要的。

第三章 面向会计场景的异构神经网络异常检测算法设计与验证

3.1 会计多源异构数据的预处理与特征工程方案

3.1.1 结构化财务记账数据的特征筛选策略

对于结构化财务记账数据具有高维、冗余、指标间强相关性等特点,设计出适合会计业务逻辑的特征筛选方法是保证算法有效的前提。首先需要对资产负债表、利润表、现金流量表的主要科目余额、月度记账波动指标和往来交易关联属性进行梳理,得到初始的全部特征池,然后按照会计恒等式等业务约束来建立基本指标。具体筛选路径为:第一步用方差过滤法,根据设定的阈值去掉数据长期没有波动的无效指标,减少数据噪声;第二步用Pearson相关系数法,对财务指标之间普遍存在的共线性问题,准确地剔除掉高度相关的冗余特征,防止模型训练时出现多重共线性的干扰;最后用树模型特征重要性排序法,结合历史审计中标记的会计异常标签,计算各个特征对于异常状态的区分度,得到核心特征子集。该方案中每一个环节的阈值都是根据会计核算规范以及数据分布特征来确定的,在业务层面可以解释筛选结果,在后面异构神经网络模型识别异常模式的时候也可以提高精度和速度。

3.1.2 非结构化会计附注文本的语义特征提取方法

会计附注文本一般包含很多专业术语,并且表述格式灵活,属于非结构化数据,对它的语义特征提取要准确,才能保证异常检测算法的正常工作。为了克服通用自然语言处理方法在会计专业领域中出现的语义理解偏差问题,本节提出了适合于会计场景的语义特征提取途径。该方法先用会计领域预训练词向量模型对数据进行预处理,对文本进行精准分词和专业术语对齐,很好地弥补了通用语料和会计专业术语在语义空间上存在的差异,保留了重要的财务概念的真实含义。接着利用卷积神经网络强大的局部语义捕捉能力,从预处理过的文本中提取出重要的风险表述特征,自动识别出有潜在风险指示作用的短语组合。经过上面的步骤,最后得到维度统一的低稠密语义特征向量。该向量既可以将非结构化文本转化为结构化的数值,又可以保证提取出来的特征可以准确地抓住附注文本里隐藏的异常风险线索,有效地防止了通用文本特征提取方法造成的语义信息损失,给后面异构神经网络的融合计算赋予了优良的数据支持。

3.2 融合CNN与时序LSTM的异构神经网络检测模型构建

本文针对会计凭证中数值型数据和非结构化文本共存的特点,提出了一种结合了CNN和时序LSTM的异构神经网络检测模型。本模型使用双分支异构结构来达到多模态特征的协同学习。时序LSTM分支主要是对结构化财务数据进行处理,从中提取出各个记账期间的时序变化以及相互间的依存关系。通过遗忘门、输入门和输出门的配合使用,LSTM可以很好地挑选出重要的财务指标,其主要的运算公式为 ft=σ(Wf[ht1,xt]+bf) ft = \sigma(Wf \cdot [h{t-1}, xt] + bf) ,从而保留了长期的风险趋势信息。同时CNN分支是附注文本语义特征的处理通道,用卷积核在文本序列上滑动来挖掘局部关联特征,得到包含审计风险的深层语义向量。在得到双分支特征之后,用拼接融合的方式把LSTM得到的时序特征和CNN得到的语义特征结合起来,得到一个综合特征向量。接着,特征向量就被全连接层所映射、降维,再经由Softmax激活函数来算出异常的概率,最后才得到分类结果。为了提高模型对于会计样本不平衡的环境下的鲁棒性,用交叉熵损失函数对参数进行优化,交叉熵损失函数的定义为 L=i=1nyilog(y^i) L = -\sum{i=1}^{n} yi \log(\hat{y}i) 。该设计保证了模型可以准确地把各种不同的异质信息结合在一起,从而提高会计异常检测的准确性。

3.3 实证实验与算法性能对比分析

实证实验是检验算法有效性的关键部分,本文首先创建出标准化的会计异常数据集。按照会计准则和审计实务的要求,把金额偏差、频次异常、凭证逻辑错误的样本标记为异常标签,按8:2比例随机分成训练集和测试集,用5折交叉验证来保证实验结果的稳健性。为了对异构神经网络模型进行全方位的评价,选择了单模态CNN、单模态LSTM和传统的随机森林算法作为参照基准。实验过程中主要对精准率、召回率、F1值、AUC值等主要性能指标进行监测,F1值的计算逻辑是用来平衡精确率和召回率之间的权重关系,计算公式为

F1=2×Precision×RecallPrecision+Recall F1 = \frac{2 \times Precision \times Recall}{Precision + Recall}

。在细分检测效果分析时,所提模型对于复杂的逻辑异常有着很好的识别能力,AUC值比基准模型高很多。另外,用关键特征消融实验来证明多模态特征融合模块对于提高检测精度起着决定性的作用。从量化的结果可以看出,本文所设计的异构神经网络算法对于会计异常检测任务来说,比传统的方法具有更高的准确率,并且在处理非结构化数据的时候也具有更好的场景适应性,可以很好地满足实际审计工作对严格性的要求。

第四章 结论

本文主要对基于异构神经网络的会计异常检测算法进行详细的探究和实证分析,整理出该技术在会计信息化方面的应用逻辑以及实践意义。从以上结果可以得出结论,异构神经网络把长短期记忆网络和卷积神经网络等不同的结构结合起来,可以很好地解决传统单一模型对于高维、非线性会计数据的不足之处。算法从原始会计凭证数据入手,先做标准化预处理和特征提取,再用异构结构并行捕捉时间序列里的长期依赖关系和局部数值特征,最后经由输出层的异常评分机制来达成对潜在违规行为的精确指向。从实际应用的结果来看,该模型在保证低误报率的基础上,对复杂的财务舞弊模式的识别准确率有了明显的提高,说明它在海量交易数据筛查中具有很高的效率和鲁棒性[4]。除此之外,本文还证明了把深度学习技术应用到会计审计流程中是可行的、必要的,大大降低了人工稽核的成本,给企业创建智能化风险预警体系赋予了标准化的技术范式,对推进会计行业的数字化转型有着十分重要的指引作用。

参考文献

\[1\]赵洁. 基于深度神经网络的一分类数据异常检测算法研究[D]. 北京邮电大学, 2023.

\[2\]姜齐艳, 王鲁平. 基于数据挖掘与神经网络的财务异常数据监测分析算法[J]. 电子设计工程, 2020, 28(11): 5.

\[3\]许建, 陈仕杰, 冯健聪. CBT-AD:CNN-BiLSTM-Transformer混合架构的时序异常检测模型[J]. 计算机科学, 2026, 53(7): 230-241.

\[4\]周梁琦, 章权, 魏莉. 基于贝叶斯的大数据异常值检测模型研究[J]. 电脑知识与技术:学术版, 2020, 16(1): 3.

\[5\]李沛原, 丁京, 张田甜. 基于改进BP神经网络算法的云环境异常检测技术研究[J]. 河南科技, 2018(4): 3.

相关文章