第一章 引言
在古代文学研究当中,意象是文化基因和审美意蕴的主要承载者,它的历史发展规律一直受到学术界的重视。但是传统的定性研究大多依靠专家个人的经验和文本细读来完成,对于浩如烟海的古籍文献来说,很难避免主观认知的偏差,并且也很难在漫长的时间跨度内对意象的演变微观脉络和宏观趋势进行系统的梳理。运用语料库技术以及文本挖掘的方法,给解决以上现实问题赋予了新的角度。利用创建的大规模历时语料库,借助词频统计、语义向量计算、聚类分析等技术手段,可以把抽象的文学感受变成可以度量的数据特征,进而达成对意象兴衰更替的准确量化追踪[1]。目前人文计算领域发展很快,但是古代文学意象研究还存在着语料代表性不足、特征维度设置缺乏针对性、量化分析深度不够等研究空白,面向特定地域场景的古代风景意象文本挖掘分析也已有成熟的探索范式可供参考[4]。因此,本文主要研究的是古代文学意象的动态演变机制,用标准的文本挖掘技术路径来对古代文学意象进行系统的考察。本节将对国内外相关文献进行梳理,阐述本研究的理论价值和实践意义,说明整体的技术路线以及章节安排的逻辑,为后面的研究打下良好的基础。
第二章 基于语料库与文本挖掘的古代文学意象演变量化研究实践
2.1 古代文学意象研究专属语料库的构建与清洗
古代文学意象研究专属语料库的建立是量化研究的基础,它主要体现在确定出一套标准的数据获取和处理流程上。语料选择范围严格限定在唐至清各个朝代的代表性诗文总集、名家别集和经典文学选本上,保证包含主要的文学流派和风格。在版本选择上,首先使用中华书局、上海古籍出版社等权威机构整理校注的本子,保证文本的原始准确性以及学术权威性。数据清洗阶段按照事先设定好的规则对原生语料实施深度净化,具体的操作有运用算法去重、剔除冗余注释、执行非文学性内容的剔除等。就古代汉语的特点而言,需要对异体字进行规范化处理,对标点符号进行校准,对繁简体进行转换,对朝代、作者等元数据进行结构化标注,从而为之后的分时段分析提供支持。另外,就古代文学意象表述的多态性而言,做了适应性的预处理,把异形意象词的录入标准统一起来。经过严格的清洗和校验之后,得到的语料库大小适中,各个朝代的文本所占比例均匀,可以客观地反映文学发展的历史面貌,也可以保证后面文本挖掘时样本具有代表性、准确性以及高适配度,为意象演变的量化分析打下了良好的数据基础。
表1 古代文学意象研究专属语料库构建与清洗核心流程及技术参数
2.2 核心意象全时段文本挖掘特征维度的设定
核心意象全时段文本挖掘特征维度的确定,是把抽象的文学意象变成可以计算的数据的重要环节,目的是建立一个能够兼顾传统文学内涵和数字化分析优势的标准化体系。该维度体系主要是由频次分布特征、场景关联特征、情感语义特征和语境共现特征四个部分组成,这四个部分一起构成实证分析的基础。首先,频次分布特征用统计核心意象在各个朝代语料中出现的绝对和相对频率来衡量它的流传广度和历史兴衰,是判断意象地位变化的基本指标。其次,场景关联特征用文本挖掘技术提取意象周围的描写对象,即季节、地理或者活动,计算出它和某个场景的共现概率,从而还原出意象在各个历史时期的典型应用场域。另外,情感语义特征借助情感词典和语义分析技术,对意象所在的诗句展开极性判定并赋予情感强度值,以此来量度意象背后所包含的褒贬色彩和情感趋向。最后,语境共现特征用意象和高频词的互信息值来识别和意象紧密搭配的词汇网络,揭示语义组合的变化规律。这四个维度从逻辑上讲是逐层深入的,由表及里地从表象的频率进入到内在的语义和情感当中,既可以涵盖传统定性研究中所关注的内容,也可以用量化的指标来体现跨朝代的细微差别,进而为之后的意象演变量化研究提供一个客观、准确并且具有可解释性的操作框架。
2.3 "梅"意象在唐至清时段的演变量化实证分析
2.3.1 意象出现频次与文本场景的关联度统计
意象出现频次和文本场景的关联度统计,就是用量化的方法准确地找出“梅”意象在唐到清时期功能的演变以及审美侧重点的变化。本环节根据文学题材将文本场景分为咏物抒怀、边塞羁旅、闺阁情思、山水隐逸和宴游酬唱等几大类,从而建立数据分析的维度框架。在具体操作时,要对各个时段的语料进行分词和实体抽取,统计出“梅”意象在各个朝代以及各种场景中出现的次数和所占的比例。绘制出跨时段的频次-场景关联热力图和趋势曲线,可以形象地看出意象的迁移过程。数据解读表明,唐代的“梅”意象大多出现在山水隐逸和闺阁情思之中,带有初兴的审美意趣;到了宋代,它在咏物抒怀场景中所占的比例明显上升,体现出了理学背景下人格比德的加深;明清时期又进一步地向多元化发展。以林逋、陆游等为代表的作品为例,对频次的波动和场景的转移进行分析,可以很好地体现社会文化风气与文学创作风尚之间的互动关系,也证明了量化统计对于挖掘文学现象背后人文动因的重要作用。
2.3.2 意象语义情感倾向的时序迁移特征识别
意象语义情感倾向的时序迁移特征识别,就是用量化的方法准确地把握文学意象在各个历史时期的情感色彩变化,是认识意象文化内涵积淀过程的重要技术途径。该环节的核心操作是用适配古代文学文本的情感分类模型,对唐至清各个时期含有“梅”意象的文本样本进行逐篇的语义情感倾向标注和测算。研究者在具体实施时要将唐代到清代分成若干个连续的时间段,用时序切片的方法来统计各个时间段内“梅”意象相关文本的正向、中性和负向情感所占比例。对这些时序数据进行纵向比较之后,就可以很快地发现情感倾向迁移的转折点以及总体的发展趋向。实际使用显示,该过程可以清楚地表现出“梅”意象由早期重在物质景物的描写,逐渐转向承载高洁品格、隐逸情志等专属文化内涵的过程。把定性的文化解读转化为可以量化的时序数据,既形象地表现出意象情感的起伏变化,又给探究社会文化背景怎样推动文学意象内涵的加深和迁移赋予了有力的实证支撑。
第三章 结论
本文通过对语料库技术以及文本挖掘算法在古代文学研究中运用的实践,创建起一套标准化的意象演变量化分析体系。研究首先确定了以特征维度为量化标准,通过创建专属古代文学语料库来完成对非结构化文本数据的清洗、分词和词性标注工作,为之后自动化处理打下了基础。实证分析部分选取“梅”意象为研究对象,用词频统计、语义关联分析、聚类算法等方法,准确地再现了“梅”由先秦时期的自然物象到宋元时期人格化的符号的演变过程,也定量地表现出了它的情感色彩和隐喻意义的历时性变化。相比传统的依靠人工阅读、主观感受的研究方法,本文的创新之处在于用计算语言学工具把模糊的文学感知变成可视化的数据指标,大大提高了研究结论的客观性以及解释力。但是由于目前语料库的规模以及古汉语自动分词技术的精度所限,本研究在语料的时间跨度覆盖上以及部分生僻意象的识别准确率上还存在着不足。未来会继续扩大语料的覆盖面,提高算法对于复杂语境的理解能力,尝试把图像、书画等多模态文献数据加入进来,把更多的传统文学意象纳入到量化研究的范围之中,进而创建起更加完备、立体的古代文学意象演变分析体系[3]。
参考文献
\[1\]李妍斐. 利用"知识图谱"网站诗词库API及文本挖掘技术分析诗词意象的方法——以挖掘"鹧鸪"意象隐藏模式为例[J]. 2024.
\[2\]付佳玉. 基于文本挖掘的历史城市意象解构及演变研究——以唐宋时期苏州为例[J]. 住区, 2025(5): 130-137.
\[3\]张鲲, 段连华, 李卓. 基于唐宋诗词语义解析的蜀地诗意场景营建探究——以天府会都岛为例[J]. 园林, 2024, 41(5): 40-51.
\[4\]宋亚琪, 沈守云, 王薇薇. 基于诗词文本分析的民国时期南岳衡山风景意象研究[J]. 现代园艺, 2025, 48(1): 62-65.