打开网易新闻 查看精彩图片

江西地名研究

关注我们,获取更多地名资讯

摘要:针对境外地名数据缺失的问题,该文提出了一种基于地名派生关系的未登录地名发现方法。通过构建地名时空派生关系知识图谱,结合深度学习技术实现未登录地名发现与空间位置推理。首先,采用混合方法构建地名派生关系知识图谱,形式化表达地名派生规则;其次,基于BERT-CRF模型(F1值达0.9567)标注地名成分,结合知识图谱的语义与空间约束验证潜在地名,最终实现84.5%的发现准确率;最后,通过通名映射类别和查询知识图谱空间关系,生成潜在地名位置,人工评估显示77.1%的推理结果合理。实验证明该方法能有效补充欠发达地区地名数据,未来将优化多语言支持与动态更新机制。

关键词:未登录地名;知识图谱;时空派生关系;BERT-CRF;空间推理

0 引言

地名作为地理实体的重要标识,承载着丰富的地理、历史和文化信息,是地理信息系统中不可或缺的关键数据。地名数据不仅为地理空间检索与分析提供了直观的参考,还在城市规划、导航服务、灾害救援及基础设施建设等领域发挥着重要作用。然而,由于数据采集的困难性,尤其是非洲等欠发达地区受限于经济条件和技术手段,大量地名未被正式收录,形成“未登录地名”问题。这些缺失的地名数据影响了地理信息系统的完整性和可用性,制约了区域资源管理和经济发展的效率。

地名派生作为一种特殊的地名命名方式,近些年受到研究学者的广泛关注。从文化与历史角度看,文献通过约鲁巴谜语揭示了地名派生与文化背景的关联。从语言学角度来说文献对比了英语和德语中的派生词缀特征;文献系统梳理了派生地名的概念框架、生成机制及译写规范;文献则进一步提出了“原生/派生”“对称/联称”等分类体系。从地理信息科学角度来说,文献提出了基于Geo Hash编码的派生地名识别算法,解决了人工标注效率低的问题;文献则对地名时空派生关系进行了规范化定义与网络构建,推动了相关推理研究的发展。然而,现有研究多是从文化和语言学角度进行分析,地理信息科学方面的研究停留于理论分析,缺乏实际应用,利用地名派生关系价值尚未充分挖掘。

知识图谱作为一种结构化的知识表示方法,能够有效建模实体间的语义关系,为地名派生关系的挖掘提供了新的技术途径。地名时空派生关系(如“北京大学地铁站”源自“北京大学”)不仅体现名称的相似性,还隐含空间邻近性,可用于推断潜在未登录地名的位置。尽管空间关系推理在模糊查询和位置描述方面已有研究,但如何结合派生关系实现未登录地名的发现仍属空白。

针对上述问题,本文提出了一种集成知识图谱与深度学习的未登录地名发现与空间位置推理方法。本文的主要创新体现在以下两个方面:①提出了一个融合多维度约束的地名派生关系形式化框架:通过构建地名时空派生关系知识图谱,统一表达了地名在语义、空间和类别上的派生规则与关联关系,为未登录地名发现提供了可计算的知识基础。②构建了从派生关系发现到空间位置生成的端到端推理链路:通过查询知识图谱中预定义的类别空间关系,将潜在地名的语义信息转化为具体的空间坐标,实现了未登录地名从“名称”到“位置”的完整补全。

实验表明,本方法在欠发达地区地名数据补全中具有显著效果。本研究不仅拓展了知识图谱与深度学习技术在地理信息科学中的应用深度,也为解决全球地名数据不均衡问题提供了一种新颖、自动化的解决方案。

1 技术思路

本文提出了一种基于地名派生关系的未登录地名发现方法,结合知识图谱与深度学习技术,实现未登录地名的自动发现与空间位置推理。

首先,对核心概念“未登录地名”进行界定。传统自然语言处理中的“未登录词”指未被收录在分词词表中但必须被切分出来的词。本文继承并扩展了这一概念:“未登录地名”特指那些在现有权威或开源地名数据库(如GeoNames、OpenStreetMap)中未被收录,但在现实世界实际存在的地理实体。其名称、空间位置及类别可以通过本文提出的派生关系推理方法从已登录地名中推断生成。本文将这一任务称为未登录地名发现任务。

为方便起见,下文统一将地名时空派生关系简写为派生关系。

研究整体框架如图1所示。

打开网易新闻 查看精彩图片

整体技术思路分为以下4个阶段:

1)地名派生关系的形式化表达。采用自顶向下和自底向上的混合方法构建派生关系知识图谱,定义核心类及其关系。

2)潜在派生关系发现。使用BERT-CRF模型标注地名成分。将多通名地名作为候选派生地名,并通过知识图谱的语义与空间约束验证潜在派生关系。

3)空间位置推理。通过通名映射类别确定潜在地名与候选派生地名的地理实体类型。查询知识图谱中的空间关系,结合候选派生地名的坐标生成潜在地名位置。

4)实验验证。在非洲四国开源地理数据上进行测试,评估未登录地名发现的准确率和空间推理的合理性。

2 关系规则及形式化表达

2.1 派生关系定义

派生关系是指在给新发现地物命名时,经过附加、并合和紧缩现有地名来命名新地名,以建立两地名之间的关系,这种关系定义为“派生关系”。派生关系可进一步分为继承派生、影响派生、时空派生,其中地名时空派生关系是指基于最新更名的原生地名,新发现的地名位于原生地名周围,所以在命名时借用原生地名作为新地名专名部分进行命名。其核心特征是:

名称相似性:派生地名通常保留原生地名部分(如“北京大学”→“北京大学地铁站”)。

空间邻近性:派生地物通常位于原生地物附近(如“北京西站南广场”靠近“北京西站”)。

类别关联性:派生地物与原生地物类别存在逻辑联系(如“中关村”→“中关村软件园”)。

2.2 派生关系判定规则

派生关系的判定规则是一个综合考量语义、空间和类别特征的多维度分析过程。该规则主要基于以下3个核心条件:

第一,在语义相似性方面,需要计算原生地名与派生地名之间的名称相似度。当两者的名称相似度超过预设的阈值时,表明它们在命名上存在明显的关联性,这是判定派生关系的基础条件。

第二,在空间关系方面,要求派生地物与原生地物之间必须存在特定的空间关联模式。这种空间关系可能表现为包含、相邻或触碰等拓扑关系。关键的是,两者的空间距离必须小于其对应地物类别组合所设定的特定邻近距离阈值。这一条件确保了派生关系具有地理空间上的合理性。第三,在类别关联性方面,需要计算派生地物类别与原生地物类别的相似度。当类别相似度超过特定阈值时,表明两者在功能或性质上具有继承或衍生关系。

只有当两个地名同时满足上述3个条件时,系统才会判定它们之间存在派生关系。这种多维度判定的方法既考虑了名称的语义延续性,又兼顾了空间分布的合理性,同时还确保了类别特征的关联性,从而有效提高了派生关系判定的准确性。

设定语义相似度阈值为70%。具体依据为:首先,通过人工筛选确定训练集中的原生-派生地名对作为真值;随后计算两者之间的名称相似度,并统计全部相似度数据后取平均值,最终确定70%为统一阈值。

类别相似度的计算与阈值设定方法如下:我们基于已知的派生地名对,总结出常见的类别关联组合(如“Park-Road”)。随后,利用预训练的语义模型将地物类别名称映射为语义向量,并通过计算向量间的余弦值来量化其语义相似度。在此基础上,我们统计了所有真实派生地名对中类别相似度的数值,并取其平均值(70%)作为通用阈值。

空间邻近距离阈值则根据地物类别动态设定。具体流程包括:首先,基于训练数据中已确认的派生地名对,统计不同类别组合(如“Park-Road”“River-Bridge”)中派生地物与原生地物的空间距离,作为真值参考;随后,取各组合空间距离的第85百分位数作为初始阈值,以覆盖大多数真实关联案例;最后,通过人工验证对该阈值进行微调。例如,“River-Bridge”类别的空间邻近距离阈值设定为200m,而“Park-Road”类别则放宽至500m。

所有阈值均在测试集上进行了有效性验证,以确保其合理性和可靠性。

2.3 派生关系形式化表达

研究构建了一个派生关系知识图谱,能够直观地表达给定区域内地名不同类别之间的派生关系及其判定规则。采用自顶向下和自底向上混合的方式构建知识图谱。混合构建结合了自底向上构建和自顶向下构建的方法,形成了一种综合而协同的建模策略。主要由本体构建、知识提取、实体填充等步骤组成。

2.3.1 本体设计

1)定义类

知识图谱涉及到的类主要有原生地物类别、派生地物类别、原生通名和派生通名。

2)定义属性

打开网易新闻 查看精彩图片

3)定义关系

根据派生规则可知,原生地物和派生地物之间存在语义关系和空间关系。其中,语义关系又分为等价关系、互斥关系、上下义关系和部分整体关系。在空间关系上,原生地物和派生地物之间存在特定的空间拓扑关系和邻近关系。空间拓扑关系包含相交、包含、叠加、相离、重合等。

2.3.2 知识提取

1)空间拓扑关系与邻近距离提取

采用基于维数扩展的九交模型,通过分析地理实体a和b的内部(interior,I)、边界(boundary,B)、外部(exterior,E)的相交维度(dimension,DIM)构建关系矩阵,以提取地理实体的拓扑关系,见式(1)。

打开网易新闻 查看精彩图片

式中:a和b代表两个地理实体,I、B、E分别代表地理实体的内部、边界和外部,DIM表示维度。考虑到派生关系的特征,本研究主要提取包含、横跨、等于、重叠、触碰、被包含和相离等7类拓扑关系。

对于拓扑关系为相离的地理实体,将拓扑关系与邻近距离阈值共同构成空间关系属性集,其中拓扑关系优先于距离判断。

2)相似度提取

利用Word2Vec计算地名相似度,针对地名的不同组成部分设计差异化的处理策略。以下是具体方法和实现步骤:

①名称相似度计算。采用基于编辑距离(如Levenshtein距离)的字符串相似度算法,见式(2)。

打开网易新闻 查看精彩图片

式中:Lt1,Lt2表示两个地名字符串的长度;De(t1,t2)表示将t1转换成t2所需的最小编辑操作次数(插入、删除、替换)。

②类别相似度计算。首先定义类别层级:设类别集合为C={c1,c2,···,cn},每个类别ci包含一组同类别词;其次计算类别中心向量:对每个类别ci,计算其所有成员词向量的均值(中心向量),见式(3)。

打开网易新闻 查看精彩图片

2.3.3 实体填充

结合知识图谱中本体的实体结构,从派生地名信息数据中,提取出相应的实体实例数据以及属性值数据,进行连接和融合。利用Neo4j图数据库存储实体与关系,最后可得到派生关系知识图谱。

3 潜在派生关系的发现

以派生关系为切入点,挖掘派生地名中的潜在地名,所以首先需要发现潜在派生关系。根据派生关系规则的形式化表达,从而实现潜在派生关系的发现。

3.1 BERT-CRF模型标注

选取BERT-CRF模型进行地名成分的序列标注任务,该模型结合了BERT(bidirectional encoder representations from Transformers)强大的上下文语义表征能力与CRF(conditional random field)在序列标注上的全局约束优势。

1)模型结构

编码层:采用BERT-Base预训练模型作为编码器,其结构包含12层Transformer编码器,隐藏层维度为768,并配备12个自注意力头。该模型能够动态生成融合了上下文信息的字符级特征向量。

解码层:使用CRF层作为解码器。CRF通过引入标签之间的转移矩阵,学习相邻标签的约束关系(如“I-GN”标签不应紧跟在“O”标签之后),从而有效避免非法标签序列的产生,获得全局最优的标注序列。

2)训练参数与细节

模型在自行构建的人工标注数据集上进行训练。训练时,批量大小(batch size)设置为32,采用AdamW优化器(adaptive moment estimation-weight decay),其初始学习率为5×10-5。模型共训练10个轮次(epoch),并配合线性学习率预热与衰减策略。训练过程在单一NVIDIA RTX 3080 GPU上完成,耗时约35min。

3)标注体系

利用BIO(begin,inside,outside)标注规则对经过分词的文本进行token标注,标注样式如下。

打开网易新闻 查看精彩图片

BERT-CRF模型结构如下图所示:

打开网易新闻 查看精彩图片

首先从23个类别中按比例抽取地名数据,进行人工标注,构建数据集,共抽取了3000条数据。使用精确率、召回率和F1分数3种参数作为评估模型预测精度的数据指标。

对构建的BERT-CRF模型进行了全面地性能评估。评估结果显示,BERT-CRF模型的F1值可达0.9567,这一指标综合考虑了精确率和召回率,表明模型在序列标注任务中表现优异,为后续的派生关系发现提供了可靠的成分分析基础。

3.2 通名提取与切分

通名提取与切分是未登录地名发现的关键步骤,其目标是从复合地名中识别出可能的嵌套结构和派生关系。具体流程如下:

1)标签序列统计与复合地名筛选

利用CRF层输出的标签序列(如B-GN、I-GN等),统计每个地名中的通名(GN)标签数量。筛选出包含多个通名标签的复合地名,作为候选派生地名。记录其通名位置和专名部分。

2)嵌套结构切分与候选潜在地名生成

根据英语地名的构成形式,结合BERT-CRF模型的标注结果,对复合地名进行层次化切分。例如,“Mataura River Bridge”可切分为“Mataura River”(嵌套地名)和“Bridge”(派生通名)。提取切分后的嵌套部分作为候选潜在地名。

为确保切分结果的准确性,避免出现结构性歧义(如将“北京南站广场”错误切分为“北京”+“南站广场”),本方法制定了明确的切分规则与消歧策略:①最长匹配原则:在多个可能的切分方案中,优先选择能形成最长、最完整专名的方案。该原则基于地名命名中普遍存在的整体性偏好,旨在保留语义最完整的原生地名。②通名优先原则:切分点的选择应确保切分出的后缀部分是一个在知识图谱通名库中明确存在的通名(如“广场”、“Bridge”)。此原则确保派生部分类别明确。③知识图谱验证驱动消歧:将依据上述原则得到的潜在地名,立即在知识图谱和背景地名库中进行查询与验证。若该候选地名能被映射到一个合理的地物类别,且与该派生地名的类别存在预定义的强关联,则确认该切分有效。若验证失败,系统则回溯至次优的切分方案(如“北京”+“南站广场”)并重复验证过程,或将其标记为需人工复审的歧义案例。通过上述规则的联合应用,本方法能够稳定地将“北京南站广场”切分为“北京南站”+“广场”,从而正确识别出核心的潜在地名。

3)通名归类

对切分出的通名部分,需进行归类以确定其对应的地理实体类别,这是后续进行类别关联性分析和空间关系推理的基础。本方法依据预定义的“通名-类别”映射表完成此过程。该映射表是通过系统性地整合OpenStreetMap(OSM)标签体系中的关键类别与本研究涉及的地名通名构建而成。

3.3 潜在派生关系判定

派生关系判定旨在验证候选潜在地名与候选派生地名之间的语义关系和空间关联性。具体步骤如下:

1)知识图谱查询与类别关联性分析

通过知识图谱查询候选潜在地名和派生地名的地物类别,检查两者是否满足预定义的强关联关系。“强关联”的判定是一个综合过程,主要依

据以下两个条件:①定量计算:计算两个类别之间的类别相似度Sim(ci,cj)。若该相似度值不低于70%(即≥0.7),则认为在数值上满足强关联条件。②定性规则:结合知识图谱中预定义的显性类别关联规则进行最终裁定。这些规则编码了领域知识,用于处理仅靠数值相似度无法准确判断的情况。

例如:“学校”与“地铁站”被显式定义为强关联,因为它们在实际空间中常因交通服务功能而紧密相邻,即使其类别相似度计算值可能不高。“学校”与“河流”则被显式定义为弱关联,因为两者在功能与空间上缺乏直接的派生逻辑,即使其词向量在某种语境下可能接近。

只有当一对类别同时满足“类别相似度≥70%”或在显式关联规则中被标记为“强关联”时,才最终被判定为具有强关联性。通过SPARQL(SPARQL protocol and RDF query language)查询类别关联强度的语句如下:

打开网易新闻 查看精彩图片

2)空间关系验证

通过知识图谱中的空间关系(如“相邻”“包含”)验证地名对的合理性。例如,“××学校”与“××地铁站”若在空间中相邻,则可能具有派生关系。

通过SPARQL查询在知识图谱中获取两类别的典型空间关系:

打开网易新闻 查看精彩图片

3)阈值过滤与关系确认

低于阈值的地名对将被过滤。对于未达到阈值但具有显著空间关联的地名对,需人工复审。

3.4 未登录地名发现

在确认派生关系后,需进一步验证潜在地名的有效性。在地名数据库中检索潜在地名(如“北京南站”),若无匹配记录,则进入下一步。若存在记录但描述不一致(如数据库中仅有“北京南火车站”),需通过相似度匹配判断是否为同一实体。若潜在地名满足以上条件,则判定为未登录地名。输出结果包括:未登录地名、派生地名、关联关系。

4 未登录地名空间位置推理

通过在知识图谱中查询派生地物类别与原生地物类别的空间关系,根据已知的派生地名位置推理潜在地名位置。

4.1 通名映射类别

潜在地名的空间位置推理首先需要明确其所属的地理实体类别。通名作为区分地理实体类型的关键要素,可通过预定义的映射表实现精准映射。具体步骤如下:

1)从潜在地名和候选派生地名中分离通名(如“Street”,“River”),并将其映射到更通用的地理实体类别(如“Road”,“Water”)。

2)当处理一个通名时,系统在映射表中进行精确或模糊查询,将其归类到对应的类别。对于复合通名(如“Suspension Bridge”),系统优先匹配整个短语,若失败则回退至核心通名(“Bridge”)进行匹配。

3)歧义处理:对于极少数存在歧义的通名(如“Court”可表示“法庭”建筑或“死胡同”道路),系统将结合该地名中识别出的专名部分所提供的上下文信息,并从知识图谱中查询该通名在不同类别下的使用频率,选择最可能的类别作为归类结果。通过以上步骤,可为后续空间关系预测提供语义约束,确保推理结果符合地理实体的实际分布规律。

4.2 知识图谱查询

基于通名映射的类别,从知识图谱中检索候选派生地名与潜在地名之间的典型空间关系,支撑位置推理。输入潜在地名类别和候选派生地名类别,使用SPARQL语言在构建的知识图谱中进行查询,输出空间关系。

4.3 位置推理

根据知识图谱返回的空间关系,结合候选派生地名的实际坐标生成潜在地名的可能位置。例如关系为span且候选派生地名“Kohaihai River Suspension Bridge”坐标为(x,y),则潜在地名“Kohaihai River”应位于该悬索桥的下方。如图所示是潜在地名位置推理的完整流程。

打开网易新闻 查看精彩图片

5 实验与分析

5.1 数据来源

实验数据来源于GeoNames官网。下载的地图矢量数据包括纳米比亚、博茨瓦纳、莱索托、斯威士兰等4个南非国家的矢量数据。该数据包括20209个地理实体和188个地理实体类别,主要包括类别如公园、河流、湖泊、学校、住宅道路、水、建筑、水库、停车场、自然保护区等。

5.2 派生关系规则形式化表达

基于本文的构建方法,将派生关系判定规则以三元组的形式存储在Neo4j图数据库中。最终识别出派生关系地名对1153个,这些关系构成了复杂的地名派生关系知识图谱,图2为示例,图3为具体的不同类别之间的派生关系。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

5.3 未登录地名发现和空间位置推理实验

5.3.1 实验步骤

用训练好的BERT-CRF模型对纳米比亚、博茨瓦纳、莱索托、斯威士兰等4个南非国家的地名数据进行标注,按8∶2划分训练集和测试集。匹配多通名的复合地名作为候选派生地名。从候选派生地名中提取嵌套子地名(如“Mataura River Brige”中的“Mataura River”)。在本地地名数据库中查询这些嵌套地名,若存在记录,则该地名在现实中已存在(非未登录地名)。若无记录,则进入下一步验证。

将未匹配的嵌套地名在OpenStreetMap(OSM)中进一步查询,确认是否无记录。若仍无记录,则判定为潜在地名。对最终筛选出的潜在地名进行人工核查,排除错误案例。

使用潜在地名识别的结果作为未登录地名输入数据,提取潜在地名和派生地名的通名,映射类别,确定潜在地名类别和候选派生地名类别。在知识图谱中查询两类别之间的空间关系,结合候选派生地名的实际坐标生成潜在地名的可能位置。

5.3.2 评价方法

在无法获取潜在地名真实位置的情况下,评估空间位置推理结果的合理性需要采用间接方法或替代指标。

1)基于已知地名的模拟验证

①从现有地名数据库中随机选取部分已知地名,人为隐藏其位置信息,将其作为“模拟的潜在地名”。

②使用相同的空间推理方法预测这些模拟潜在地名的位置,并与真实位置对比。

③计算位置误差,以此间接评估对未登录地名的推理能力。

2)人工合理性评估

邀请3名地理信息专家,对潜在地名的推理结果进行评分,按合理、部分合理和不合理3个等级进行评分。其中符合语义和空间逻辑为合理,位置大致正确但存在偏差为部分合理,推理位置存在明显错误为不合理。

3)多源数据验证

使用OSM地图查找使用本文方法推理出的潜在地名位置,观察推理位置附近是否存在未命名的相关地理实体(如无名道路、建筑),以间接证明推理的合理性。

5.3.3 未登录地名发现实验结果与分析

为了验证方法的有效性,通过人工识别潜在地名与本文方法进行对比评价。从南非4个国家经过预处理的地名数据中,随机抽取10000条数据进行验证分析。其中,人工识别的潜在地名共有1364个,通过本文的方法发现的潜在地名共有1153个。具体的分析结果如表3。

进一步分析发现,尽管该方法在大多数情况下都表现出色,但仍存在一些识别错误的情况。错误案例进一步分析表明,二词通名及二词以上的复合通名因训练语料中样本稀少,导致模型识别能力下降;多级派生(如“Tauranga Bay Beach Road”包含“Tauranga Bay”与“Tauranga Bay Beach”两级派生)因当前模型仅支持单层切分,未能递归解析多层结构,构成主要技术瓶颈。

打开网易新闻 查看精彩图片

针对上述瓶颈,未来的优化工作将围绕以下方向展开:①针对二词通名及二词以上的复合通名问题,需要构建一个领域特定的通名词典,并在模型预处理或后处理阶段进行集成,通过规则与统计相结合的方式提升低频复合通名的识别率。

②针对多级派生问题,需要将现有的单层切分模型改进为递归神经网络的层次化切分架构。该架构能够对切分后的候选地名进行迭代式再分析,直至无法发现新的派生结构为止,从而实现对复杂嵌套地名的完整解析。

5.3.4 空间关系推理实验结果与分析

1)模拟验证结果

在1000个已知地名的测试中:82%的推理位置误差≤100m。12%的误差在100~500m。6%的误差>500m。

对误差大于500m的案例进行深入分析后发现,地名点位标志方法的不一致性是导致重大空间偏差的一个重要原因。具体而言,开源地名数据库中地理实体的空间坐标通常以简化后的几何中心(如多边形质心)作为其位置代表,然而在实际地理语境中,该点位所承载的语义功能往往因地物类型与命名习惯的不同而存在显著差异。

以“北京大学”与“北京大学地铁站”的空间关系为例:在实际位置推理中,地铁站的位置应参照北京大学的主要入口或通行节点进行推算;而在开源数据中,“北京大学”的坐标可能被记录为整个校区多边形范围的几何质心。若以质心坐标为基准推理“北京大学地铁站”的位置,其结果可能与以实际校门为参照的推理结果相距数百米甚至更远,从而导致显著的空间位置误差。

未来研究需要考虑地物功能与位置标志的语义,采用多位置点或概率分布模型来更精确地表征地理实体的空间属性。

2)人工评估结果

对1153条潜在地名的推理结果:评分合理的占77.1%,部分合理的占16.5%,不合理的占6.4%。

3)多源数据验证结果

在OSM地图中,约41%的推理位置附近存在未命名的相关地理实体,间接支持推理合理性。

通过模拟验证、人工评估和多源数据验证,实验表明本文方法能有效预测潜在地名位置(合理率77.1%)。代理指标可替代真实位置缺失的评估需求。未来需结合多模态数据进一步提升推理精度。

6 结束语

本文提出了一种融合知识图谱与深度学习的未登录地名发现与空间位置推理方法。首先构建派生关系知识图谱,建立包含语义、空间和相似度约束的规则库;其次采用F1值达0.9567的BERT-CRF模型实现地名成分标注,支持结构解析。在Intel Xeon E5服务器上训练BERT-CRF模型耗时约3h,知识图谱查询平均响应时间<100ms,具备了实际部署的可行性。实验表明,本方法对未登录地名发现准确率达84.5%,并能通过知识图谱的空间关系进行位置推导,有效增强地理信息查询准确性,可为GIS系统提供自动化地名补全功能,并为历史地名研究和文化遗产保护提供技术支持。本文主要贡献为:①知识图谱与深度学习的协同应用提升了地名发现效率与定位精度;②建立了可解释的派生关系分析框架。

需要指出的是,该方法目前主要针对英语地名,对非洲土著语言(如斯瓦希里语、豪萨语)缺乏适应性,主要受限于训练语料稀缺与字符编码差异。针对类似局限性,未来工作将围绕以下两个核心方向展开:①多语言支持能力的深化。进行跨语言词向量与模型迁移、低资源命名实体识别。②知识图谱动态更新机制的构建。为实现地名知识的持续演进,需解决静态知识图谱的滞后性问题。具体技术路线包括:流式数据处理与事件检测、增量学习与模型更新、置信度评估与人工介入。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

作者:张婷婷,毛曦,路文娟

来源:《测绘科学》2026年第4期

选稿:贺雨婷

编辑:杜佳玲

校对:欧阳莉艳

审定:耿 曈

责编:杜佳玲

(由于版面内容有限,文章注释内容请参照原文)

打开网易新闻 查看精彩图片

微信扫码加入

中国地名研究交流群

QQ扫码加入

江西地名研究交流群

欢迎来稿!欢迎交流!

转载请注明来源:“江西地名研究”微信公众号