面向大规模语义表格解释与数据质量评估的可解释表头中心框架
事件
知识图谱的质量不仅取决于下游图验证,也取决于整合前表格元数据的质量。在仅有元数据的语义表格解释场景中,单元格值缺失、噪声大或不适用,列标题成为可追溯知识图谱准备的关键语义证据。为此,研究者提出一个可解释、以表头为中心的框架,用于仅基于元数据的列类型标注与数据质量评估。
该框架利用人工整理的词汇资源,将表头映射到39种可解释的FinalFormat类型,并通过SourceKeywords保留词元级可追溯性。每种被赋予的类型会激活基于数据质量问题分类体系的验证规则,从而检测缺失数据、重复、领域违规、数据类型错误和时间不匹配等问题。这些检测结果被聚合为HeadersIQ,一个轻量、不加权的数据源级质量指标。
框架在UCI、Prague、Kaggle、VizNet/Sato、SOTAB、T2Dv2以及SemTab 2024元数据到知识图谱赛道等异构基准上评估,涵盖约12万个表头列。结果显示其对噪声较大的真实元数据具有较广的实用覆盖,并可通过并行的知识图谱映射路径对齐DBpedia与Schema.org。在SemTab 2024赛道上,官方严格真值评估成绩一般,但盲测诊断审计表明,许多不匹配源于基准粒度、别名和本体选择效应,而非表头中心预测完全不合理。该审计作为分歧模式的诊断证据报告,而非修正后的基准成绩。整体而言,论文提供了一套可复用的工作流,用于元数据驱动的语义标注、数据源级质量监控和面向知识图谱的基准诊断。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*