✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

面向大规模语义表格解释与数据质量评估的可解释表头中心框架

事件

知识图谱的质量不仅取决于下游图验证,也取决于整合前表格元数据的质量。在仅有元数据的语义表格解释场景中,单元格值缺失、噪声大或不适用,列标题成为可追溯知识图谱准备的关键语义证据。为此,研究者提出一个可解释、以表头为中心的框架,用于仅基于元数据的列类型标注与数据质量评估。

该框架利用人工整理的词汇资源,将表头映射到39种可解释的FinalFormat类型,并通过SourceKeywords保留词元级可追溯性。每种被赋予的类型会激活基于数据质量问题分类体系的验证规则,从而检测缺失数据、重复、领域违规、数据类型错误和时间不匹配等问题。这些检测结果被聚合为HeadersIQ,一个轻量、不加权的数据源级质量指标。

框架在UCI、Prague、Kaggle、VizNet/Sato、SOTAB、T2Dv2以及SemTab 2024元数据到知识图谱赛道等异构基准上评估,涵盖约12万个表头列。结果显示其对噪声较大的真实元数据具有较广的实用覆盖,并可通过并行的知识图谱映射路径对齐DBpedia与Schema.org。在SemTab 2024赛道上,官方严格真值评估成绩一般,但盲测诊断审计表明,许多不匹配源于基准粒度、别名和本体选择效应,而非表头中心预测完全不合理。该审计作为分歧模式的诊断证据报告,而非修正后的基准成绩。整体而言,论文提供了一套可复用的工作流,用于元数据驱动的语义标注、数据源级质量监控和面向知识图谱的基准诊断。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容