文章主要内容和创新点主要内容本文提出了一个基于大型语言模型(LLM)的统一模块化模式匹配框架LLMatch,用于解决企业数据集成中复杂的多表模式对齐问题。核心目标:解决传统方法在多表模式匹配中对语义差异、结构依赖(如主键-外键关系)处理不足的问题,实现源模式与目标模式的精准映射。框架设计:将模式匹配分解为三个阶段——模式准备(整理 schema 信息为标准类别)、表候选选择(筛选与源表相关的目标表)、列级对齐(建立列之间的映射)。优化策略:引入“Rollup-Drilldown”两级优化:Rollup将语义相关列聚合为高阶概念(如将updated_at和created_at合并为timestamp),实现粗粒度对齐;Drilldown将聚合概念还原为原始列,进行细粒度映射。基准数据集:针对现有基准缺乏复杂语义匹配场景的问题,构建了SchemaNet基准,涵盖金融、医疗、娱乐三个领域的真实世界模式对,包含多表、复杂关系和多对多映射。实验验证:在SchemaNet等5个基准上的实验表明,LLMatch在复杂模式匹配任务中显著优于传统方法和现有LLM方法(如ReMatch),且能提升工程师在实际数据集成中的效率。创新点