LETToT研究总结与核心内容翻译一、文章主要内容总结1. 研究背景与问题在旅游等特定领域评估大型语言模型(LLMs)面临两大核心挑战:一是标注基准数据集成本高昂,尤其在旅游这类专业领域难以实现;二是LLMs易产生“幻觉”(生成看似合理但错误的信息),且传统评估方法(如二元检查)无法覆盖旅游问答所需的多维度质量要求(如主题相关性、实用性等)。此外,旅游问答需结合实时数据(如航班状态、酒店 Availability)和个性化需求,与传统通用领域问答差异显著,现有通用评估基准难以适配。2. 核心框架:LETToT提出LETToT(Label-Free Evaluation of LLM on Tourism using Expert Tree-of-Thought),一种基于专家思维树(ToT)的无标注旅游领域LLM评估框架,分两阶段实现:阶段1:专家ToT的迭代优化与验证结合旅游领域通用质量维度(主题相关性、语境适配性等7个维度)和专家反馈,构建层级化ToT组件,并通过LLM-judge交叉验证迭代优化。最终优化后的ToT提示在多个质量维度上较基线提升4.99%-14.15%。阶段2:基于优化ToT的无标注评估以优化后的ToT组件为评估准则,设计基于“组件覆盖率”和“文本效率”的规则化可验证评分公式,无需标注数据即可评估LLM性能。评分公式整合