标题BENCHCOMPASS: From Scores to Signals for Training and Harness Decisions in Payment-Domain LLMs来源arXiv, 2609.18270v1️文章简介研究问题现有基准测试无法区分大模型在支付领域的失败是源于缺乏专业知识、未能利用提供的证据还是在面对不完美输入时的脆弱性如何精准定位这些能力短板主要贡献论文提出了BenchCompass一个由专家审核的支付领域基准测试及构建流水线能将模型表现转化为具体的诊断信号指导训练和工程优化。重点思路构建基于文档的诊断流水线利用LLM辅助从版本化的支付文档中生成基于场景的任务结合类型化证据包和布鲁姆分类法控制难度并通过LLM质量网关进行初步筛选最终由领域专家决定收录确保题目的高质量与可追溯性。设计三种评估设置以分离故障模式Closed设置仅凭模型参数知识作答测试领域知识储备Open设置提供充分证据测试基于上下文的推理能力Attacked Open设置在保留正确答案的前提下引入干扰信息测试模型在面对不完美输入时的鲁棒性。实施任务输入攻击以检验鲁棒性针对通过Open测试的题目生成保持答案不变的扰动变体如子规则前提崩塌、规则覆盖缺口过度泛化、先验反转等专门评估模型在误导性或信息缺失场景下是否仍能遵循正确逻辑。将分数转化为诊断信号通过对比不同设置下的表现将失败归因为参数知识缺失、上下文使用间隙或对抗环境下的脆弱性从而为后续的知识增强、检索优化或提示词工程提供明确方向。分析总结提供上下文能显著修复知识类错误在封闭环境下许多模型因缺乏特定支付规则知识而失败但在开放环境下提供相关规则后大部分此类错误得以纠正表明许多失败源于知识访问而非推理无能。上下文推理仍存在明显差距即使提供了充足证据顶尖模型在复杂场景推理上的准确率也未饱和最高89.6%主要错误集中在多规则综合、范围边界判断及异常处理上说明模型在深度理解与应用规则方面仍有不足。模型对误导性输入表现脆弱在受到攻击的输入设置下模型性能显著下降尤其是中等规模模型。即便拥有正确规则模型仍可能遵循看似合理但无效的工作流显示出对层级规则适用性和冲突处理的薄弱。不同故障模式指向不同优化路径实验表明提升支付领域能力不能仅靠单一手段需根据诊断信号分别加强领域知识训练、改进上下文推理机制或增强对规则适用性的验证能力。个人观点论文像医生一样通过“控制变量”的实验设计有无上下文、有无干扰来给大模型“确诊”揭示了支付场景中“知道规则”和“会用规则”是两回事特别是在面对现实世界中混乱、冲突的信息时模型的鲁棒性远比我们想象的要差。