
文章主要内容总结本文聚焦于软件开发中提交消息(commit messages)的质量评估问题。提交消息是记录代码变更的关键文档,但实际中常存在质量不足(如空消息或信息不完整)的问题。尽管基于大型语言模型(LLMs)的自动提交消息生成技术已取得进展,但评估生成消息的质量仍面临挑战:传统基于参考文本的自动指标(如BLEU、ROUGE-L)存在局限性(如依赖文本相似度、无法处理语义等价但表达不同的消息),而人类评估虽准确却耗时耗力、可扩展性差。研究通过系统实验探索了LLMs作为自动评估器的潜力,核心发现包括:结合思维链(Chain-of-Thought)推理和少样本演示的LLMs评估性能接近人类水平,与人类评估的相关性较高;基于LLM的评估器显著优于传统自动指标,在与人类判断的一致性上表现更优;尽管LLMs存在固有变异性,但其在可重复性(相同输入的评分稳定性)、鲁棒性(语义等价但表达不同的消息的评分稳定性)和公平性(对人类与LLM生成消息的无偏性)上仍处于可接受范围。文章创新点首次实证研究LLMs用于提交消息评估:探索了有效提示策略(思维链+少样本),证明LLMs评估与人类评估的强相关性,为替代人类评估提供了可行方案。超越传统自动指标:验证了基于LLM的评估器在相关性上显著优于BLEU、ROUGE-L等传统指标,解决了传统指标依赖文本相似度的固有缺陷。全面分析稳定性:系统评估了LLMs评估器