目录与“仅检索”评估类型相关的指标上下文相关性Context relevance上下文覆盖需要基础事实Context coverage (requires ground truth)与“检索和回复生成”评估类型相关的指标正确性Correctness完整性Completeness有用性Helpfulness逻辑连贯性Logical coherence忠实度Faithfulness引用精确性Citation precision引用覆盖率Citation coverage危害性Harmfulness刻板印象Stereotyping回避性Refusal亚马逊 RAG 评测指标与“仅检索”评估类型相关的指标一些指标与评估您的知识库检索高度相关信息的能力相关。上下文相关性Context relevance该指标与检索到的信息的质量相关。其分数是数据集内对所有提示检索到的文本分块的平均分数。上下文相关性是指检索到的文本分块与问题具有背景相关性。分数越高平均而言信息的背景相关性就越密切。分数越低平均而言信息的背景相关性就越疏远。上下文覆盖需要基础事实Context coverage (requires ground truth)该指标与检索到的信息的质量相关。其分数是数据集内对所有提示检索到的文本分块的平均分数。上下文覆盖是指检索到的文本块涵盖了基础事实文本中提供的所有信息。分数越高平均而言上下文覆盖率越高。分数越低平均而言上下文覆盖率越低。与“检索和回复生成”评估类型相关的指标一些指标与评估您的知识库根据检索到的信息生成有用且适当的响应的能力相关。正确性Correctness该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。正确性是指准确回答问题。分数越高平均而言生成的响应就越正确。分数越低平均而言生成的响应就越不正确。完整性Completeness该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。完整性是指回答并解决了问题的所有方面。分数越高平均而言生成的响应就越完整。分数越低平均而言生成的响应就越不完整。有用性Helpfulness该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。有用性是指对问题给出全面且有用的响应。分数越高平均而言生成的响应就越有用。分数越低平均而言生成的响应就越没用。逻辑连贯性Logical coherence该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。逻辑连贯性是指没有逻辑漏洞、不一致或矛盾之处。分数越高平均而言所生成响应的连贯性就越好。分数越低平均而言所生成响应的连贯性就越差。忠实度Faithfulness该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。忠实度是指避免对检索到的文本分块产生幻觉。分数越高平均而言所生成响应的忠实度就越高。分数越低平均而言所生成响应的忠实度就越低。引用精确性Citation precision该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。引用精确性用于衡量正确引用的段落数。分数越高平均而言响应中正确的引用就越多。分数越低平均而言正确的引用就越少。如果您选择使用引用精确性那么您还应该使用引用覆盖率反之亦然。引用覆盖率近似于引用查全率。将两者结合使用可以全面了解引用质量。引用覆盖率Citation coverage该指标与所生成响应的质量相关。其分数是数据集内对所有提示的响应的平均分数。引用覆盖率近似于引用查全率用于衡量所引用段落对响应的支持程度如何。分数越高平均而言引用对响应的支持就越好。分数越低平均而言引用对响应的支持就越差。如果您选择使用引用覆盖率那么您还应该使用引用精确性反之亦然。将两者结合使用可以全面了解引用质量。危害性Harmfulness该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。危害性是指发表仇恨、侮辱或暴力言论。分数越高平均而言所生成响应的危害程度就越高。分数越低平均而言所生成响应的危害程度就越低。刻板印象Stereotyping该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。刻板印象是指针对单个人员或一组人员给出概括性表述。分数越高平均而言所生成响应的刻板印象程度就越高。分数越低平均而言所生成响应的刻板印象程度就越低。请注意如果同时存在大量赞美和贬低的刻板印象分数会很高。回避性Refusal该指标与所生成响应的适当性相关。其分数是数据集内对所有提示的响应的平均分数。回避性是指对问题的规避性回答。分数越高平均而言所生成响应的规避性就越高。分数越低平均而言所生成响应的规避型就越低。