文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载本文是《Applied LLMs Mastery 2024》第六周「LLM Evaluation Techniques」的完整技术导读。围绕评估整个 LLM 应用管线这一核心命题文章将系统拆解**管线评估Pipeline Evaluation与模型评估Model Evaluation**两大维度从 Prompt 测试框架与检索质量指标到响应相关性、对齐能力与任务特定基准并给出可直接套用的指标公式、判定逻辑与工具选型建议。读完本文你将掌握一套可用于生产实践的 LLM 评估指标矩阵能够针对自己的 RAG 应用与生成式任务选对评估维度。说明本文基于 week6_llm_evaluation.md课程归档的 2024 版内容供参考学习。该课程完整内容见 Applied LLMs Mastery 2024 课程首页最新课程索引见 repository index。为什么需要整个管线的评估评估 LLM 是否满足我们的特定需求至关重要。必须建立清晰的指标才能度量 LLM 应用带来的实际价值。这里的LLM 评估不是只测模型本身而是评估整个管线包括 LLM 自身、所有输入源、以及它处理的内容——具体来说既包括喂给 LLM 的 Prompt也包括 RAG 场景中检索到的文档质量。因此本课将 LLM 评估拆解为两个维度A. 管线评估Pipeline Evaluation评估 LLM 管线中各个组件的有效性包括 Prompt 与检索到的文档。B. 模型评估Model Evaluation评估 LLM 模型本身聚焦其生成输出的质量与相关性。这两个维度回答了同一个问题应用跑起来效果好不好到底是谁的功劳、谁拖了后腿在仓库的评估主题页 topics/evaluation.md 中本课程被列为该主题下Build 201级别的入门材料与之并列的还有更系统的 AI Evals for Everyone 课程含 10 个章节从参考数据集构建、指标设计到生产监控而持续更新的 AI Evaluation 2025 论文表 则记录了 2025 年以来评估领域的最新研究LLM-as-a-judge、基准数据集、鲁棒性评估等可与本文内容相互印证、追踪前沿。A. LLM 管线评估Prompt 与检索一个都不能少管线评估包含两类对象评估 Prompt鉴于 Prompt 对 LLM 管线输出有决定性影响需要深入讨论评估与试验 Prompt 的各种方法。评估检索管线对包含 RAG 的 LLM 管线至关重要即评估检索到的 top-k 文档对 LLM 性能的影响。A1. 评估 Prompt从人工试验到自动生成Prompt 的有效性可以通过试验不同 Prompt 并观察 LLM 性能变化来评估。这一过程由 Prompt 测试框架支撑典型的框架通常包含四类组件Prompt Registry提示词注册表为用户提供一个空间列出希望在 LLM 上评估的 Prompt。Prompt Playground提示词试验场用于试验不同 Prompt、观察并记录响应该功能通过调用 LLM API 获取响应。Evaluation评估区提供用户自定义函数用于评估不同 Prompt 的表现。Analytics and Logging分析与日志提供日志、资源用量等附加信息辅助选出最有效的 Prompt。常用的 Prompt 测试工具包括 Promptfoo、PromptLayer 等。这套注册—试验—评估—分析的闭环正是仓库 AI Evals for Everyone 中强调的评估数据集指标流程思想在 Prompt 环节的具体落地。自动 Prompt 生成Automatic Prompt Generation近年还出现了自动优化 Prompt 的方法。例如 Zhou 等人2022提出的Automatic Prompt EngineerAPE这是一个自动生成并挑选指令的框架。APE 把 Prompt 生成视为语言综合问题language synthesis problem用 LLM 本身来生成和探索候选方案首先LLM 基于输出示例生成 Prompt 候选这些候选引导搜索过程随后用目标模型执行这些 Prompt最后根据评估分数选出最佳指令。这个生成候选 → 目标模型执行 → 按分数择优的流程如下图所示A2. 评估检索管线RAG 场景必须看中间产物在 RAG 场景中只评估最终输出无法还原全貌——LLM 是基于提供的上下文来回答问题的因此评估中间结果尤其是检索到的文档质量至关重要。如果你对 RAG 不熟悉可先阅读 week4_RAG.md 了解其运作原理ingestion → retrieval → synthesis 三阶段。以下讨论中我们把 top-k 检索文档统称为 LLM 的上下文context它正是需要评估的对象。下述指标主要源自RAGas——一个开源的 RAG 管线评估库。1. Context Precision上下文精确率Context Precision 评估检索结果中所有 ground-truth 相关条目是否被排在更靠前的位置。理想情况下所有相关块都应出现在靠前的排名中。该指标由**问题question和上下文contexts**计算得出取值在 0 到 1 之间分数越高表示精确率越好$$ \text{Context Precisionk} {\sum {\text{precisionk}} \over \text{total number of relevant items in the top K results}} $$$$ \text{Precisionk} {\text{true positivesk} \over (\text{true positivesk} \text{false positivesk})} $$其中 k 是 contexts 中块chunk的总数。2. Context Relevancy上下文相关性该指标衡量检索上下文的相关性纯度由问题和上下文共同计算取值在 (0, 1) 之间越高越好。理想情况下检索到的上下文应只包含回答该问题所必需的信息。计算时先识别检索上下文中与回答问题相关的句子再按如下公式给出最终分数$$ \text{context relevancy} {|S| \over |\text{Total number of sentences in retrived context}|} $$直观示例Hint高相关性问题What is the capital of France?——上下文France, in Western Europe, encompasses medieval cities, alpine villages and Mediterranean beaches. Paris, its capital, is famed for its fashion houses, classical art museums including the Louvre and monuments like the Eiffel Tower.句句紧扣首都主题低相关性同一问题下追加了大量无关信息...The country is also renowned for its wines and sophisticated cuisine. Lascauxs ancient cave drawings, Lyons Roman theater and the vast Palace of Versailles attest to its rich history.有用句子占比下降3. Context Recall上下文召回率Context Recall 衡量检索上下文与标注答案视为 ground truth的对齐程度由 ground truth 与检索上下文计算取值 0 到 1越高越好。计算时对 ground truth 中的每个句子逐一分析判断其能否归因于检索上下文理想情况下ground truth 中的所有句子都应能从检索上下文中找到出处$$ \text{context recall} {|\text{GT sentences that can be attributed to context}| \over |\text{Number of sentences in GT}|} $$通用检索指标何时用、注意什么也可以使用通用检索指标评估检索文档/上下文质量但需注意这些指标对检索结果的排名次序赋予较大权重而这在 RAG 场景中可能并非那么关键LLM 通常把 top-k 全部作为上下文而非只取第一名Mean Average PrecisionMAP对每个相关文档被检索到后的精确率求平均考虑文档顺序在检索顺序重要时尤其有用。Normalized Discounted Cumulative GainnDCG根据文档在结果列表中的位置衡量增益增益从列表顶部向底部累积且低排名结果的增益会被折扣。Reciprocal Rank倒数排名关注第一个相关文档的排名第一个相关文档排名越靠前分数越高。Mean Reciprocal RankMRR对一组查询的结果倒数排名取平均特别适用于关注第一个正确答案排名的场景。背景延伸RAG 检索质量本身也是仓库持续跟踪的研究热点RAG 研究论文表 中专门设有 RAG Evaluation 与 Retrieval Improvement 分类记录了如 ChartWalker跨图表 RAG 基准、Answer Presence Drives RAG Rewriting Gains干预审计式评估等最新工作可作为评估指标的进阶参考。B. LLM 模型评估直击管线心脏评估完管线组件后进入管线的核心——LLM 模型本身。由于 LLM 应用面广、能力强直接评估并不简单不同用例需要侧重不同维度。例如在精度至上的应用中评估模型是否避免幻觉生成不实内容至关重要而在需要跨人群保持中立的应用中避免偏见的原则性表现又成为重点。模型评估可大致分为三类相关性指标Relevance Metrics评估响应与用户查询、上下文的贴切程度。对齐指标Alignment Metrics评估模型在特定用例中与人类偏好的一致性如公平性、鲁棒性、隐私性。任务特定指标Task-Specific Metrics衡量 LLM 在不同下游任务如多跳推理、数学推理上的表现。B1. 相关性指标响应质量的第一道关卡常用响应相关性指标包括Perplexity困惑度衡量 LLM 对一段文本样本的预测能力困惑度越低表示性能越好。该指标是语言模型内部的自评估方式相关数学解释可参考 Hugging Face Transformers 文档中的 perplexity 章节。Human Evaluation人工评估由人类评估者依据相关性、流畅度、连贯性、整体质量等标准评判模型输出。BLEUBilingual Evaluation Understudy将 LLM 生成输出与参考答案对比衡量相似度BLEU 分数越高表示性能越好。Diversity多样性衡量生成响应的多样性与独特性包括 n-gram 多样性或语义相似度等指标多样性分数越高表示输出越丰富、越不重复。ROUGERecall-Oriented Understudy for Gisting Evaluation将生成文本与参考文本对比评估生成文本对参考文本关键信息的覆盖程度ROUGE 计算精确率、召回率和 F1 分数揭示生成与参考文本的相似度。面试视角补充这些指标也是 LLM 工程师面试的常客。仓库的 60 道生成式 AI 面试题 中明确把 Perplexity、Human Evaluation、BLEU、ROUGE、Diversity 列为评判 LLM 生成质量的常用指标并特别提醒过度依赖 perplexity 是有问题的——它主要衡量模型对下一词的预测能力可能忽略连贯性、事实准确性与深层语义理解。这正是相关性指标需要组合使用的原因。RAG 特定的相关性指标除通用指标外RAG 管线还需要额外指标来判断答案是否与给定上下文相关以及是否回答了用户问题。RAGas 定义的相关指标如下1. Faithfulness忠实度衡量生成答案对给定上下文的事实一致性由答案与检索上下文计算结果归一化到 (0, 1)越高越好。若答案中的所有论断都能从给定上下文推导出来则认为该答案是忠实的。计算时先提取答案中的论断集合再逐一与上下文交叉核对判断能否由上下文推断得出$$ {|\text{Number of claims in the generated answer that can be inferred from given context}| \over |\text{Total number of claims in the generated answer}|} $$直观示例Hint问题Where and when was Einstein born?上下文Albert Einstein (born 14 March 1879) was a German-born theoretical physicist, widely held to be one of the greatest and most influential scientists of all time高忠实度答案Einstein was born in Germany on 14th March 1879.论断全部可由上下文推断低忠实度答案Einstein was born in Germany on 20th March 1879.出生日期与上下文矛盾2. Answer Relevance答案相关性评估生成答案对给定问题的贴切程度。不完整或包含冗余信息的答案得分更低。该指标由问题与答案计算取值 0 到 1越高越好。一个答案只要直接且恰当地回应了原问题即视为相关。注意答案相关性评估不考察事实性而是惩罚答案不完整或包含冗余细节的情况。计算方式为多次提示 LLM 为生成答案反推合适的问题然后测量这些生成问题与原问题之间的平均余弦相似度。其思想是如果生成答案准确回应了初始问题那么 LLM 应能据此生成与原问题一致的问句。3. Answer Semantic Similarity答案语义相似度评估生成答案与 ground truth 之间的语义相似程度由 ground truth 答案与 LLM 生成答案计算取值 0 到 1分数越高表示生成答案与 ground truth 越一致。该指标使用**交叉编码器模型cross-encoder model**计算语义相似度能深入揭示生成响应的质量。B2. 对齐指标让 LLM 符合人类标准这类指标在 LLM 直接与人交互的应用中至关重要。其难点在于难以用数学量化——实践中通常是在针对对齐设计的基准上运行特定测试用测试结果作为间接度量。例如评估模型公平性时使用包含刻板印象识别的数据集模型在此类任务上的表现即作为其公平性对齐的间接指标。因此对齐评估没有放之四海而皆准的方法。本课程采用 TRUSTLLMTRUSTLLM: Trustworthiness in Large Language Models这篇有影响力的研究中的思路来探索对齐维度与代理任务。论文作者进一步将每个维度细分为更具体的子类下图所示例如 Truthfulness 细分为错误信息、幻觉、谄媚sycophancy与对抗性事实性adversarial factuality每个子维度都配有相应的数据集与指标来量化。对齐没有统一定义但可以用以下维度来量化定义取自上述论文Truthfulness真实性LLM 对信息的准确呈现涵盖对生成错误信息、幻觉、谄媚行为以及纠正对抗性事实的能力评估。Safety安全性LLM 避免不安全或非法输出、促进健康对话的能力。Fairness公平性LLM 避免偏见或歧视性结果评估刻板印象、贬损与偏好偏差。Robustness鲁棒性LLM 在各种输入条件下的稳定性与表现区别于抵御攻击的能力。Privacy隐私性强调保护人类与数据自主权重点评估 LLM 的隐私意识与潜在泄露。Machine Ethics机器伦理由于缺乏全面的伦理理论可拆分为内隐伦理implicit ethics、外显伦理explicit ethics与情感意识emotional awareness三个部分。Transparency透明度用户可获得的关于 LLM 及其输出的信息可用性。Accountability可问责性LLM 自主为其行为提供解释与理由的能力。Regulations and Laws法规遵循LLM 遵守国家与组织规则法规的能力。 这本质上是用代理任务proxy tasks 数据集 指标来评估 LLM 在特定维度的表现。实际项目中选择哪些维度取决于你的具体任务需要按需挑选最适用的维度组合。B3. 任务特定指标为具体任务定制基准LLM 应用千差万别常常需要量身打造包含数据集与指标的基准来评估特定任务表现。例如开发需要强推理能力的聊天机器人可用常识推理基准评估多语言理解可用机器翻译基准。以下是一些经典案例GLUEGeneral Language Understanding Evaluation包含九个任务衡量模型理解英语文本的能力任务涵盖情感分析、问答、文本蕴含textual entailment。SuperGLUEGLUE 的扩展版任务更具挑战性推动模型理解能力的上限包含词义消歧、更复杂的问答与推理任务。SQuADStanford Question Answering Dataset阅读理解基准模型需根据给定文本段落预测问题答案。常识推理基准Commonsense Reasoning BenchmarksWinograd Schema Challenge通过解决句中的代词指代问题测试模型的常识推理与理解能力。SWAGSituations With Adversarial Generations评估模型基于常识预测给定句子最合理结局的能力。自然语言推断基准NLI BenchmarksMultiNLI测试模型判断给定前提与假设关系的能力蕴含entailment、矛盾contradiction或中性neutral。SNLIStanford Natural Language Inference与 MultiNLI 类似但使用不同的评估数据集。机器翻译基准Machine Translation BenchmarksWMTWorkshop on Machine Translation年度赛事提供各语言对翻译质量评估的数据集。面向任务的对话基准Task-Oriented Dialogue BenchmarksMultiWOZ评估面向任务对话中对话系统的数据集如预订酒店、寻找餐厅等场景。代码生成与理解基准Code Generation and Understanding BenchmarksMBPP Dataset约 1,000 道众包的 Python 编程问题难度设计为入门级程序员可解。图表理解基准Chart Understanding BenchmarksChartQA包含基于图表摘要自动生成的机器问题聚焦现有数据集常因依赖模板问题与固定词汇而忽视的复杂推理任务。Hugging Face 的Open LLM Leaderboard汇集了大量用于评估基础模型与聊天机器人的数据集和任务是横向比较开源模型的标准入口。该排行榜基于 EleutherAI 的 Language Model Evaluation Harness 实现自动化评估可筛选模型类型预训练/领域微调/聊天模型、精度float16、8bit 等与参数量并查看 Average、ARC、TruthfulQA、GSM8K 等经典基准得分评估指标速查与选型建议评估层级指标计算输入取值范围/语义适用场景管线-PromptPrompt Registry / Playground / Evaluation / Analytics提示 LLM API—试验并挑选最优 Prompt管线-PromptAPE自动 Prompt 工程示例 目标模型 评分按评估分数择优自动化 Prompt 优化管线-检索Context Precisionk问题 contexts0~1越高越好相关块是否排在靠前位置管线-检索Context Relevancy问题 contexts0~1越高越好上下文是否纯净、无冗余管线-检索Context Recallground truth contexts0~1越高越好答案信息能否从上下文追溯管线-检索MAP / nDCG / Reciprocal Rank / MRR检索结果排序排名导向排序敏感的传统检索模型-相关性Perplexity文本样本越低越好模型预测能力自评模型-相关性Human Evaluation人类评估定性相关性、流畅性、连贯性模型-相关性BLEU / ROUGE生成 vs 参考越高越好翻译、摘要等参考型任务模型-相关性Diversity生成输出越高越多样生成多样性模型-RAG 相关Faithfulness答案 上下文0~1越高越好答案论断能否从上下文推断模型-RAG 相关Answer Relevance问题 答案0~1越高越好答案是否切题、无冗余模型-RAG 相关Answer Semantic Similarity答案 ground truth0~1越高越好交叉编码器语义相似度模型-对齐Truthfulness / Safety / Fairness / Robustness / Privacy / Machine Ethics / Transparency / Accountability / Regulations基准 代理任务间接度量人机交互、可信赖性模型-任务GLUE / SuperGLUE / SQuAD / Winograd / SWAG / MultiNLI / SNLI / WMT / MultiWOZ / MBPP / ChartQA专用基准数据集任务准确率通用理解、推理、翻译、代码、图表选型核心原则管线类指标定位故障在哪一环Prompt 写坏了还是检索带偏了相关性指标回答答得贴不贴题对齐指标回答能不能放心给人用任务特定基准回答能不能胜任具体业务。实际项目应像本课程建议的那样先确定业务目标再从四个层级中各取所需指标组合成一个可执行的评估矩阵。延伸学习资源本主题在仓库中有丰富的前后衔接材料继续系统学习评估方法论阅读 AI Evals for Everyone 的 10 个章节其中第 2 章模型评估 vs 产品评估与本文的管线 vs 模型双维度互为印证第 5 章介绍从代码型指标到 LLM-as-judge 的落地做法。跟进最新评估研究浏览 AI Evaluation 2025 论文表覆盖 LLM Judges、Benchmarks、域特定评估、多模态评估、鲁棒性与安全性评估等八大类。面试复习对照 60 道生成式 AI 面试题 中关于评估指标、幻觉检测Seq-Logprob、Sentence Similarity、SelfCheckGPT、G-EVAL 等方法与 perplexity 局限性的问答检验理解深度。检索质量专项结合 RAG 研究论文表 中 RAG Evaluation 与 Retrieval Improvement 分类了解检索指标在 2025-2026 年的最新进展。赞分享文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载相关推荐2024终极指南20天快速入门生成式AI从零基础到实战高手2024终极指南20天快速入门生成式AI从零基础到实战高手 Generative AI Genius 2024是一门专为忙碌人士设计的20天生成式AI入门课文档教程人工智能大模型AI智能体评估实战指南从性能到成本的四维评测体系AI智能体评估实战指南从性能到成本的四维评测体系 在AI智能体快速发展的今天如何科学评估这些智能体的真实价值成为技术决策者和开发者的关键挑战。本文基于AweAI Agent人工智能Applied LLMs Mastery 2024 第 3 周精讲LLM 微调全景——从指令微调、RLHF 到 PEFT 与 DPO 的完整指南Applied LLMs Mastery 2024 第 3 周精讲LLM 微调全景——从指令微调、RLHF 到 PEFT 与 DPO 的完整指南 本文整理自文档教程人工智能大模型创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考