《大型语言模型无训练对齐综述》核心总结与关键部分翻译一、文章主要内容总结本文是首篇针对大型语言模型(LLMs)无训练(TF)对齐方法的系统性综述,旨在解决传统基于微调(FT)的对齐方法存在的知识退化、资源密集、模型访问受限三大核心问题。1. 核心概念界定LLM对齐:确保模型输出符合人类价值观、伦理标准与法律规范,分为功能对齐(任务特定对齐、通用能力对齐)和规范对齐(公共安全与伦理对齐、个性化对齐)。无训练(TF)对齐:无需大量重训练模型,通过在生成 pipeline 的不同阶段干预实现对齐,适用于开源与闭源模型场景。2. TF对齐方法分类与机制文章按生成阶段将TF对齐方法分为三类,涵盖单模态LLM与多模态LLM(MLLMs)的应用:对齐阶段核心方法典型技术与案例优势与局限解码前(Pre-Decoding)调整输入或提示词,不修改模型参数- 简单提示工程:ICL(如URIAL用3个示例对齐)、文化适配提示(CoSA的安全配置)- 增强提示策略:RAG动态适配价值观(OPO)、跨语言CoT推理(AUTOC