135、强化学习在Agent调优中的应用调试一个老项目时见过最诡异的Agent行为:同一个Prompt,昨天回答得好好的,今天突然开始疯狂重复某个动作,像卡了磁带一样。查了日志,不是上下文溢出,不是API限流,连随机种子都固定了,最后发现是Agent内部那个用于平衡探索和利用的温度参数,在长期运行中被某个策略梯度更新带到了极低值。模型彻底“锁死”在一条固定路径上,失去了所有随机性。那时候我意识到,光靠调Prompt和调工具链,根本管不住一个具备学习能力的系统——你需要真的把强化学习那套东西请进来,不是当概念,而是当调试工具用。先别急着把RL想成训练一个大模型。在Agent调优这个场景里,我们面对的问题是:一个由LLM、工具调用、状态记忆、判定规则组成的复杂系统,行为空间巨大,反馈信号稀疏且延迟。传统的规则调参,改一个阈值可能影响十个下游行为,你根本分不清是哪一环导致整体性能下降。而RL给我们提供了一个非常务实的视角——把Agent的决策过程看成策略,把用户满意度或任务完成度看成奖励,然后用策略梯度或者Q学习的方式去迭代这个策略。本质上,你不是在“训练”Agent,你是在“自动搜索”一组最优的行为参数。我实际干过的一件事,是给一个客服Agent调“转人工”的触发时机。最初规则很简单:当用户情绪负面且连续两次澄清失败,转人工。上线后发现转人工率偏高,用户老是抱怨“怎么每次都让我等人工”。我把规则改成“三次失败+情感阈值0.7”,结果转人工率降了,但用户满意度也降了——因为有些问题确实该早点转人工,硬撑三次体验更差。来回试了十几个阈值组合,每次都要等一周的线上数据才能评估。后来我用了一个轻量级的策略梯度实现,把两个阈值和情感模型的那个判定边界当作策略参数,用A/B测试的转