SCA:面向GUI智能体强化学习的空间信用分配方法arXiv编号:arXiv:2609.36939v1摘要GUI智能体将自然语言指令映射到可视化界面上的可执行动作。现有的组相对强化学习,会对同一GUI状态采样多条响应并对比奖励,以此改进动作预测。但二元评估会把空间位置不同的失败点击视作完全等价;当全部采样点击全部失败时,无法提供任何相对学习信号。针对该缺陷,本文提出SCA(Spatial Credit Assignment,空间信用分配),利用采样点击的屏幕坐标来细化组相对信用分配。具体分为两条分支:SCA(N‑1)Residual处理混合命中组,利用组内其它响应预测留出样本的奖励,使用预测残差调整信用;SCA(N‑1)Prox处理全部失败组,依据采样点距离标注目标的远近做信用排序。空间参考信息仅用于训练阶段的参数更新,推理部署阶段仍然使用原始策略,不引入额外预测器。在受控合成实验中对比精确回报梯度,验证该修正可以改善策略更新误差、保证更新方向对齐。在GUI视觉定位、离线动作预测多套基准上,SCA在专业领域定位任务取得26.1分,OmniAct(N‑1)Desktop定位精度80.5 ± 0.41,GUI(N‑1)Odyssey任务成功率66.0 ± 0.52。在多数动作预测指标上超过其它强化微调基线,在全部GUI评测套件上获得一致正向增益。关键词GUI智能体;强化学习;信用分配;空间信用分配;组相对策略优化;视觉定位目录引言相关工作预备知识方法:SCA空间信用分配4.1 SCA(N‑1)Residual混合命中组残差信用4.2 SCA(N‑1)Prox全失败组邻近度信用4.3 模式路由与边界异常处理4.4 交叉拟合与计算开销实验5.1 实现细节5.2 基准实验结果5.3 跨领域分析5.4 精确梯度对照合成实验局限性结论参考文献附录简要说明1 引言GUI智能体接收截图与自然语言指令,输出点击、选择菜单、输入文本等结构化动作,横跨移动端、桌面端、网页界面。该任务融合视觉定位、动作类型选择、参数生成,需要把屏幕几何位置和语言指令建立映射,而不仅仅识别界面元素。近期研究表明,强化微调RFT相比大规模模仿学习,可用更少监督数据提升GUI动作预测性能。GRPO、RLOO这类组相对优化范式,对同一个状态采样多条响应,对比各自奖励计算优势函数,非常适配GUI任务;GUI动作可以通过确定性评估器快速校验,采样奖励可以直接用于策略更新。现有组相对信用分配存在固有缺陷:仅使用二元成功/失败奖励,忽略GUI动作的空间几何信息。同样判定为失败的点击,有的离目标很近,有的远离目标,但二元评估会给到完全一样的信用。带来两类问题:混合命中组:组内既有成功也有失败点击,可以观察到坐标(N‑1)奖励局部关系,但所有失败样本获得完全一样的组相对信用;全失败组:所有采样点击全部失败,组优势直接归零,即便各个点击距离目标远近不同,也丢弃全部空间证据。本文提出SCA空间信用分配,针对GUI分组强化学习:SCA(N‑1)Residual:处理混合命中样本组;在组内使用留出法拟合坐标(N‑1)奖励趋势,利用残差修正原始组相对优势;SCA(N‑1)Prox:全部样本都失败时,基于采样点距离标注目标的邻近度排序分配信用;全部命中组直接沿用原始组相对信用分配。重要设计:空间几何信息仅用于训练更新;推理阶段直接使用训练完成的策略,推理时不需要额外预测器,不增加推理开销。本文主要贡献针对GUI分组强化学习,提出空间信用分配范式,区分混合命中、全部失败两类失效场景,指出纯奖励驱动信用分配的缺陷。设计SCA(N‑1)Residual残差分支、SCA(N‑1)Prox邻近度分支;分别利用坐标(N‑1)奖励趋势、目标邻近度生成训练信号。通过合成精确梯度分析验证更新方向与误差;在ScreenSpot(N‑1)Pro、ScreenSpot、GUI(N‑1)Act(N‑1)Web、OmniAct、GUI(N‑1)Odyssey多套GUI基准完成评测,取得优于同类RFT基线的结果。2 相关工作组相对强化学习GRPO、RLOO、REINFORCE变体,从采样奖励构造优势信号。现有工作大多只利用标量奖励,SCA在组内进一步引入采样动作的空间坐标信息;采用留出交叉拟合,避免样本自引用。GUI智能体空间奖励GUI(N‑1)G²使用高斯奖励建模GUI定位;SE(N‑1)GUI研究GUI智能体自进化强化学习;目标距离塑形可以在点击失败时提供分级反馈。SCA和上述工作区别:不是直接设计全局稠密奖励函数;而是在组相对优化框架内部,依据组内采样样本做信用修正。混合命中场景用拟合坐标(N‑1)奖励残差;全失败场景才使用目标邻近度信号。GUI定位与导航评测ScreenSpot / ScreenSpot(N‑1)Pro用于UI元素定位,覆盖多个专业领域;GUI(N‑1)Act、OmniAct、GUI(N‑1)Odyssey、AndroidControl用于动作预测与交互。本文全部实验基于离线录制GUI状态,点击坐标与标注真值完备,用于检验空间信用分配带来的定位增益。3 预备知识3.1 策略损失与信用权重M i t M_{it}Mit​为响应token掩码;似然比:ρ i t = π θ ( y i t ∣ y i , t , x ) π θ o l d ( y i t ∣ y i , t , x ) \rho_{it}=\frac{\pi_{\theta}(y_{it}|y_{i,t},x)}{\pi_{\theta_{old}}(y_{it}|y_{i,t},x)}ρit​=πθold​​(yit​∣yi,t​,x)πθ​(yit​∣yi,t​,x)​标量信用A i A_iAi​会停止梯度,对该响应全部token共享。裁剪Actor损失:L ∗ a c t o r = − ∑ ∗ i , t M i t ℓ i t ∑ i , t M i t + λ K L D ^ ∗ K L , \mathcal{L}*{actor }=-\frac{\sum*{i, t} M_{i t} \ell_{i t}}{\sum_{i, t} M_{i t}}+\lambda_{KL} \hat{D}*{KL},L∗actor=−∑