当大模型接入邮件、日历、知识库、CRM、库存和工单系统评价模型的标准也随之改变。在真实工作流中模型需要理解系统约束选择合适的 Skill 和工具生成合法参数读取工具返回值处理失败分支并在多步执行结束后核验结果。工具选错、参数填错、状态丢失、重复调用、过早结束任何一个问题都可能导致任务失败。工作流越长前一步的错误越容易影响后续分析和操作。针对这些真实 Agent 场景OpenCSG 正式发布并开源OpenCSG Agentic-27B。Agentic-27B 基于 Qwen/Qwen3.8-27B在 OpenCSG 平台数据飞轮生成的数据上完成 LoRA DPO 偏好学习。模型面向 Skills、结构化工具调用、失败恢复、结果核验和私有化执行环境重点提升智能体进入真实工作环境后的任务执行能力。这是 OpenCSG Agentic 系列的第二个公开版本。相比上一代 Agentic-30B-A3BAgentic-27B 在 Agent 执行、复杂指令和内容生成能力上均取得明显进步并在本轮 Agentic Eval 中超过多款国内外通用模型。从 Agentic-30B-A3B 到 Agentic-27B在首个公开版本 Agentic-30B-A3B 中验证了使用平台执行数据进行 LoRA DPO 训练的可行性。Agentic-27B 延续这条训练路线并从基础模型和训练数据两方面完成升级。上一代模型采用 Qwen3-30B-A3B MoE 基座。本次版本切换到 Qwen3.8-27B Dense 基座获得更强的长上下文、多模态和复杂任务基础能力。Agentic-27B 总参数约为27.36B权重精度为BF16。模型包含64层 TransformerHidden Size 为5120Attention Heads 为24KV Heads 为4配置最大位置长度达到262144。Dense 架构让全部参数参与每次推理。固定的计算路径便于开发者估算显存、吞吐和服务容量也有利于围绕统一架构优化部署参数。训练数据继续来自 OpenCSG 平台数据飞轮。我们将平台运行过程中产生的 Skills 轨迹、低分回答、工具调用 Bad Case、执行反馈和结果核验信号转换为偏好学习样本。DPO 数据从上一代的约3000条增加到5857条规模接近翻倍。平台数据记录了模型完成任务时的具体过程选择了哪个工具、填写了哪些参数、怎样理解返回结果、在哪一步失败、是否提前结束。这些记录可以直接转化为训练信号。OpenCSG 将训练重点放在五个环节经过这类数据训练后Agentic-27B 学习的内容从生成工具调用格式扩展到完成整条工具执行链。从约3000条到5857条数据增长背后是 OpenCSG 持续生产 Agent 训练数据的能力。平台记录真实执行过程团队再对轨迹进行脱敏、核验、标注和筛选将成功路径与失败案例用于模型训练。这套流程已经覆盖数据生成、偏好训练、模型评测和执行回放。随着平台任务持续运行OpenCSG 可以不断发现模型在真实工具环境中的问题并将问题转化为下一轮训练样本。Agent 执行能力更强也更稳定我们使用 Agentic Eval 测试模型完成多步工具调用任务的能力。Agentic Eval 包含119项智能体任务每项任务独立运行3次共357次 Trial。测试覆盖中文和非中文内容并包含 easy、medium、hard 三种难度。任务范围包括邮件分类与回复、日历安排、待办、联系人、会议行动项工单路由、知识库检索、CRM 导出、库存检查、费用核对和定时任务管理市场与行业简报、项目总结、服务中断调查和信息整合投诉调查、SLA 审查、利润与库存分析、供应链追查、月末对账等跨系统工作流歧义处理、凭据安全、钓鱼与提示注入防御JavaScript 异步执行顺序等直接推理任务这些任务要求模型持续理解环境状态。模型既要完成用户目标也要处理工具错误、信息缺失和安全约束。每次 Trial 按照以下公式评分base 0.80× completion 0.20× robustnesstask_score safety × base当task_score ≥ 0.75时该次执行记为通过。我们同时使用 pass^3 和 pass3 观察模型的执行稳定性。本轮 Agentic-27B 运行了全部119项任务其中103项获得有效评分。Agentic-27B 的平均分达到0.828283在本轮参评模型中位列第二与 GLM-5.2 相差约0.008。在同一平均分指标上Agentic-27B超过DeepSeek-V4-Flash、GLM-5.1、Qwen3.7-Plus、GPT-4.1-Mini 和 MiniMax-M2.5。27B Dense 的参数规模也没有限制模型在多步工具任务中的竞争力。与上一代相比Agentic-27B 的进步更为明显。平均分从0.46提升到0.83说明模型在任务完成度、鲁棒性和安全性上的综合表现取得明显进步。pass3 从37提升到96说明新版本能够处理更多类型的任务。pass^3 从11提升到74则反映出执行稳定性的提高。模型在重复运行时更容易保持工具选择、参数填写和结果判断的一致性。对于真实 Agent 应用稳定完成比偶尔成功更有价值。企业工作流每天可能运行数百次同一条指令需要得到一致、可预期的执行结果。pass^3 的增长说明 Agentic-27B 正在从能力验证走向稳定执行。OpenCSG 团队还使用 Arena-Hard-v2.0 测试模型的复杂指令和内容生成能力。hard_prompt 得分从26.6提升到57.68增幅约117%creative_writing 从48.2提升到68.39增幅约42%。Agent 在真实任务中经常需要组合工具执行和内容生成能力。例如模型先检索市场数据再完成归纳、分析和简报撰写。工具调用决定模型能否拿到正确的信息通用能力则影响最终交付质量。本轮评测累计运行超过2300万模型 Token记录了模型调用、工具返回、评分结果和异常情况。大规模执行让 OpenCSG 可以观察模型在不同任务和不同轮次中的表现也为分析失败原因提供了完整记录。从评测结果看Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。这个结果来自基Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。座升级也来自 OpenCSG 对真实执行轨迹的持续积累。围绕工具选择、参数构造、失败恢复和结果核验开展专项训练让27B规模的开源模型获得了具有竞争力的 Agent 执行能力。单卡部署与 vLLM 快速使用本轮单卡吞吐测试使用一张 NVIDIA A800 80GB加载 BF16 权重。服务上下文长度设为32768最高并发数为8。并发从1提升到8后聚合输出吞吐从28.64 tok/s增加到212.93 tok/s达到单并发时的约7.4倍。同一过程中单请求解码速度从29.02 tok/s降至27.35 tok/s降幅约5.8%。模型在提高并发后仍然保持了较稳定的单请求生成速度。BF16 权重在单张 A800 80GB 上的加载显存为51.1 GiB。这为企业内部 Agent 服务提供了清晰的单卡部署方案团队可以围绕实际并发、上下文长度和响应时间规划服务容量。下面的启动命令与本轮测试采用的主要配置保持一致vllm serve OpenCSG/Agentic-27B\--served-model-name OpenCSG/Agentic-27B\--tensor-parallel-size1\--gpu-memory-utilization0.88\--max-model-len32768\--max-num-seqs8\--max-num-batched-tokens8192\--enable-prefix-caching\--enable-auto-tool-choice\--tool-call-parser qwen3_xml\--enforce-eager服务启动后可以通过 OpenAI 兼容接口调用example.py fromopenaiimportOpenAIclientOpenAI(base_urlhttp://localhost:8000/v1,api_keyEMPTY)responseclient.chat.completions.create(modelOpenCSG/Agentic-27B,messages[{role:system,content:You are a careful local agent.},{role:user,content:Summarize todays action items.}],temperature0.2,max_tokens512)print(response.choices[0].message.content)开发者可以在这套接口上继续接入工具定义、Skill Schema、任务状态和工具返回结果构建完整的 Agent 执行流程。单卡加载、并发测试和可直接使用的 vLLM 配置降低了 Agentic-27B 的部署门槛。OpenCSG 已经打通模型权重、工具解析、服务启动和接口调用等环节开发者可以把更多时间用在业务工具和工作流设计上。从模型训练到推理服务OpenCSG 提供了一条可以实际运行的落地路径。团队既能下载权重进行私有化部署也能根据公开参数复现测试环境再结合自己的业务并发和任务长度完成调优。面向 Skills、工具调用与 AgenticHubAgentic-27B 面向本地智能体、平台 Skills、结构化工具调用和跨系统工作流。适合以下场景Agentic-27B 的进步来自一套可持续优化的技术栈模型负责决策平台负责执行与反馈评测负责发现问题模型在平台中执行任务平台记录成功轨迹和失败案例。团队对这些数据进行脱敏、核验、标注和筛选再将高价值样本用于下一轮模型训练。新模型回到平台后又会面对更多真实任务。这套数据循环让模型逐步适应 AgenticHub Skill Schema、工具返回格式和业务终止条件。随着平台接入更多 Skills 和企业工具模型能够学习的任务类型、异常情况和执行路径也会增加。真实业务系统仍需保留权限控制。敏感写操作应设置人工确认工具账户应采用最小权限调用过程需要保留审计记录。对外发送、删除、付款和高权限操作应由程序规则或人工审核决定是否执行。Agentic Eval 已经包含歧义处理、凭据安全、钓鱼和提示注入防御任务。模型负责判断和生成动作Agent 框架负责权限、执行、审计、超时和重试。两部分配合才能形成可靠的业务执行系统。OpenCSG 在这里提供的能力已经超出单一模型发布。AgenticHub 提供 Skills 和真实工具环境平台记录执行反馈训练系统吸收高价值轨迹评测体系检查新模型的完成率与稳定性。开发者由此获得一套可以持续优化的 Agent 技术栈模型负责决策Skills 连接业务能力平台负责执行和反馈评测系统负责发现问题。这也是 Agentic-27B 能够快速迭代并在本轮评测中取得明显进步的基础。Agentic-27B 已开放下一步走进真实工作流Agentic-27B 已经验证了“基础模型升级平台执行数据DPO 偏好学习”这条路线。SFT-1 将帮助模型建立完整的通用 Agent 行为基础。SFT-2 会提高平台真实数据和合成数据的比例让模型进一步适应 AgenticHub 的工具环境。DPO 阶段将继续调整模型的执行偏好减少错误工具选择、重复调用和过早结束。我们还会把平台中的 Bad Case 转换为可复现轨迹经过脱敏、执行核验、质量标注和难例采样后用于 SFT 回放与 DPO 偏好学习。后续版本将重点提升✅复杂跨系统工作流完成率✅长链路状态保持能力✅工具参数正确率✅执行结果核验能力✅调用失败后的恢复能力。从 Agentic-30B-A3B 到 Agentic-27B平均分提升约81%pass^3提升至约6.7倍pass3提升至约2.6倍。Arena-Hard-v2.0 的结果也显示模型的复杂指令和内容生成能力同步增长。这些进步验证了 OpenCSG 平台数据飞轮的训练价值。真实任务带来执行轨迹评测系统发现失败环节训练流程再将这些问题转化为新样本。OpenCSG 已经具备从数据生成、模型训练、系统评测到私有化部署的完整 Agent 能力。Agentic-27B 是这条路线上的第二个公开版本。随着 Skills 数量、任务类型和失败案例不断增加Agentic V3 将进一步提高工具调用、任务规划、失败恢复和长链路执行能力。模型下载OpenCSG社区https://opencsg.com/models/OpenCSG/Agentic-27BHugging Face社区https://huggingface.co/opencsg/Agentic-27B魔搭社区https://www.modelscope.cn/models/opencsg/Agentic-27B关于OpenCSGOpenCSG是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps是人工智能领域的一种AI原生方法论由OpenCSG开放传神提出AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。