GLM-5.3的网络安全能力有多强CyberGym 84.5分背后的开源SOTA漏洞发现【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3GLM-5.3是智谱AI开源的大语言模型与 GLM-5.2 共用同一基座所有提升均来自后训练。它在复杂编程和长程任务上表现显著提升其中网络安全Cyber能力尤为突出——在CyberGym漏洞发现基准上拿下84.5 分位列开源模型 SOTA在利用链Exploitation基准上更是将前代能力翻倍展现出涌现式安全攻防能力。 一句话看懂 GLM-5.3 的定位同一个基座模型 → 更深的后训练 → 编程更强 网络安全能力大幅涌现GLM-5.3 不是靠换个底座实现的提升而是通过更大规模的后训练Post-training让模型在漏洞发现、利用链构建、终端自动化三个维度同时跃升。 CyberGym 84.5漏洞发现开源第一CyberGym是衡量模型**漏洞发现Vulnerability Discovery**能力的核心基准共 1,507 个任务。GLM-5.3 的评测条件非常严苛评测细节说明任务数量1,507 个真实漏洞场景推理努力max最高超时限制每任务无上限网络访问关闭仅允许 pypi.org 等必要域名Git 信息全部移除防止抄答案结果口径单次运行 Pass1与主流模型对比模型CyberGym排名GLM-5.384.5 开源 SOTAGPT-5.6 Sol83.6Fable 583.8DeepSeek-V4 Pro-081383.34GLM-5.277.2—GLM-5.3 相比 GLM-5.2 提升7.3 分且领先第二名近 1 分是开源权重模型中漏洞发现能力的天花板。⚔️ 利用链能力GLM-5.2 的 3 倍以上如果说发现漏洞是上半场那构建利用链Exploit Chain才是下半场。GLM-5.3 在后训练规模扩大后利用链能力增长远超预期。ExploitGym869 个利用任务模型2小时6小时GLM-5.3105130GLM-5.22939Kimi K33670Qwen3.8 Max14262小时窗口内GLM-5.3 是 GLM-5.2 的3.6 倍6小时窗口内GLM-5.3 是 GLM-5.2 的3.3 倍是 Qwen3.8 Max 的7.5 倍2hExploitBench41 个任务 × 3 轮覆盖模型ExploitBenchGLM-5.354.4GLM-5.224.4Fable 578.0Opus 4.840.0GLM-5.3 相比 GLM-5.2翻倍还多123%在开源模型中仅次于 Fable 5。 为什么后训练能带来安全能力的涌现README 原文用了一个关键词Emergent Cyber Capability涌现式网络安全能力。后训练规模扩大 │ ├──→ 复杂编程能力 ↑Z.ai Code Bench 50% ├──→ 长程任务能力 ↑Terminal Bench 3.0: 4.6 → 28.3 └──→ 网络安全能力 ↑↑↑CyberGym 77.2 → 84.5 └── 利用链能力增长最快ExploitGym ×3.6背后的逻辑编程与安全的深度耦合漏洞发现本质上是读懂代码 理解系统 推理边界这三项能力在编程后训练中同步强化。长程推理是关键利用链构建需要多步骤、多轮工具调用GLM-5.3 的1M token 上下文config.json 中max_position_embeddings: 1048576让它能在单次会话中追踪完整的攻击链路。工具调用模板成熟chat_template.jinja 中内置了完整的tool_call/tool_response协议模型在评测中可以直接操作终端、执行命令、读写文件而无需外部胶水代码。 模型规格速览参数值来源架构GlmMoeDsaForCausalLMMoE DSAconfig.json层数78 层config.json路由专家256 个每 token 激活 8 个 1 共享专家config.json隐藏维度6,144config.json上下文长度1,048,576 tokens1Mconfig.json词表大小154,880config.json量化FP8e4m3config.json精度bfloat16config.json推理努力控制reasoning_effort: low / high / max默认 maxREADME.md生成默认参数temperature1.0, top_p0.95generation_config.json权重文件共141 个 safetensors 分片配合 model.safetensors.index.json 可完整加载。 本地部署 GLM-5.3 的 6 条路径GLM-5.3 官方支持以下推理框架来自 README.md框架适用场景SGLang高吞吐在线服务vLLM生产级推理服务TokenSpeed低延迟推理Transformers快速验证 / 研究KTransformersCPUGPU 混合推理低显存Unsloth高效微调 / 量化部署Ascend NPU华为昇腾平台vLLM-Ascend / xLLM / SGLang提示用于安全评测/基准复现时保持reasoning_effortmax默认值日常对话场景建议传入clear_thinkingtrue以节省输出 token。 其他关键基准成绩网络安全之外GLM-5.3 在通用编程和智能体基准上同样领先基准GLM-5.3GLM-5.2提升幅度Terminal Bench 2.188.281.07.2Terminal Bench 3.028.34.623.7DeepSWE (v1.1)66.946.220.7SWE-Marathon (v1.1)42.519.423.1AutomationBench48.226.222.0GDPval-AA v217691508261Terminal Bench 3.0 从 4.6 → 28.3 的跃升尤其值得关注——这意味着 GLM-5.3 在隔离容器内自主完成复杂终端任务的能力有了质变而这正是安全攻防场景的核心能力。❓ 常见问题QGLM-5.3 的 CyberGym 84.5 是怎么算的A在 1,507 个漏洞发现任务上单次运行Pass1通过率。评测中模型被放在任务容器内无网络访问仅 pypi/deb 白名单无 Git 信息模拟真实攻防环境。详见 README.md Footnotes。Q为什么 GLM-5.3 不用新底座就能大幅提升A后训练Post-training规模扩大是核心。README 明确写道GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training. 更大的后训练让编程、长程推理和安全攻防能力同步涌现。Q部署需要多少显存A模型采用 FP8 量化 MoE 架构256 专家每 token 只激活 8 个实际激活参数远小于总参数。具体显存需求取决于选择的推理框架和量化方案KTransformers 框架特别适合低显存 CPUGPU 混合场景。Q如何引用 GLM-5.3A技术报告 arXiv 编号为2602.15763完整 BibTeX 见 README.md 的 Citation 部分。 仓库文件索引文件说明README.md项目主页基准成绩、部署指南、评测细节config.json模型架构配置78层MoE、1M上下文、FP8generation_config.json默认生成参数temperature1.0, top_p0.95tokenizer_config.jsonTokenizer 配置1M 最大长度chat_template.jinja对话模板含工具调用协议、reasoning_effort 控制model.safetensors.index.json权重索引141 个分片model-00001-of-00141.safetensors ~ model-00141-of-00141.safetensors模型权重文件LICENSE开源协议 总结GLM-5.3 用同一个基座证明了后训练的深度决定了模型能力的上限。在网络安全这个维度它不是略胜一筹而是漏洞发现CyberGym开源SOTA 84.5 分利用链构建ExploitGym前代3.6 倍漏洞利用覆盖ExploitBench前代2.2 倍对于安全研究员、红队测试工程师或任何想用开源模型做自动化安全扫描的团队来说GLM-5.3 目前是免费可部署的最强选择。【免费下载链接】GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比它在复杂编程和长程任务上的表现显著提升。项目地址: https://ai.gitcode.com/zai-org/GLM-5.3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考