
Ornith-1.5-35B-A3B-GGUF 基准测试深度解读SWE-bench 79分背后的智能体编程实力附 GGUF 本地部署指南【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFOrnith-1.5-35B-A3B-GGUF 是开源智能体编程大模型的 GGUF 量化版仓库350亿总参数混合专家架构每 token 仅激活约 3B 参数在 SWE-bench Verified 拿下 79 分、Terminal-Bench 2.1 拿下 68 分全面超越同级稠密模型支持 llama.cpp、Ollama 一键本地部署。先看懂Ornith-1.5 是什么来头先给不熟悉 Ornith 的朋友补个背景。Ornith-1.5 是 ornith-ai 团队发布的端到端自我改进self-improvement基础模型系列中的中型 MoEMixture-of-Experts成员总参数约 35B每 token 只激活约 3B 参数——这意味着推理成本接近一个小模型却拥有大模型的知识容量在 Qwen3.5 与 Gemma4 基础上做继续预训练、中期训练与后训练把自我改进闭环从脚手架rollout 优化扩展到任务生成、脚手架构建、求解 rollout 的联合优化——模型持续自己生成训练任务、自己发现解题策略、再用强化学习自我提升核心卖点集中在编码与智能体Agentic能力而非通用问答官方完整的评测数据与部署说明都写在 README.md 里本文就是逐节带你拆这份成绩单。核心成绩单SWE-bench 79分、Terminal-Bench 68分意味着什么SWE-bench 系列真实 GitHub Issue 修复能力基准测什么Ornith-1.5-35B-A3BSWE-bench Verified真实开源项目的 Issue 修复单补丁79SWE-bench Pro更复杂的真实工程任务59.6SWE-bench Multilingual多语言代码库上的 Issue 修复71.4DeepSWE深度长程软件工程任务22NL2Repo自然语言描述 → 完整仓库46.2SWE-bench Verified 79 分意味着给它一个真实仓库和一个真实的 Issue它平均每 10 次能独立完成 7.9 次修复。作为参照稠密模型 Gemma-4-31B 只有 52 分——Ornith 以每 token 激活 3B 参数的体量跑赢了体量相当或更大的稠密对手。更值得关注的是 DeepSWEOrnith-1.0 在此得 0 分1.5 版本直接拉到 22 分对照的 Qwen3.5-397B 也只有 1 分说明自我改进训练对长程、多步骤工程任务的突破是实质性的。Terminal-Bench 2.1命令行智能体的实战分数运行框架Ornith-1.5-35B-A3BQwen3.6-35B-A3BQwen3.5-397BTerminus-2 框架67.852.553.5Claude Code 框架68.549.248.6Terminal-Bench 考验的是模型在终端环境中自主完成多步任务的能力——建环境、跑命令、看报错、改代码、验证结果。两个不同框架下 Ornith 都稳定在 67~68 分说明分数不依赖特定 Agent 框架而是模型本身的智能体素养。对比同为 MoE 的 Qwen3.6-35B-A3B52.5 分领先超过 15 个百分点优势非常显著。不只是会写代码推理与工具调用全面开花GPQA Diamond 89.2 分研究生级科学问答全场最高推理底座扎实HLE 33.4 分with tools使用工具时大幅提升模型善于调用工具辅助解题MCP-Atlas 70.2 分MCP 工具调用能力位居前列Frontier-Bench 5.1 分前沿任务基准是上一代 Ornith-1.01.4 分的 3 倍多一句话总结编码、推理、工具调用三条腿都硬且随版本迭代持续变强对比 README.md 中的 Ornith-1.0 列即可看出每项几乎全部提升。为什么强自我改进闭环的三个升级 ⚙️Ornith-1.5 相对 1.0 的核心差异不在数据规模而在训练方式的闭环升级任务自生成不再依赖人工策划的固定任务集模型持续生成新的训练任务脚手架自构建自动发现并优化解题所需的执行框架harnessrollout 自优化对任务的完整求解过程做强化学习任务、脚手架、求解三者联合优化这正是 DeepSWE 从 0 → 22 分、Frontier-Bench 从 1.4 → 5.1 分的来源——自我改进对长程任务规划的增益远大于对短平快问答的增益。GGUF 版本怎么选本地部署量化清单 这个仓库的意义在于用 llama.cpp 生态就能把这份成绩搬进你自己的机器。仓库提供了完整的量化阶梯文件精度适合谁Ornith-1.5-35B-BF16.ggufBF16 全精度显存充足、追求极限质量约 70GB 级Ornith-1.5-35B-Q8_0.ggufQ8_0接近无损多数场景的推荐起点Ornith-1.5-35B-Q6_K.ggufQ6_K质量/体积均衡Ornith-1.5-35B-Q5_K_M.ggufQ5_K_M中显存主力选择Ornith-1.5-35B-Q4_K_M.ggufQ4_K_M消费级硬件、追求最低显存另有 mmproj-Ornith-1.5-35B-BF16.gguf 多模态投影文件可用于视觉能力场景。三步本地跑起来llama.cpp从本仓库下载对应量化文件clone 仓库git clone https://gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF用llama-server起一个 OpenAI 兼容接口加载 GGUF 文件并设置 256K 上下文任何支持自定义 endpoint 的工具Coding CLI、Agent 框架把OPENAI_BASE_URL指过来即可Ollama 用户更简单一条命令ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF上手建议推理参数与长上下文设置 ✅这个模型是推理模型默认会在正式回答前输出一段think…/think思考过程部署时需要开启 reasoning parser 与 tool-call parser如 vLLM 加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_xml否则思考链和工具调用不会正确分离到reasoning_content/tool_calls字段。采样参数建议来自 README.md 官方推荐日常使用temperature0.6、top_p0.95、top_k20复现基准成绩temperature1.0长上下文原生支持 256K262,144 tokens任务超长时可启用 YaRN RoPE scaling 扩展到约 1M tokens——注意只有真的需要长窗口才开避免影响普通长度的输出质量结语3B 激活参数跑出大模型的成绩回到开头的两个数字SWE-bench Verified 79、Terminal-Bench 2.1 约 68。对一个小体量 MoE 模型来说这组分数意味着它不是会聊代码的聊天机器人而是能独立修 Issue、自主操作终端的可用型编程智能体。如果你是本地算力党建议从 Q6_K 或 Q8_0 版本入手在 llama.cpp / Ollama 里体验一把如果你关注它的技术路线README.md 里引用的 Ornith-1.5 官方博客值得细读——自我改进闭环可能是中小参数模型持续变强的关键路径。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考