
据 IT之家 9 月 2 日报道Arenaarena.ai发布了 2026 年第 35 周8 月 24 日~8 月 30 日的大模型盲测周榜。这期榜的看点是国产模型扎堆亮相阿里 9 月 2 日更新的 Qwen3.8-Max-0902 首次入榜就登顶前端开发榜智谱的 GLM-5.3-Flash 首次进入代码榜前十腾讯 Hy4-Preview、阿里 Qwen3.8-Flash-Next 也同期首秀。一圈看下来国产模型在写代码这条细分赛道上已经从陪跑变成了前排选手。榜单上发生了什么先把这期的关键名次摆一下数据来自 Arena 周榜据 IT之家报道整理前端开发榜Qwen3.8-Max-0902 以 ELO 1691 分首次入榜即登顶把上一任榜首 Claude-Opus-5-Max1687 分挤到第二Kimi K3 Max 第三腾讯 Hy4-Preview 第八、Qwen3.8-Flash-Next 第九都是首秀GLM-5.3-Flash 排第十二。新入榜的国产模型就有四款挤进前 12。代码榜头部依旧是 Anthropic 的天下Claude-Opus-4-7-high 以 1552 分排第一前三名分差只有 1 分误差范围内算并列GLM-5.3-Flash 首次入榜就排到第七1535 分前十里的国产面孔是第六的 Kimi K3 Max 和它。综合榜Claude-Fable-5 以 1508 分蝉联第一Anthropic 占据前七名中的六席国产最高是第十名的 Kimi K3 Max。另据阿里官方发布信息量子位获授权转载9 月 2 日更新的 Qwen3.8-Max 总参数 2.4 万亿、支持 100 万 token 上下文新版本针对编程Coding和专业办公Cowork做了专项后训练在 CodeArena 的 WebDev 榜上提升 22 分至 1691 分居第一按官方口径每百万 token 的综合平均成本约 5 美元。目前新模型已上线千问平台 API千问办公、Qoder、千问 App 都已接入。技术本质还是组合拳不是新范式这两个主角的卖点值得拆开看。GLM-5.3-Flash 是智谱 GLM-5 系列第一个原生多模态模型8 月 26 日发布总参数 3200 亿、激活参数只有 180 亿采用线性注意力加稀疏注意力的混合架构。这类架构这两年很常见思路就一条总参数可以大但推理时只激活一小部分把单次调用的算力成本压下来。榜单里标注它的 API 价格是输入 0.15 美元、输出 0.5 美元每百万 token比自家 GLM-5.3-Max1.4/4.4 美元低一个数量级也远低于多数海外头部模型。这款模型还开源了Ox Alpha 版据 IT之家报道摩尔线程已官宣完成 Day-0 适配商汤大装置也上线提供国产算力支持——开源加国产芯片适配走的是和上一代 DeepSeek 类似的路线。Qwen3.8-Max 则是另一个路子不省参数2.4 万亿靠专项后训练把能力往工程任务上掰。所谓专项后训练就是在通用训练完成后再用大量编程、办公协作类数据做定向强化让模型更会干活而不是更会聊天。所以这一轮的变化本质是三件事叠一起更省的推理架构、更低的定价、更定向的任务训练。底层并没有出现新范式——综合榜和代码榜头部依旧被 Anthropic 系占着就是证据。变的是细分市场前端开发这种任务明确、反馈快、量又大的场景国产模型先用性价比撕开了一个口子。顺带提醒一句榜单怎么读。Arena 是匿名盲测投票、用 ELO 算分反映的是用户主观偏好而不是绝对能力测试不同分榜互相独立不能拿前端榜的分去和综合榜比分差在误差范围内都算并列。所以登顶要理解成用户投票层面占优别当成所有编程任务绝对第一。对普通开发者的实际建议我一个运维转运营的人写代码不算多但这两年用 AI 写脚本、处理报表数据的频率明显在涨——这类模型卷起来最先受益的其实就是够用就行的用户。具体怎么用给几条实在的前端/页面类活可以降本了。组件、页面、样式、接口联调这类高重复度任务让便宜的国产模型当主力、人来做 review性价比比全程用顶配海外模型高。接口基本是 OpenAI 兼容格式切换成本很低。复杂工程和长任务 Agent 先别急着换。重构老系统、跨模块排错、长链路 Agent 这类活目前头部梯队Claude 系、Kimi K3 Max 等稳定性更可预期建议留一个强模型兜底。别信排名信自己的用例。抽一两个真实业务小需求同一份 prompt 跑几个候选模型对比# OpenAI 兼容接口示例具体 base_url 与可用模型名以各平台文档为准importosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[LLM_API_KEY],# 换成你自己的 keybase_urlos.environ[LLM_BASE_URL],# 如 DashScope 兼容模式地址)prompt用 Vue3 Element Plus 写一个带搜索、空状态、加载骨架的用户列表页formodelin[qwen3.8-max,glm-5.3-flash]:respclient.chat.completions.create(modelmodel,messages[{role:user,content:prompt}],temperature0.2,)print(f---{model}---)print(resp.choices[0].message.content[:300]) 跑的时候留意三个坑一是能用和能上线差距很大生成代码必须人工过一遍二是便宜模型往往意味着更有限的指令遵循能力长 prompt 和复杂约束要多测三是榜单价是每百万 token 的标价实际账单还要看上下文长度和缓存命中情况。## 小结国产模型这周在编程榜上的成绩单确实亮眼但含金量要打折看赢的是细分场景和性价比不是全面碾压。对写代码的人来说这是好事——可选项变多、价格往下走省的是自己的时间和公司的预算。你平时写代码用哪家模型最近换过吗评论区聊聊。