GLM-5.1:智谱面向长程任务的开源大模型,Coding Plan全量开放
最近一直在用各种 AI 模型写代码。Claude Code 确实很好用,但是用多了发现一个问题:太贵了。特别是做长任务的时候,tokens 烧得飞快,一个月下来账单看着心疼。所以也在试各种开源模型,想找个性价比高的替代方案。
但是用着用着发现了一个很有意思的现象:大多数开源模型在做长任务的时候,经常会出现一些问题。比如做到后半程开始丢上下文、忘约束,或者突然跑偏去干别的,你得反复拉它回来。复杂一点的任务,基本要全程盯着。能力是有,但稳定性差点意思。
智谱要给 Coding Plan 用户更新 GLM-5.1 了,据说全体用户都能用,包括 Lite 用户。提前拿到了测试权限,试了一下,AutoClaw 可以直接调用 GLM-5.1。
长程任务的提升
先说结论:长程任务的提升不是一点半点。
测试的场景是让它重构一个老项目,涉及技术栈迁移、数据库改造、接口重写、前端适配,大概十几个步骤的完整链路。之前用其他开源模型做类似的任务,到后半程就开始丢上下文、忘约束、需要人工介入。
GLM-5.1 完全不一样。它记得住前面做了什么、知道当前在哪一步、清楚接下来该干什么。这种你给目标,它自己干,最后交结果的体验,确实有点像在跟一个有经验的同事协作。
后来又试了几个场景:多步骤开发,逻辑链稳得住,不会走到一半忘了前面在干嘛;复杂 debug,能跟着上下文一轮轮往下推。
这其实就是最近 AI 圈很火的一个方向,Long Horizon,长程任务。简单说就是,AI 能不能处理那种需要持续几个小时、跨十几个步骤、中间还可能出意外的完整项目。它能不能自己记住做过什么、知道现在到哪一步了、清楚最终要交付什么,中间出了错还能自己修。
这个能力,其实是 AI 从"辅助工具"变成"能独立交付"的关键分水岭。以前开源模型在长任务后半程容易断链、需要人工介入的问题,在 GLM-5.1 上得到了明显改善。中间环节出错时能自主排查修复,而不是停下来等你。
榜单表现
这个方向其实不是智谱一家在做,Anthropic、OpenAI 这些头部玩家都在往这个方向走。AI coding 正在经历一条很清晰的能力跃迁路径:从 AI coding(辅助写代码)→ vibe coding(让更多人能创造)→ agentic(让 AI 能执行)→ long horizon(让 AI 能像专家一样持续工作、交付成果)。
而 GLM-5.1 在长程任务这个赛道上,目前是开源模型里做得比较好的。从榜单数据来看,GLM-5.1 在 Artificial Analysis、SWE Bench 等核心榜单上都拿到了开源第一。
海外也有不少开发者在用。OpenRouter 上 GLM-5.1 的调用量,在开源模型里是断档第一。Youtube 博主 AICodeKing 的 King Bench 上,GLM-5.1 排名开源第一。还有 karminski 牙医的 vector bench,也是第一。甚至有海外网友直接放弃 Claude,选择 GLM。
根据 METR 的研究,在编程等领域,AI 能以 50% 成功率完成的任务复杂度(以人类专家耗时衡量)正呈指数级增长,近期加速至每 4-6 个月翻倍。
长程任务能力正在成为检验模型智能的下一个标准。单轮问答已经不够看了,长程复杂任务(多步推理、跨文件工程、端到端项目交付)才是衡量模型真实智能的新门槛。
怎么用
如果你也是 Coding Plan 用户,记得手动切换到 glm-5.1。在你使用的 Coding Agent 自定义配置中(比如 Claude Code 中的 ~/.claude/settings.json),手动修改模型为 "glm-5.1"。
长任务效果确实不错:
- 在 Claude Code、OpenClaw、Cline 这些工具里,或者自己搭的代理环境,它可以自己先规划好步骤,然后直接写代码、执行、发现 bug 就调试、改完再继续跑,一口气把涉及多个文件的项目做完,中间不会轻易跑偏。
- 拿一个很大的代码库来重构,或者按照需求从零搭一个完整的系统。它特别擅长这种需要反复调用工具、不断纠错、一步步推进的长时间工作,不会做到一半就忘掉最初的目标。
- 从头到尾处理一个数据分析流程:先清洗数据、做转换、建模、画图,最后生成报告。或者简单点,比如把 CSV 文件转成 JSON,顺便把各种奇怪的边缘情况都处理好。它能在整个过程中保持稳定,不会中途乱来。
值得一试。