8 月 14 日,智谱发了新模型 GLM-5.3。
官方用了个词:「史诗级」。
但有个细节,比「史诗级」更值得注意。
这个模型,参数没变。还是 7500 亿。
编程能力,却翻了 6 倍。
同一个模型,什么都没换。只换了一件事:怎么教它。
我叫杨欢。这篇文章,讲一个正在悄悄改变 AI 行业的逻辑。
01
同一辆车,换了个教练
先把两个词说清楚。
基座,就是模型本身。你可以把它想成一辆车的发动机。
后训练,就是怎么教这个模型。你可以把它想成教练。
以前,整个行业拼的是发动机。
谁家模型大,参数多,谁就强。想更强,就堆更大的模型,买更贵的显卡。
GLM-5.3 没走这条路。
它没有换发动机,参数还是 7500 亿。
它只换了个教练。用更长的训练时间、更丰富的任务环境、更大规模的强化学习,把同一个模型的潜力,硬挖了出来。
以前拼谁家发动机大,现在拼谁家教练好。
02
实测:它真的能自己干活了
光说数据没意思,看两件真事。
第一件,有人拿 GLM-5.3 去「裸考」DeepSeek 刚开源的 Harness 框架。
什么叫裸考?零先验,不喂任何资料,直接让它自己读。
这个框架有 7000 多个文件。
GLM-5.3 自己读懂了整个代码仓库,还按它的规矩,打造出一个「人格插件」。
7000 个文件,没有一个字是人替它读的。
第二件,GLM-5.3 配合 ZCode,从 0 到 1 开发了一款 3D 开放世界驾驶游戏。
用的还是真实地图数据,1:1 复刻上海陆家嘴到外滩。
读 7000 个文件、写一个游戏,这两件事放在一起,就是「AI 自己动手干活」的具象化。
03
数字:6 倍是怎么来的
几个关键基准,涨得最狠。
终端操作,Terminal Bench 3.0,从 4.6 涨到 28.3。
长程代码修改,DeepSWE,从 46.2 涨到 66.9。
最值得看的是横向对比。
在智谱自研的 Code Bench 里,高档位准确率 31.4%,超过了 Claude Opus 4.8 的 29.5%。
而且,它每个任务只输出 5 万个 token。Opus 4.8 要 12 万。
结果更好,花得更少。
它用不到对手一半的 token,干出了更高的准确率。省下的,都是实打实的钱。
04
这件事为什么比堆参数更可怕
这才是真正该被记住的地方。
堆参数,意味着要买更贵的硬件。模型越大,显卡越贵,成本越陡。
换教练,不需要更贵的硬件。只是训练方法更聪明。
同样的硬件,更强的模型。
这等于说,AI 变强的成本,突然低了一大截。
过去大家算过一笔账,AI 能力的上限,被硬件成本卡着。
现在这笔账,要重算了。
天花板不是靠硬件堆出来的,是靠教法挖出来的。而教法的进步,比硬件快得多。
05
这对普通人意味着什么
三个字:更快,更便宜。
AI 会更快地变强。因为训练方法的进步,比堆硬件快。
AI 会更便宜地变强。因为不用换更贵的显卡。
这两个「更快更便宜」叠在一起,就是普通人最大的机会。
上一篇文章我们讲过,OPC 一人公司的成本,被 AI 一层层打穿。
今天这个逻辑,是打穿成本的又一层。
你不需要看懂后训练是什么。你只需要知道,手里的工具,会一直变强,而且不怎么涨价。
回到开头那个细节。
参数没变,能力翻倍。
这件事本身,就是 AI 时代最值得记住的信号之一。
以前,AI 的进步靠「更大」。
现在,AI 的进步开始靠「更聪明」。而这条路,才刚刚开始。
发动机没换,车却快了一倍。接下来这辆车能跑多快,取决于教练,而不是油箱。
等等,说一件事。
你刚才读完的这篇文章不是我写的。是我训练的一支AI团队写的。选题、搜集素材、写作,全部由AI协作完成,我只做了方向决策和内容校对。
如果你也在想AI能不能用在实际工作中。
这篇文章就是答案。
我给这个AI团队起名叫「狗蛋致富团队」
由多名专业的AI员工组成,还会不断进化
关注我,学AI、聊商业、教实操
▼ 这是我的公众号名片 ▼
参考来源 · 智谱开放平台官方发布 8月14日 · 智东西/36氪 8月14日(裸考Harness、3D游戏实测)· 第一财经 8月14日(市场背景、定价对比)
本文为技术与商业信息分享,不构成投资建议。










暂无评论内容