GEO资讯

智谱 GLM-5.3 发布,后训练拉开开源差距

发布于 2026/8/19 58 次阅读
智谱 GLM-5.3 发布,后训练拉开开源差距

同一基座,靠后训练追上闭源

8月14日,智谱发布新一代基座模型 GLM-5.3。最值得玩味的是:它和前代 GLM-5.2 用的是一个基座,参数规模 7430 亿没变,性能跃升几乎全部来自后训练(post-training)的极致打磨——更多长程任务环境、更长训练时间、更好的强化学习策略。智谱把这概括为"课本没变,换了更好的训练方法",也顺手证明了一件事:前沿能力往前推,未必非要更大的模型和更多的算力。这对企业有个直白的含义——模型迭代会越来越频繁,但部署和调用方式可以不变,不必每次为"新大模型"重建整套管线。

编程与安全的双突破

官方称 GLM-5.3 是"编程能力最强的开源模型"。在 Terminal-Bench 3.0 上得分从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 到 66.9,Agents' Last Exam 从 23.8 到 28.5,均在开源模型中排第一。在网络安全方向,CyberGym 漏洞推理得分 84.5%,高于 GLM-5.2 的 77.2%,也略高于 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。

发布前两周,智谱联合安全团队做密集测试,发现经去重后潜在漏洞 2404 个,其中 1088 个中高危,最早的可追溯至约 40 年前——包括一个潜伏多年的 DNS 协议级风险,少量特殊请求就能把服务器压力放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。这说明模型能力正从 Benchmark 走向真实专业工作流。

单位成本下的有效智能

在 Artificial Analysis 的 Intelligence Index 里,GLM-5.3 拿到 60 分,进入全球前沿模型区间,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰处于同一水平,并与 Kimi K3 并列开源第一。但以更小参数规模拿到这个分,意味着单位任务成本更低——对按调用量计费的企业,这是实打实的账单差异,也是智谱想传递的核心卖点:前沿能力不必靠堆参数和堆算力来换。

开源,但要先过安全关

智谱表示将在发布约两周后开放完整模型权重,在此之前完成安全评估和模型加固。逻辑很清楚:当强大的攻击能力在扩散,防守能力就不能只锁在少数闭源公司手里。把安全审计能力做成开放权重,等于让全球开发者共同完善防御,而不是让攻防能力分布更失衡。不过,开源也意味着防护和攻击的门槛在同步降低,企业部署时要更重视模型调用的边界控制,别把高权限直接交给自动化流程。

给企业的三个信号

  • 竞争焦点从"谁参数大"转向"谁用进真实工作流"。Coding Agent、安全审计、企业服务,正成为模型商业化的主战场。
  • 国产开源成熟,选型余地更大。对想私有化部署的中大型企业,配套工具、微调方案和可预期的成本都在改善,闭源不再是唯一选项。
  • 迭代节奏在加快。后训练 Scaling 的路线如果被复制,行业成本曲线会继续下探,企业的模型替换成本也会更低。

同月的国产模型节奏

GLM-5.3 不是孤例。就在这一个月里,月之暗面完成 Kimi K3 关键迭代,DeepSeek 上线 V4 Pro 正式版,国产旗舰的更新节奏明显加快。当头部模型从"年更"走向"月更",企业更需要一套能快速切换模型、不被单一厂商绑定的接入层——这恰恰也是 GEO 与 AI 应用落地时该提前考虑的工程问题。

信息来源

  • 智谱官方技术博客《GLM-5.3:前沿编程能力与涌现的网络安全能力》(2026-08-14)https://www.zhipuai.cn/zh/research/162
  • 央广网《智谱发布GLM-5.3 公司称是编程能力最强的开源模型》(2026-08-14)https://www.toutiao.com/article/7673864812912214554
  • 证券时报《智谱发布新一代模型!一个月内,国产三巨头完成关键版本迭代》(2026-08-14)https://www.toutiao.com/article/7673846869709177394