FEATURED · 精选文章

GLM‑5.3深度实测:7430亿参数,国产编程大模型有多猛

发布时间 / 2026/8/15 0:09:51
来源 / 创域科博编辑部
栏目 / 资讯中心
GLM‑5.3深度实测:7430亿参数,国产编程大模型有多猛 文章目录1 先唠唠刚出炉的GLM‑5.3到底有多猛1.1 7430亿参数主打编程赛道1.2 跑分直接冲到开源梯队第一1.3 干活又快又省token效率拉满2 实测第一弹从零搓出个3D开放世界驾驶游戏2.1 这需求放普通人手里得干半个月2.2 干活思路清晰修bug比谁都快2.3 省钱是真的短板也很明显3 实测第二弹裸考DeepSeek刚开源的框架3.1 纯纯的“闭卷考试”连复习时间都没有3.2 先把整个仓库给你摸得明明白白3.3 顺手做了个“人格切换”插件3.4 交付质量够硬还会做对照排查3.5 美中不足的小细节4 能力涨在哪还顺便点满了网安技能4.1 没换基座全靠后训练堆出来的4.2 意外涌现的网络安全能力4.3 实战两周挖了两千多个漏洞4.4 开源前先上“安全锁”5 最后扯两句P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者这个教程里内容讲解通俗易懂且风趣幽默对我帮助很大。我想与大家分享这个宝藏教程请点击下方链接查看 传送门https://blog.csdn.net/qq_740133651 先唠唠刚出炉的GLM‑5.3到底有多猛1.1 7430亿参数主打编程赛道今天AI圈又扔了个重磅消息智谱直接发布了新一代旗舰模型GLM‑5.3还放话两周之内就要开源。7430亿个参数是什么概念说个直观的这数量比我上班三年摸鱼刷过的网页总数还多光听数字就觉得离谱。跟之前的系列一样这模型主打的就是编程能力说白了就是给程序员量身定做的“超强辅助”。1.2 跑分直接冲到开源梯队第一现在主流的基准测试里它已经是所有已开源和即将开源模型里的第一名。编程和智能体相关的任务能力已经快摸到海外那几个顶尖模型的门槛了。放在国内对比跟Kimi K3在这两个领域各有胜负绝大部分测试都跑赢了DeepSeek最新款的模型。尤其是网络安全这块优势还挺明显直接领先另外两款国产模型。以前咱们总说海外大模型是天花板现在国产模型不仅追上来了个别科目还实现了反超属实是越来越有看头。1.3 干活又快又省token效率拉满除了能力强它还有个很实在的优点会过日子。同样的高档位思考预算下它的准确率有31.5%比Claude Opus 4.8还高两个百分点。但平均输出才5万个token还不到人家的一半。这就好比学生写作文别人写一万字才拿80分它写五千字就拿了85分省了墨水还拿了高分性价比直接拉满。2 实测第一弹从零搓出个3D开放世界驾驶游戏2.1 这需求放普通人手里得干半个月第一个测试任务就挺狠的用真实的OpenStreetMap数据1:1复刻上海陆家嘴到外滩的区域做一款3D开放世界驾驶游戏。要求还特别苛刻地图解析、坐标转换、核心游戏逻辑全得模型自己手写只能用Three.js的底层渲染能力。甚至还在需求里埋了两个“陷阱”凌晨两点到四点外滩建筑的灯要灭一半地图边缘得做带提示的软性阻挡。就这需求放普通开发手里不得先开三天会捋清楚细节模型倒好拿到手先去核实数据了。2.2 干活思路清晰修bug比谁都快它先写脚本拉了8万多个OSM节点确认数据没问题了才正式开工。前前后后多轮迭代最后交出来大概4900行代码数据管线、车辆物理、音效、导航、昼夜循环、存档系统啥都给你配齐了。之前埋的两个“陷阱”人家一个没落全给实现了比我记自己的外卖地址还准。修bug的本事更是一绝。测试早期页面直接卡死它没瞎改代码先给本地服务器加了请求探针靠日志一步步定位到问题根源。后来反馈相机视角会穿建筑它直接统计出6300多栋建筑里有四成的轮廓环绕方向跟法线约定反了最后改了几行代码就修好。更绝的是因为没法直接看画面它自己写了个零依赖的PNG解码器靠像素统计来证明渲染效果是对的。这自我验证的觉悟比很多刚入职的新人都高。2.3 省钱是真的短板也很明显搭配ZCode用的时候对话平均缓存命中率超过99%四舍五入就是干活基本不浪费算力老板看了都得夸一句会省钱。但短板也挺突出审美这块确实差点意思。建筑贴图和道路标线前后改了四轮人工反馈观感还是有点简陋。毕竟是主打编程的模型审美就别强求了。总不能要求敲代码的大神同时还得会做美术设计吧术业有专攻嘛。3 实测第二弹裸考DeepSeek刚开源的框架3.1 纯纯的“闭卷考试”连复习时间都没有第二个测试更考验真本事对象是DeepSeek前一天刚开源的Harness智能体框架。这个仓库有多复杂40多个顶层包200多个项目7400多个文件。而且发布才一天模型训练数据里根本不可能有相关内容纯纯现场摸索属于是“裸考”了。换我遇上这种事大概率直接摆烂交白卷。模型倒好直接派“小分队”开工了。3.2 先把整个仓库给你摸得明明白白第一个任务是搞懂运行链路执行命令之后从进程启动到消息抵达模型中间经过哪些模块插件怎么加载出错了怎么兜底它直接派出4个并行的子智能体分别去查CLI入口、插件机制、模型契约和消息通路。最后把四份结论整合成一份完整的链路报告还回头逐条核对关键代码。最后得出的结论很清晰插件靠YAML清单登记没有自动扫描所有模型都遵守同一份契约启动失败直接快速失败不会静默跳过。一个人干活慢就开四个号并行分工明确效率高比很多公司的项目组排期都明白。3.3 顺手做了个“人格切换”插件搞懂框架之后进阶任务来了开发一个“人格插件”让AI能在文言文、东北话、猫语之间切换。还得做到零侵入——插件关了就得立刻复原不能影响框架本身。这功能要是普及了以后跟AI聊天可太热闹了上午之乎者也下午唠大碴子晚上还能撸猫语主打一个精神分裂式体验。它先派2个子智能体通读仓库研究交互的时候又派了第3个前后花了大概5分钟摸透规范最后选了系统提示注册表当注入口完全不碰用户消息。3.4 交付质量够硬还会做对照排查最终交付的版本涉及20个文件净增560行代码配套的11条单元测试一次就过核心功能全覆盖。跑全量回归的时候出了点小插曲771个测试里有6个失败。它没急着改自己的代码先把新增内容全撤了在干净环境里重跑发现失败原样复现。当场就实锤了是本机环境的锅跟新写的代码没关系。出问题先自查还会做对照实验这严谨程度比我写周报凑字数认真一百倍。最后它还复用了框架原有的命令机制把人格切换接到了网页端斜杠命令就能切前端基本没加新代码所有文档检查全通过。3.5 美中不足的小细节当然也不是完美的。长任务执行的时候反馈太少好几次都以为进程卡死了差点手动打断。还有就是哪怕是风险很低的小修改它也会跑完整的检查和测试严谨是严谨但有时候确实有点费token。就像那种做事特别轴的同事一点小事也要走完全部流程靠谱是真靠谱急也是真急人。4 能力涨在哪还顺便点满了网安技能4.1 没换基座全靠后训练堆出来的说出来可能有人不信GLM‑5.3的基座模型跟上一代5.2完全一样能力提升全靠后训练。说白了就是多刷了好多题训练环境更丰富训练时间也更长硬生生把成绩提上来了。题海战术果然在哪都管用同一个底子多练就是能出效果。4.2 意外涌现的网络安全能力练着练着还意外解锁了网络安全技能效果还挺出乎意料。白盒代码安全测试里它得分84.5%比Claude Mythos 5还高一点。更贴近实战的漏洞利用测试里虽然跟海外顶尖还有差距但比上一代翻了好几倍。本来是培养程序员的结果顺便练成了半个白帽黑客属于是技能树点歪了但歪得特别有用。4.3 实战两周挖了两千多个漏洞发布前它还跟国内高校、一堆安全团队一起做了红队测试两周时间揪出来2436个漏洞其中一千多个是中高危的。这些漏洞最早的都有45年历史了覆盖系统内核、浏览器、开源组件啥的全报给国家漏洞库了。两周挖两千多个漏洞这效率比我上班找自己代码的bug高多了。搁以前这不得几十人的安全团队干好久4.4 开源前先上“安全锁”智谱也说了开源之前还会做安全评估和加固把潜在的攻击能力限制住只保留防御的价值。这就好比给厉害的工具上保险本事大是大但不能乱用得用在正道上。5 最后扯两句现在大模型圈的风向真的变了。以前大家都拼基座、拼参数拼预训练的算力和数据。现在预训练的红利慢慢见顶各家都开始卷后训练。不换基座也能做出换代级的提升这条路看来是走通了。就像手机行业以前大家拼处理器参数现在都卷系统优化、场景调教。卷的方向越来越细对用户来说总归是好事。反正GLM‑5.3这波确实拿出了硬东西真实场景里能交付完整的活短板也摆得明明白白。等两周后开源估计又得有一堆大神整出新活了。P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者这个教程里内容讲解通俗易懂且风趣幽默对我帮助很大。我想与大家分享这个宝藏教程请点击下方链接查看传送门https://blog.csdn.net/qq_74013365
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻