GLM 5.3 测试报告!究竟有多能打?
发表于|更新于|大语言模型
GLM 5.3 测试报告,本此在 Claude Code 完成测试,推理设置 high、编程拉满 max 思考深度;强约束指令测试第五句不符合结尾规则,其余语句通顺,24 点、密码锁推理全部作答正确;编程任务浏览器操作系统、太空射击游戏完成度优秀,3D 赛车画面精致但按键左右反转,Trello 看板功能仅好拖动动画质感一般,整体无严重 bug,综合表现属于上乘水准……
相关推荐

2026-09-18
GLM 5.3 FlashX测评报告!究竟有多能打?
智谱最新发布的 GLM 5.3 FlashX 测评报告来了,还是在 PI 中接入、思考深度放大最高。来看看这个高速版本实际表现如何。 第一题:强约束指令遵循——句子生成测试。 生成速度相当快,有点 DeepSeek V4 Flash 的味道,起码比 GLM 5.3 Flash 快多了。仔细检查生成的句子,第四、六、七、八、十句为了凑成数字结尾都硬生生去掉了单位,读起来不太通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 效果不错,虽然这几期提示词难度调低了,但 GLM 5.3 FlashX 依然是第一个实现得比较完整的模型,值得肯定。 第三题:复合弓射箭 SVG 测试。 如果不吹毛求疵的话,还算是可以的了。非要挑毛病的话也有不少:箭是被弓箭手推出去的而不是射出去的,弓弦应该在复合弓左边,但弓箭手却用右手拉弓,存在方向矛盾。 第四题:精美浏览器操作系统。 UI 看上去不错,右上角弹窗、dock 栏应用功能都没有问题,太空射击游戏则是这题的压轴大戏——可惜效果不大行,飞机和子弹离得太远,不移动的话根本看不出子弹是从自己飞机发射出去的,子弹大、飞机小,如果游戏能实现得更好这题应...
2025-10-09
GLM 4.6 测评报告!国产Claude 4.5?
昨天的视频分享了对Claude 4.5的测评,今天打算测下也是刚出来的智普的GLM 4.6。废话不多说,赶紧开干。我们来到网页客户端。这次主要还是测试下我关注的推理和编程。推理的话,我会先关闭深度思考,如果做错了,我再会打开深度思考测一遍。其他情况我都会开深度思考… 访问入口
2025-07-24
图片无损升4K!即梦新功能实战!
即梦新推出炸裂“智能超清”功能!我最近不是在做《即梦实战》系列视频嘛,刚上去想去生成个图片,就看到这个弹窗,竟然能将画质无损提升到4K,也就是能在保持细节的情况下提升画质。我们都知道AI修图最大的问题之一就是一致性问题,修着修着就变了个人了!废话不多说,赶紧demo下看下效果 访问入口
2025-05-13
Cline重大更新:Task Timeline及其他!
快速跟大家分享下cline的最近几个更新,我们先打开vscode,然后打开插件市场找到cline,没有安装的安装上,安装好的升级到最新,当前最新的3.15.1…
2025-12-25
SIM:再见N8N,别了扣子!告别手搓AI工作流!
本视频介绍了新一代AI工作流平台,让你彻底告别N8N和扣子(Coze)等需要手动拖拽配置的复杂工作流工具。新一代平台通过AI自动规划工作流——你只需用自然语言描述需求(如”每天早上8点爬取某网站数据,分析后发送摘要到我的邮箱”),AI会自动设计、搭建和执行整个工作流。这意味着”手搓”AI工作流的时代即将过去,人人都能用自然语言构建自动化流程。 访问入口

2026-09-12
Kimi K2.8 测评报告!真的能打吗?
Kimi K2.8 Preview 的测评报告终于来了。这次测试用的 key 由 B站网友「非著名思想公智」提供,评测依然放在 PI 平台上进行,尽量把 Harness 的影响降到最低,思考模式同样拉到最高。 不过在开始之前有个问题想先问大家:既然 Kimi K3 都已经出来了,为什么现在才推出 K2.8 Preview?知道的朋友可以在评论区聊聊。 推理能力测试 第一题是强约束指令遵循的句子生成,要求所有句子分别以「一到十」结尾。这一题有点大跌眼镜——十句里明显只有第一句和第四句符合结尾要求,通读下来这两句是通顺的。 第二题是新版 24 点,需要给出三个解。结果非常棒,三个解都完全符合提示词要求。 第三题是难度更高的新版密码锁推理,答案是 7294364,判断正确。 编程能力测试 第四题要求实现一个精美的浏览器操作系统。第一版点上去没有反应,毕竟花了几十分钟开发,直接判失败有点可惜,于是让它返修了一次,之后就能正常使用了。右上角的弹窗表现还算可以,Dock 栏里的应用功能也没什么问题,但压轴的太空射击游戏直接报错,这一项不行。 第五题是 3D 赛车游戏。车道方向就不对,游...
公告






