Grok 4.7 刚上线,这一期的测评依然在 Pi 平台上接入,思考强度直接拉到最 xhigh,还是那套祖传测试用例,逐题开干。

第一题是强约束指令遵循的句子生成测试。逐句看下来,所有句子的结尾都按要求落在 1 到 10 之间,句子本身也基本通顺,只有最后一句翻车了。口语里我们偶尔确实会那样说,但放到书面语里语法上就不太对——说「满分 100,他考了 90」没问题,前后呼应;但换成「这有苹果 10 个,他拿了一」,就明显别扭了,总感觉要补上「分」这个单位才舒服。大家觉得呢?

第二题是鹈鹕骑自行车的 SVG 测试(沿土星环轨道做 360° 环形骑行)。从最后的输出看,它转弯是通过淡入淡出方式解决的。实际效果有几个问题:一是转弯时的衔接明显不理想,看着接不上;二是车轮总感觉是反着转的;三是内层的土星环画反了——上方部分应该被土星挡住,面向我们的下方部分则不该被挡住。

第三题是复合弓射箭的 SVG 测试。复合弓和射箭整体还可以,唯一想吐槽的是那个小人:知道这只是个 SVG,但手也不至于长到脖子上吧,看着怪吓人的,这不是拍恐怖片。

第四题是做一个精美的浏览器操作系统。实际玩下来,右上角的弹窗功能没问题,Dock 栏里的应用功能也没问题,但整体 UI 很一般。压轴的太空游戏玩起来有点别扭:方向控制等都没问题,只是射击的反向我更倾向于一直往前,和一般的射击游戏一样,玩家靠左右前后闪躲来走位。不过这是个开放式游戏,不能说它错,只能说不是最佳实践。

第五题是实现一个 3D 赛车游戏。这题有点奇怪,几分钟就写完了,几乎没怎么思考,不像其他题要思考很久才动笔。结果一玩,游戏一直开始不了,估计有 bug;打开调试模式一看,确实有变量没有定义,是个挺低级的错误。看来问题就出在思考环节上,没想到 Grok 竟然会犯这种错误。

第六题是不用第三方库实现一个高颜值的 Trello 看板。这题花的时间就有点长了,20 分钟左右,然后就出现了 provider unavailable,只能切换到 DeepSeek V4 让它帮忙检查 Grok 这边出了什么问题,最终诊断是 Grok 服务端故障,这道题没法继续,只能五五开进行打分。

这次测评就先到这,大家看完后觉得这个模型怎么样?评论区聊聊。