Claude Haiku 5.5 测评报告!究竟有多能打!
刚出的 Claude Haiku 5.5 测评报告来了,这次通过 OpenRouter 接入,思考模式调到 high 档位——这是一般用户最常用的思考深度。如果 high 都搞不定的题目,建议上 Sonnet 或 Opus,这两个我都有测评过,大家翻一下就能找到。
第一题:强约束指令遵循句子生成测试。 要求生成 10 句话,每句必须以特定数字结尾,测试通顺度。我认真看了下,第 7 句不太通顺,其他还算 OK,整体指令遵循能力中规中矩。
第二题:鹈鹕土星环骑自行车 SVG 测试。 效果相当不错,转弯堪称完美。唯一美中不足的是鹈鹕平白无故多出一只手来扶着车把——更好的实现应该是用翅膀扶着,更符合鹈鹕的生理结构。
第三题:复合弓射箭 SVG 测试。 存在几个问题:怎么看都像个普通弓箭,连副弦都没看到;上下转轮是同一个方向转动的,其他方面没有太大问题。
第四题:精美浏览器操作系统 UI。 整体看上去还不错,右上角的弹窗把所有弹窗整合成一个了,看上去挺整洁的。Dock 栏应用功能没有问题。压轴的太空射击游戏只能通过空格键和鼠标操作,无法用键盘上下左右移动飞机,虽然操作难度不大,但用键盘控制会更有立体感。
第五题:3D 赛车游戏。 整体实现挺不错,唯一的问题是路上有个隐藏的黑色障碍物,颜色和马路基本一样,很难察觉,好几次撞上去一脸懵。
第六题:无第三方库实现高颜值 Trello 看板。 UI 配色还算可以,但列表高度没有自适应——正常来说高度应该跟随列表里待办卡片数量自适应,它每个都搞这么高不太好看。功能方面没有太大问题。
整个测评下来,虽然只是 Haiku 的 high 级别思考深度,表现已经相当能打,吊打国内一大堆模型了。而且价格很便宜,百万 token 输入 0.1 刀、输出 0.5 刀,比腾讯混元 Hy4 Preview 都便宜。大家觉得呢?








