Longcat 2.5 Preview 测评报告!这个模型能用吗?
美团在中秋之夜发布了 LongCat 2.5 Preview,本期测评同样用 PI 接入,思考模式上 LongCat 只有开和关两档、不支持分 level 调节,所以直接全部打开来测。
第一题是强约束指令遵循句子生成测试。十句话的结尾确实按顺序从一数到十,约束是守住了,但读下来第六、七、八、九句都不通顺,语言质量没跟上。
第二题是鹈鹕土星环骑自行车 SVG 测试。这个模型显然没有理解土星环这条环形轨道:它不是顺着土星环骑行,而是另外又建立了一条轨道;转弯肯定是不行的,骑到下方就开始倒着走。另外鹈鹕身后那块红色的东西估计是自行车坐垫,无论是什么,一直在变动,也是不对的。
第三题是复合弓射箭 SVG 测试。问题不少:箭感觉是被推出去的而不是射出去的;弓是平射出去的,箭却往上跳跃着,想模拟成抛物线但很假;箭没有射到靶心;画面里也看不到复合弓的副弦,那跟一般弓箭有什么区别。
第四题是实现一个精美的浏览器内操作系统。UI 感觉很一般,右上角的设置弹窗根本不工作,只有一团东西在那里闪烁。压轴的太空射击游戏,虽然说实现了 WASD 控制方向,但按下后飞机只是侧了一下身、并没有移动方向,最终只能通过鼠标控制,玩起来很不舒服,好在空格键发射子弹是正常的。
第五题是实现一个 3D 赛车游戏。一开局的时候路就是远离车子的,给人感觉车是倒着开的;开了半天别说障碍物,连鬼影都没有见到一个,所以这个实现是完全不行的。
第六题是无第三方库实现一个高颜值 Trello 看板。列表布局不大好,没有根据卡片数量自适应高度;待办卡片添加子任务后,关闭重新打开就不见了;拖动卡片到另外一个列表时其他卡片会挪位置,但动画效果很一般,根本没有提示里说的平滑滑开让位的效果。
整个测评下来,感觉这个模型能用,但不算很能打。








