好久没碰到全套推理题直接全部翻车的大模型了!粉丝点名让我拿祖传测试用例跑一遍讯飞星火最新 X2.5,之前我还没有实测过讯飞的模型,索性直接线上开启推理模式完整测一轮:

  • 第一题强约束指令生成测试,输出句子结尾完全没有按照 1‑10 格式,整题全错
  • 第二题新版 24 点要求输出三组解法,长时间等待之后直接抛出服务器繁忙错误,没有返回有效结果
  • 第三题七位数密码锁推理,给出的答案和标准答案完全不符

三道推理题直接全军覆没。来到编程项目测试:

  • 精美浏览器操作系统 UI 简陋
  • 终端输入 help 之后后续输入直接失效
  • 太空射击游戏画面漆黑看不到战机,分数却疯狂跳动
  • 3D 赛车游戏车辆静止不动只有障碍物不断冲过来
  • 无第三方库 Trello 看板距离高颜值差距很大,列表回车无法确认、待办标题输入失效、描述丢失、标签无效、卡片不能正常拖拽,卡片和列表都找不到删除入口

整套测评跑下来整体表现拉胯,对比近期测过的 GPT‑6、Fable5.1、千问 3.8 一众模型,实际表现就不多做评价避免争议,感兴趣的小伙伴可以自己上手感受下……