讯飞星火X2.5测评报告!严重翻车事故现场!
好久没碰到全套推理题直接全部翻车的大模型了!粉丝点名让我拿祖传测试用例跑一遍讯飞星火最新 X2.5,之前我还没有实测过讯飞的模型,索性直接线上开启推理模式完整测一轮:
- 第一题强约束指令生成测试,输出句子结尾完全没有按照 1‑10 格式,整题全错
- 第二题新版 24 点要求输出三组解法,长时间等待之后直接抛出服务器繁忙错误,没有返回有效结果
- 第三题七位数密码锁推理,给出的答案和标准答案完全不符
三道推理题直接全军覆没。来到编程项目测试:
- 精美浏览器操作系统 UI 简陋
- 终端输入 help 之后后续输入直接失效
- 太空射击游戏画面漆黑看不到战机,分数却疯狂跳动
- 3D 赛车游戏车辆静止不动只有障碍物不断冲过来
- 无第三方库 Trello 看板距离高颜值差距很大,列表回车无法确认、待办标题输入失效、描述丢失、标签无效、卡片不能正常拖拽,卡片和列表都找不到删除入口
整套测评跑下来整体表现拉胯,对比近期测过的 GPT‑6、Fable5.1、千问 3.8 一众模型,实际表现就不多做评价避免争议,感兴趣的小伙伴可以自己上手感受下……










