Mercury 2.5测评报告!自回归大语言模型杀手?
扩散大语言模型这条路走得通吗?称生成速度上千 token 每秒的扩散大模型 Mercury 2.5 实测来了!粉丝点名让我测试这款刚在 OpenRouter 上线的 Diffusion LLM,这类模型和普通自回归模型不一样,不会逐个输出 token,而是一次性批量吐出多个 token,理论上速度直接拉满。
我在今年 3 月就测过旧版本,当时表现很差,期待新版本能有所改善。本次通过 OpenRouter 在 pi 环境接入,思考模式开到最高,逐项实测:
- 第一题·强约束指令生成:生成速度肉眼飞快,不用快进,但全部句子语句不通顺,直接翻车;
- 第二题·新版 24 点:要求三组解法,模型直接表示无法求解,要求去掉数字 2 才能作答;
- 第三题·七位数密码锁推理:给出的答案完全错误,三道推理题全军覆没。
接着测试编程任务:
- 浏览器操作系统缺少弹窗,仅计算器勉强可用;
- 太空射击游戏完全失效;
- 3D 赛车 UI 简陋,越过第一个障碍物之后不再刷新障碍;
- Trello 看板初始化界面异常,创建列表后无法新建卡片和拖拽。
整套测评下来,这款扩散大模型空有极速生成的噱头,推理和代码落地能力拉胯。大家怎么看待这类 Diffusion LLM 呢?欢迎在评论区聊聊。







