扩散大语言模型这条路走得通吗?称生成速度上千 token 每秒的扩散大模型 Mercury 2.5 实测来了!粉丝点名让我测试这款刚在 OpenRouter 上线的 Diffusion LLM,这类模型和普通自回归模型不一样,不会逐个输出 token,而是一次性批量吐出多个 token,理论上速度直接拉满。

我在今年 3 月就测过旧版本,当时表现很差,期待新版本能有所改善。本次通过 OpenRouter 在 pi 环境接入,思考模式开到最高,逐项实测:

  • 第一题·强约束指令生成:生成速度肉眼飞快,不用快进,但全部句子语句不通顺,直接翻车;
  • 第二题·新版 24 点:要求三组解法,模型直接表示无法求解,要求去掉数字 2 才能作答;
  • 第三题·七位数密码锁推理:给出的答案完全错误,三道推理题全军覆没。

接着测试编程任务:

  • 浏览器操作系统缺少弹窗,仅计算器勉强可用;
  • 太空射击游戏完全失效;
  • 3D 赛车 UI 简陋,越过第一个障碍物之后不再刷新障碍;
  • Trello 看板初始化界面异常,创建列表后无法新建卡片和拖拽。

整套测评下来,这款扩散大模型空有极速生成的噱头,推理和代码落地能力拉胯。大家怎么看待这类 Diffusion LLM 呢?欢迎在评论区聊聊。