Seedream 5.0 Flash测评报告!几近全军覆没!
AI产品狙击手此前用一套「祖传测试用例」测过不少大语言模型,但文生图模型一直没有做过 Benchmark。这次补上:同样是 6 道题、每题 10 分,分别考察中文文字生成、物理规律理解、AI 修图等能力。第一位上场的,是字节跳动的 Seedream 5.0 Flash。
Q1 中文长文本排版支持(水彩风珠海 5 天行程插画,6 分):整体生成的大方向没有问题,画面和五日行程安排也都正常,主要问题出在错别字,一共错了三处——第一天的「日月贝鹈鹕歌剧院」把「鹈鹕」写错,第二天「鲸鲨馆」的「鲨」字写错,第三天「外伶仃」的「仃」字写错。算它刚及格。
Q2 推理和中文支持(桂林手绘三日行程图,7 分):这一题不给任何具体行程描述,要求模型自己推理。三日行程的安排它能正常推理出来,整个画面也比较讨喜,核心能力是达成的。但错别字依然存在:某处「船……夜游」有个字认不出来,「土鸡」后面接的「等」字不对,「世外桃源」的「世」字写得很别扭,乍一看像个「山」字。因为本题主要考察推理能力,给 7 分。
Q3 同一角色多视角一致性(女孩四宫格不同角度,4 分):三个问题——右边不该多出一个人物来,说好的是四宫格;右下角那张应该是 3/4 视角、稍微侧对着镜头,没有做到;左下角两只手是垂下来的,很明显没有抱着白猫。完全不及格。
Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射,3 分):这是穿帮最密集的一题,一共挑出七处。第一,女孩明显不是站着的,提示词写的是站在落地镜前拍摄;第二,镜子里的手机方向反了,违反物理规则;第三,镜中女孩拿手机的手能看到 5 根手指,而对比扶着手机边框的手指和真实情况,那明显是食指,也就是说还有一根拇指被挡住没看到,镜子里的女孩有 6 根手指;第四,提示词说杯子是装满水的,但明显没有;第五,筷子无论在镜子里还是镜子外都没有半点折射;第六,从我们这个角度看镜子,杯子放在那个位置其实不大可能从镜中被看到;第七,提示词说的是一根筷子,画面里明显是两根。穿帮太多,只能给 3 分。
Q5 柱状图和饼图图表生成(7 分):完整看过一遍,没有什么大问题。真要挑的话,就是左边柱状图里红色那一根数值是 25,但高度稍微超出了代表 25 的虚线一点点。其余没什么问题。
Q6 参考图和图片编辑(左右两个男生位置互换,3 分):左右两个男生的位置确实互换了,但三位女生的位置也跟着换了——感觉模型只是把它理解成了「所有人物左右互换」。勉强给 3 分。
总的测评下来,因为这是这套 Benchmark 的第一个被测模型,没有其他模型做比较,所以目前还不确定是这套用例太难,还是这个模型太烂,只能等测多几个之后再下定论。







