Qwen 3.8 Omni Flash 全模态测评!究竟有多能打?
Qwen 3.8 Omni Flash 全模态模型来袭,我们的测评报告当然不能落下。因为是全模态模型,所以先测多模态能力,然后再看大家要求要不要测推理和编程。由于在线上测试,不知道免费额度能测多少,本次测试按最关心的顺序来。
第一题:HTML 游戏复刻。 给它一个简单的左右移动接住星星的小游戏视频,让它通过 HTML 复刻这个游戏。实现完成后打开看,实际效果像模像样,但有个问题:只能通过鼠标控制,键盘上下左右无法操控——而这个游戏明显应该支持键盘控制。
第二题:鸳鸯图片辨别。 给它一张鸳鸯图片,让它分辨雄鸳鸯和雌鸳鸯的数量。图片中应该有五只雄鸳鸯、四只雌鸳鸯,最左边是一只野鸭。模型回答四雄五雌,刚好说反了。
第三题:图像细节辨析。 让模型找出图片中的不同之处,它指出第一行第四列的菱形不端正、有所倾斜。实际检查后确认确实如此,判断正确。
第四题:电影出处匹配(老无所依)。 给一张老无所依电影截图,看模型是否能找出出自哪部电影。第一次给了截取较远的图,模型回答星际穿越,错了。这道题很少有模型能做对——不是辨别不了图片内容,而是在根据内容匹配电影时出错。换成更清晰的截图后,这次成功找出是老无所依。
第五题:空间位置判断。 给一张距离很远拍摄的图片,问红色电话亭在黄色车的哪一边,模型回答正确,在右边。
第六题:视频行为分析。 给一个很模糊的开车视频,让模型判断何时变道、何时转弯。原视频约 4 秒并线、9 秒左右转弯,模型回答 4-6 秒变线、8-9 秒开始转弯,基本准确。
第七题:音频转写。 用之前测试 Union Alpha 时分离出的音频,让模型提取文稿。结果整体表现不错,只有一处把”复合弓的副弦”识别成了”布弦”。考虑到语音转写的难度,这个准确度已经非常难得,用过剪辑软件自动生成字幕的人都知道错字有多离谱。
测评下来,Qwen 3.8 Omni Flash 在多模态理解方面有亮眼表现,也存在一些细节上的不足。结论大家评论区自己判断吧。












