Qwen-3.8-27B 测评报告!真的能打吗?
发表于|更新于|大语言模型
Qwen-3.8-27B 开源模型测评,本次测试使用 Q4_K_S 量化版本,BF16 原版权重留给大家自行部署。指令生成测试全部达标通顺,24 点、密码锁推理作答无误;浏览器操作系统项目启动失败,3D 赛车游戏画面可用但按键左右反转,Trello 看板功能完整。27B 量化后依旧有着不俗实力,非量化版本潜力更高,非常适合个人以及小型企业本地部署使用……
相关推荐

2026-09-02
Qwen 3.8 Max 新版测试!究竟有多能打?
Qwen 3.8 Max 新版实测报告来了!官宣编程能力大幅升级、登陆 CodeArena 榜单,今天就在 Deepseek Harness 拉满思考深度,用上 V2.1 祖传测试用例一探究竟。 强约束句子生成任务全部通过,十条语句通顺达标;三解 24 点题目前两个解法正确,第三个误用开立方出现违规参数;难度升级的 7 位密码锁推理宣告无解,推理环节翻车。 编程测试取消无头浏览器 UI 校验,纯看模型原生输出。浏览器操作系统 UI 精致、弹窗与 Dock 栏运行正常;太空射击游戏 3D 效果到位,但空格键和鼠标点击无法发射子弹,存在功能 bug;3D 赛车游戏整体体验尚可,少量障碍物贴图粗糙;Trello 看板 UI 观感舒适,拖拽增删改功能运行稳定。 访问入口

2026-05-21
Qwen 3.7 测试!吊打Gemini 3.5!
本期带来 Qwen 3.7 与 Gemini 3.5 的正面评测对比,涵盖编程、推理、数学、多模态等核心维度。阿里通义千问 Qwen 3.7 是阿里巴巴推出的高性能大语言模型,号称全面吊打 Gemini 3.5。一起来看看 Qwen 3.7 的实际表现如何。 访问入口

2026-08-27
Qwen 3.8 Flash测评报告!究竟有多能打?
期待已久的 Qwen‑3.8‑Flash 实测报告新鲜出炉!这款全新的 MoE 多模态大模型,主参 125B,每次仅激活 6B 参数,原生 256K 上下文最高可扩容至 1M,API 定价性价比极高,网传办公编稿实力十分强悍。本次依旧使用祖传全套测试用例,在 Claude Code 上将思考模式拉满展开测评。约束生成、24 点运算、密码推理题全部顺利通过,推理表现亮眼。但深度编程测试当中,浏览器操作系统、太空射击游戏、Trello 看板等项目出现了界面布局、物体方向、按钮排版等小 bug,3D 赛车游戏整体完成度较高。综合来看它的推理能力稳定在线,编程实力可圈可点,想要上手的小伙伴可以参考这份实测结果…… 访问入口

2026-07-19
Qwen 3.8 预览版测评报告,打得过Kimi K3吗?
千问 3.8 Max Preview 实测测评,对比此前 Kimi K3 的测评表现如何呢? 统一标准祖传测试用例实测,约束文本生成全对且速度更快,24 点、密码推理答题准确;编程项目生成效率大幅提升,浏览器系统配套太空射击游戏 UI 与功能完整,3D 赛车运行流畅无操控故障,复刻 Trello 看板还原度极高,仅缺少单条待办删除按钮一处小瑕疵。 对比 Kimi K3 存在答题失误、赛车失控、界面 bug 且生成耗时极长等短板,千问新版本综合实力更出众,响应速度优势突出。 关注 AI 产品狙击手,持续更新各类 AI 模型实测干货! 访问入口

2026-08-27
Qwen 3.8 Flash 多模态测评!究竟有多能打?
Qwen 3.8‑Flash 多模态专项测评来了!在上一期测试推理与编程实力之后,本期就用专属祖传测试用例,深度检验它识图、视觉理解的真实水平。 电影截图识别一题翻车、一题答对;空间方位判断、细微倾斜图形辨别表现出色;鸳鸯计数出现误判,将野鸭归类成了雌性鸳鸯。视觉时序测试中,并线时间识别准确,右转时间判断却出现了较大偏差。综合来看,这款 125B 参数的模型图像感知能力可圈可点,但在复杂识别、长视觉时序轴判断上依旧存在短板,感兴趣的小伙伴可以亲自动手实测感受一下…… 访问入口

2026-09-13
Qwen 3.8 Max 鹈鹕骑自行车SVG测评报告!
本期继续跑 Benchmark 里的两道 SVG 测试题——「鹈鹕土星环骑自行车」和「复合弓射箭」。上一集测的是 GLM 5.3 Flash,这一集轮到千问 3.8 Max 0902 上场。 第二题「鹈鹕土星环骑自行车 SVG 测试」,先看效果。鹈鹕和自行车的结构没有问题,但骑到右边之后,鹈鹕和自行车整个倒了过来。这一点和 GLM 5.3 Flash 刚好相反:GLM 是在上方跑道正常,一来到下面跑道就倒过来。 第三题「复合弓射箭 SVG 测试」同样有几个问题。第一,弓箭明显是反的;第二,人物的右手去拉弓的时候,是穿过了持弓的左手的,属于明显的穿帮。 其他题目这次就不重测了,分数继续沿用 Benchmark V2.1 的测评结果,只有第二、第三题换成本次的新得分。大家翻 Benchmark 数据的时候请注意这一点,我也会在页面上标注出来。 访问入口
公告






