Qwen 3.8 27B(FP8) 测评报告!相当的能打!
发表于|更新于|大语言模型
Qwen-3.8-27B FP8 量化版本实测对比,相较于上期 Q4 版本表现更进一步,强约束指令生成全部通顺无重复字符,24 点、密码锁推理题全部答对;浏览器操作系统出现计算器计算错误,太空射击游戏存在小瑕疵,3D 赛车游戏运行正常、按键方向无误,Trello 看板功能完好,综合性能足以胜任日常办公、网页开发等常规编程需求……
相关推荐

2026-09-30
Qwen 4(疑似)测评报告!究竟有多能打?
注意 Qwen 4 后面要括弧加个”疑似”——真实代号是 Qwen latest series Invite 2,609。测评环境是在 Deepseek Harness 上进行的,具体思考深度未知,稍后获悉会在评论区补充。 第一题:强约束指令遵循句子生成测试。 第 5 和第 8 句结尾不是从 1 到 10 结尾的。其他句子中第 3 句不通顺,第 6 句也不太通顺(如果改成”掷出的点数正好是 6”会更通顺)。 第二题:鹈鹕土星环骑自行车 SVG 测试。 整体感觉不错。右边转弯时仔细看会发现鹈鹕的屁股先转,然后才 180 度转正,稍微有点瑕疵。 第三题:复合弓射箭 SVG 测试。 整体效果不错,复合弓结构和弓箭抛物线都没有问题。唯一的问题是人物右手拿弓、左手拉弓,但弓箭却在右手外侧,特别是拉到身体部位时左手被挡住,弓箭感觉是被无形的手在拽着,不合常理。 第四题:实现个精美浏览器操作系统。 UI 看上去还是不错的。右上角弹窗功能没有问题。日历高亮日期部分不应做成椭圆形,而应做成圆形或带圆角的方形。Dock 栏应用没有问题。 第五题:3D 太空射击游戏。 初始速度太猛,开车水平不行...

2026-09-02
Qwen 3.8 Max 新版测试!究竟有多能打?
Qwen 3.8 Max 新版实测报告来了!官宣编程能力大幅升级、登陆 CodeArena 榜单,今天就在 Deepseek Harness 拉满思考深度,用上 V2.1 祖传测试用例一探究竟。 强约束句子生成任务全部通过,十条语句通顺达标;三解 24 点题目前两个解法正确,第三个误用开立方出现违规参数;难度升级的 7 位密码锁推理宣告无解,推理环节翻车。 编程测试取消无头浏览器 UI 校验,纯看模型原生输出。浏览器操作系统 UI 精致、弹窗与 Dock 栏运行正常;太空射击游戏 3D 效果到位,但空格键和鼠标点击无法发射子弹,存在功能 bug;3D 赛车游戏整体体验尚可,少量障碍物贴图粗糙;Trello 看板 UI 观感舒适,拖拽增删改功能运行稳定。 访问入口

2026-08-15
Qwen-3.8-27B 测评报告!真的能打吗?
Qwen-3.8-27B 开源模型测评,本次测试使用 Q4_K_S 量化版本,BF16 原版权重留给大家自行部署。指令生成测试全部达标通顺,24 点、密码锁推理作答无误;浏览器操作系统项目启动失败,3D 赛车游戏画面可用但按键左右反转,Trello 看板功能完整。27B 量化后依旧有着不俗实力,非量化版本潜力更高,非常适合个人以及小型企业本地部署使用…… 访问入口

2026-07-19
Qwen 3.8 预览版测评报告,打得过Kimi K3吗?
千问 3.8 Max Preview 实测测评,对比此前 Kimi K3 的测评表现如何呢? 统一标准祖传测试用例实测,约束文本生成全对且速度更快,24 点、密码推理答题准确;编程项目生成效率大幅提升,浏览器系统配套太空射击游戏 UI 与功能完整,3D 赛车运行流畅无操控故障,复刻 Trello 看板还原度极高,仅缺少单条待办删除按钮一处小瑕疵。 对比 Kimi K3 存在答题失误、赛车失控、界面 bug 且生成耗时极长等短板,千问新版本综合实力更出众,响应速度优势突出。 关注 AI 产品狙击手,持续更新各类 AI 模型实测干货! 访问入口

2026-08-27
Qwen 3.8 Flash 多模态测评!究竟有多能打?
Qwen 3.8‑Flash 多模态专项测评来了!在上一期测试推理与编程实力之后,本期就用专属祖传测试用例,深度检验它识图、视觉理解的真实水平。 电影截图识别一题翻车、一题答对;空间方位判断、细微倾斜图形辨别表现出色;鸳鸯计数出现误判,将野鸭归类成了雌性鸳鸯。视觉时序测试中,并线时间识别准确,右转时间判断却出现了较大偏差。综合来看,这款 125B 参数的模型图像感知能力可圈可点,但在复杂识别、长视觉时序轴判断上依旧存在短板,感兴趣的小伙伴可以亲自动手实测感受一下…… 访问入口

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口
公告





