Qwen 3.7 Max正式版!真的能打吗?实测报告!
发表于|更新于|大语言模型
本期视频带来千问旗舰模型 Qwen 3.7 Max 正式版实测。作为阿里通义千问迄今最强大的智能体模型,Qwen 3.7 Max 可自主完成长达 35 小时的复杂任务,在 Arena 全球大模型盲测总榜中位列国产第一,逼近 GPT、Claude、Gemini 第一梯队水平。视频从编程能力、办公自动化、长周期任务执行、多框架适配四大维度全面评测,解析这款模型究竟能不能打、适合哪些场景。
相关推荐

2026-06-07
Qwen3.6 27B 测试报告!真的能打吗?
本期视频实测阿里巴巴通义千问最新发布的 Qwen3.6 27B 大模型,国产旗舰开源系列全新版本。27B 参数规模,主打更强推理与 Agent 能力。本期视频用祖传测试用力测评,看这款阿里旗舰模型究竟能不能打。 访问入口

2026-06-02
Qwen 3.7 Plus 测试报告!真的能打吗?
本期视频实测阿里巴巴通义千问最新发布的 Qwen 3.7 Plus,国产旗舰开源大模型系列高配版本。本期视频用祖传测试用力测评,看 Qwen 3.7 Plus 究竟能不能打。 访问入口

2026-07-21
Qwen-Audio-3.0-TTS!阿里语音合成新模型登顶榜单!
此前实测千问3.8 Max Preview综合表现十分亮眼,阿里同期上新的Qwen-Audio-3.0-TTS语音合成模型实力同样顶尖,拿下全球语音榜单榜首。传统TTS音色规整生硬,很难还原真实情绪,只能生硬输出笑声文字,这款模型支持细粒度情绪调控,喜怒骂等神态语气都能自然还原,同时完美适配多方言与多种语言合成。模型可在百炼平台调用,代码简介易懂,采用websocket全双工传输,区别于传统单次应答的HTTP接口,支持实时打断对话,交互流畅度大幅提升,适合有语音生成、实时语音交互需求的开发者自行上手体验。 访问入口

2026-08-27
Qwen 3.8 Flash 多模态测评!究竟有多能打?
Qwen 3.8‑Flash 多模态专项测评来了!在上一期测试推理与编程实力之后,本期就用专属祖传测试用例,深度检验它识图、视觉理解的真实水平。 电影截图识别一题翻车、一题答对;空间方位判断、细微倾斜图形辨别表现出色;鸳鸯计数出现误判,将野鸭归类成了雌性鸳鸯。视觉时序测试中,并线时间识别准确,右转时间判断却出现了较大偏差。综合来看,这款 125B 参数的模型图像感知能力可圈可点,但在复杂识别、长视觉时序轴判断上依旧存在短板,感兴趣的小伙伴可以亲自动手实测感受一下…… 访问入口

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口

2026-08-27
Qwen 3.8 Flash测评报告!究竟有多能打?
期待已久的 Qwen‑3.8‑Flash 实测报告新鲜出炉!这款全新的 MoE 多模态大模型,主参 125B,每次仅激活 6B 参数,原生 256K 上下文最高可扩容至 1M,API 定价性价比极高,网传办公编稿实力十分强悍。本次依旧使用祖传全套测试用例,在 Claude Code 上将思考模式拉满展开测评。约束生成、24 点运算、密码推理题全部顺利通过,推理表现亮眼。但深度编程测试当中,浏览器操作系统、太空射击游戏、Trello 看板等项目出现了界面布局、物体方向、按钮排版等小 bug,3D 赛车游戏整体完成度较高。综合来看它的推理能力稳定在线,编程实力可圈可点,想要上手的小伙伴可以参考这份实测结果…… 访问入口
公告






