讯飞星火X2.5测评报告!严重翻车事故现场!
好久没碰到全套推理题直接全部翻车的大模型了!粉丝点名让我拿祖传测试用例跑一遍讯飞星火最新 X2.5,之前我还没有实测过讯飞的模型,索性直接线上开启推理模式完整测一轮: 第一题强约束指令生成测试,输出句子结尾完全没有按照 1‑10 格式,整题全错 第二题新版 24 点要求输出三组解法,长时间等待之后直接抛出服务器繁忙错误,没有返回有效结果 第三题七位数密码锁推理,给出的答案和标准答案完全不符 三道推理题直接全军覆没。来到编程项目测试: 精美浏览器操作系统 UI 简陋 终端输入 help 之后后续输入直接失效 太空射击游戏画面漆黑看不到战机,分数却疯狂跳动 3D 赛车游戏车辆静止不动只有障碍物不断冲过来 无第三方库 Trello 看板距离高颜值差距很大,列表回车无法确认、待办标题输入失效、描述丢失、标签无效、卡片不能正常拖拽,卡片和列表都找不到删除入口 整套测评跑下来整体表现拉胯,对比近期测过的 GPT‑6、Fable5.1、千问 3.8 一众模型,实际表现就不多做评价避免争议,感兴趣的小伙伴可以自己上手感受下…… 访问入口
千问办公多人工作台怎么玩?业内首个 AI 多人协同工作台!
AI 工作台只能自己用,团队没法分工协作怎么办? 普通 AI 工作台只是静态网页,没有数据库和权限管控,只能自娱自乐。 千问办公多人工作台自带数据库与账号权限体系,实现真正多人协同,不同角色分配对应可见权限。 更新千问办公,唤起多人工作台,输入提示词快速搭建,市集招募、校园作业管理都可以实现,适用场景丰富,你想搭建什么工作台呢…… 访问入口
Skills自动进化神器!让你的智能体越用越聪明!
还在手动维护一堆 AI 智能体 Skills 吗?用一段时间就频繁出问题是不是特别闹心?如今不管 Claude Code、Codex 还是别的智能体工具,大家都会装大量 Skills,可时间一长部分 skill 就会失效,处理新任务输出效果大幅下滑——根源就是这些技能都是静态写死的文件,没有自我迭代能力,接口变更、场景变化不会自动更新;就算本次会话把问题修正,下次调用依旧旧错重犯。网上找来的 Skill 只有文字描述、缺少真实运行数据,好不好用只能靠踩坑,会话一关经验就丢了,无法沉淀成智能体自身能力。 港大(HKU Data Science Lab)开源的 OpenSpace 正好解决这个痛点。原理并不复杂:监控并记录每一次任务的成败,从失败中学习修复现有 skill,还能生成全新 skill。简单说,从前是人维护静态 Skill;用上它之后,Agent 执行的任务越多,技能库就越靠谱,不仅让 skills 越来越好用,还能节省大量无效试错带来的 tokens 损耗。 OpenSpace 通过 MCP 协议接入 Claude Code、Codex、Cursor、OpenCl...
千问办公入门(22)!数据可视化神器!
还在拿密密麻麻的原始 Excel 表格给领导做汇报?纯数据堆砌毫无重点,看着又枯燥又敷衍。本期用千问办公轻松搞定高阶数据汇报,把 Excel 一键变成能直接交差的动态销售报告——它不是死板的静态图片,而是全程可交互的可视化报表。 报表包含销售额趋势折线图、区域销售对比柱状图、品类销售占比饼图,最关键的是还能自动生成数据核心洞察与落地建议,专业度直接拉满。 操作方法超级简单:打开千问办公,在功能栏选中数据可视化技能,上传自己的 Excel 数据表格,输入对应的分析提示词直接提交,短短几秒就能生成完整成品。零基础不用懂制表、不用懂数据分析,一键把枯燥原始数据变成高端专业汇报报表,职场办公效率直接翻倍! 访问入口
Muse Spark 1.3 测评报告!Meta翻身之作?
Meta Muse-Spark-1.3 测评报告来了!这款模型热度远不如 GPT-6,网传却是实力强悍、价格低廉的高性价比选手。本次通过 OpenRouter 接入测试,Harness 选用干净的 PI-Agent,文末附带本次测评完整开销与 Token 消耗数据。 第一项强约束指令生成测试,1-10 结尾格式无误,但 6、9 句存在缺陷,六七句语句生硬不通顺,第八句缺少文字,第九句时间逻辑出现错误。新版 24 点三道解法全部合规正确。七位数密码锁推理顺利答对。 来到编程测试,浏览器操作系统、太空射击游戏功能完整可运行,只是游戏效果对比 GPT-6、Claude Fable5.1 差距明显。3D 赛车项目翻车,道路无法渲染几乎不能游玩。Trello 看板整体 UI 好看,唯独卡片编辑标题栏过窄存在显示 bug。 本次测评一共消耗 301K tokens,缓存命中率 23.8%,花费 0.89 美元,折合人民币六块出头。看完实测,你觉得这款模型值不值得入手,欢迎评论区聊聊…… 访问入口
GPT 6 Astra测评报告!究竟有多能打?
GPT-6 Astra 实测测评新鲜出炉!本次测试由粉丝提供,所有任务思考模式均调至 medium。 推理测试 指令生成测试满分通关 24 点第三解违规使用 log 函数 密码锁推理回答正确 编程板块 浏览器系统成功实现 太空射击游戏成功实现 3D 赛车成功实现(仅存在碰撞穿透的小 bug) Trello 看板成功实现 整体实战水平十分出彩,搭配 Workbuddy 效果更佳。你如何看待 GPT-6 Astra 本次的实测成绩? 访问入口
GPT-6 究竟强在哪?各大benchmarks详细解读!
GPT-6 跑分直接杀疯了!本期视频深度解读 OpenAI 官方放出的全套 benchmark 数据,看看 GPT-6 真正的强项在哪里。 推理能力 ARC-AGI-3 拿下 98.6%,近乎满分,主打原生智力和全新任务零提示摸索能力 Claude-Fable-5.1 得分 87.8%,GPT-6 大幅领先 数学实力 Frontier Math Tier4 斩获 97.6%,大幅抛离 Claude-Fable-5.1 的 87.8%,数学实力实测碾压 办公智能体 Agents Last-Exam 得分 59.3%,考察 AI 自主操控电脑完成复杂工作 3D 建模型空间感知 BenchCAD 达到 95.9%,相比 Fable 5.1 高出十个百分点以上,空间能力提升巨大 编程基准 DeepSWE 仅 73%,略低于 Gemini-3.8-Flash 的 73.7%,编程表现反常偏弱 其他基准 Terminal-Bench-Science 拿到 64%,终端科研实操能力出众 Exploit-Bench 漏洞挖掘安全测试直接满分 100% 跑分解读完毕,后续...
全球大模型怎么玩?Openrouter竟然支持微信支付!
分享一个很尴尬的冷知识,估计很多人早就知道,唯独我才后知后觉。OpenRouter 聚合了海量海内外大模型,我一直误以为只能靠境外信用卡才能充值,直到今天才解锁新姿势。点开个人头像,选择 credit 余额板块,点击 add-credit 充值入口,一定要勾选 use one time payment methods 这个选项,之后就能看见支付宝、微信支付的通道。不用海外银行卡,也可以轻松充值,体验平台上面各式各样的海外大模型。之前白白绕了不少弯路,属实有点尴尬…… 访问入口
AI产品狙击手!大模型性价比一览表!哪个模型最能打?
想要快速摸清一款新出大模型的真实实力、调用价格,算出它的性价比,可以看看我做的这个小工具: AI 产品狙击手平台。之前更多给大家介绍过平台的 AI 工具严选板块,选中例如 Agnes‑AI 这类工具,既能一键跳转访问入口,还可以点开视频标签,查看实测测评视频,提前了解工具真实上手效果。而查询大模型实力就打开 LLM 测评专区,所有主流模型统一使用同一套 benchmark 测试用例打分,像刚测完的 Gemini 3.8‑Flash 拿到 49 分(满分 60),点开详情就能查看每一道测试题的得分与扣分原因,配套的测评视频也可以一键直达,保证测评分数有据可查。看完性能之后再前往模型参数价格板块,谷歌 Gemini 3.8‑Flash、千问 3.8‑Flash‑0902、混元 Hy4‑Preview、GLM‑5.3、Claude‑Fable‑5.1 等一众新品的最新报价全部收录在内。结合实测得分与 API 价格两项数据对比,哪个模型才是性价比之王,一眼就能判断出来…… 访问入口
千问办公实战(21)!这一看就是AI做的?怎么一键去AI味?
做内容创作、靠 AI 产出文案的小伙一定要留意!刷视频频时你肯定听过”战斗力度拉满”这类话术,浓郁的 AI 腔很容易让观众产生抵触心理。像深耕、致力于、最前沿,都是大模型高地产出的标志性词汇,一眼就能识破机器痕迹。 我拿一段 Deepseek 生成 的自我介给给家演示,原文 AI 味很重,经过修改之后几乎分不清是人写还是 AI 生成。想要快速去掉方案的机器感,可以在千问办公启用 AI 文本优化 skill,下达去除 AI 味的指令。工具会逐项标出 AI 话术、给出修改理由,输出一份接地气、说人话的改写文稿。 掌握这个去 AI 腔的小技巧,你的内容创作效率就能再上一个台阶…… 访问入口









