GPT-6-Luna-Decisions!OpenAI版Jev决策模型!
OpenAI 也下场做决策模型了。Decisions API 这两天开公测,价格倒是 Jev 的两倍多。 三个问法几乎是照着 Jev 搬过来的。Jev 那边叫 noul、choice、score,OpenAI 这边叫 predicate、choice、score —— 换了个名字接着用。你把要判断的东西喂进去,文字、JSON 都行;OpenAI 这边多吃一样:图片。 出来直接就是数。是还是不是,给你一个 0 到 1 的概率;几个候选你选哪个,把每个的概率列出来;按档位打分,还给个加权分 —— 三档 0、1、2,它返你一个 1.1,意思是卡在两档中间。 答案旁边带着信心值。比如丢一张商品照片问有没有磕碰,它返 0.816,你就可以定条线:超过 0.8 转人工。一次请求最多塞 200 个问题。 官方说它比同一个模型走普通的 Responses API 快 10 倍。价钱摊开看:Jev 100 万输入 token 收 0.042 美元,它收 0.1 美元;但 Jev 只认文字,图片接不了。另外现在能跑的模型也只有 GPT-6 Luna 一个,还是公开测试版,输出那个数不单独收费。...
千问办公入门(31)!如何做一份专业的竞品分析?
这一集教程,我们学习在千问办公中怎么做竞品分析。开始之前,先看一份 DeepSeek 做的竞品分析——以千问办公和 Workbuddy 为例。它输出的是一个看着像模像样的对比页面:两款产品各一句话定位,加一张覆盖厂商定位、功能、商业模式等十几个维度的对比表,再有相同点、关键差异和选型建议。结构是完整的,但通篇没有任何数据来源,内容全靠模型记忆泛泛而谈,还把基本事实搞错了——它把 Workbuddy 说成京东系产品,而它其实是腾讯家的。看着热闹,经不起推敲。 再看千问办公用同样提示词做的这份:开头就标注了 6 大维度、10 张对比表、12 项数据来源、数据截止日期。它是真联网调研过的,信息来自两家官网、掘金和 CSDN 的第三方横评、用户长测等,每个板块都挂着出处。内容也全是硬货——定价精确到每一档,口碑做成了结论和好评差评对照表,功能矩阵 20 多项逐项标注支持情况,还给两家各做了一套 SWOT,最后落到按优先级排序的差异化机会点。 一句话总结:DeepSeek 教的是一篇作文,千问办公教的是一份能直接拿去开会用的报告。 那千问办公是怎么做到的呢?很简单,靠 Skill。我...
Claude Haiku 5.5 测评报告!究竟有多能打!
刚出的 Claude Haiku 5.5 测评报告来了,这次通过 OpenRouter 接入,思考模式调到 high 档位——这是一般用户最常用的思考深度。如果 high 都搞不定的题目,建议上 Sonnet 或 Opus,这两个我都有测评过,大家翻一下就能找到。 第一题:强约束指令遵循句子生成测试。 要求生成 10 句话,每句必须以特定数字结尾,测试通顺度。我认真看了下,第 7 句不太通顺,其他还算 OK,整体指令遵循能力中规中矩。 第二题:鹈鹕土星环骑自行车 SVG 测试。 效果相当不错,转弯堪称完美。唯一美中不足的是鹈鹕平白无故多出一只手来扶着车把——更好的实现应该是用翅膀扶着,更符合鹈鹕的生理结构。 第三题:复合弓射箭 SVG 测试。 存在几个问题:怎么看都像个普通弓箭,连副弦都没看到;上下转轮是同一个方向转动的,其他方面没有太大问题。 第四题:精美浏览器操作系统 UI。 整体看上去还不错,右上角的弹窗把所有弹窗整合成一个了,看上去挺整洁的。Dock 栏应用功能没有问题。压轴的太空射击游戏只能通过空格键和鼠标操作,无法用键盘上下左右移动飞机,虽然操作难度不大,但用键...
Rea!可执行程序秒扒光!开源逆向黑科技!
看到别人 APP 里一个好用的功能,却拿不到源码,是很多做客户端的人都会遇到的窘境。现在有个新思路:直接对着 AI 说一句话,让它把那个 APP 拆到二进制层面,告诉你这个功能到底是怎么写的,甚至顺手帮你复刻一个。干这件事的开源项目叫 REA,目前在 GitHub 上已经攒了 12,000 多颗星。 REA 的形态是给 AI 编程助手用的一个 MCP 服务,装完之后重启一下 agent 就能用,不需要另外学一套界面。用法也很直白:直接跟它说想搞懂哪个软件里的哪个功能,它就会自己把那个软件扒开来看——没有源码也能看。它会先把可执行文件还原成能读的代码,再顺着调用关系,把整件事是怎么跑通的讲给你听。像人家的离线搜索是怎么做的、登录和本地存储是怎么设计的、一段可疑的联网行为藏在哪一行,都可以直接问它。 看明白之后,在同一个会话里就能让它照着你的项目做一个自己的版本,从「看懂」直接过渡到「照做」,不用在两个工具之间来回搬上下文。 它能摸的东西挺杂:Mach-O、ELF、PE 这些原生二进制,Mac 上的 APP,Electron 打包过的前端应用,手机上的 APP 和 IPA 也都...
Mistral Large 4.0 测评报告!中美之外的法国黑马?
这期应粉丝要求测评 Mistral 最新的 Mistral Large 4 模型。看网上各种 benchmarks,据说非常能打,那在我们这套祖传测试用例中表现如何呢?我们继续在 Pi 中接入,另外查了一下,它的思考模式最高只能去到 high。 第一题是强约束指令遵循句子生成测试——要求十个句子的结尾依次是 1 到 10,来看通顺度。认真看下来,第一、三、五、六、七、八、九句都不通顺,都是为了凑数字结尾,硬把句尾的单位去掉的;其实第十句也不大顺,感觉还是要加个「颗」字才好,大家觉得呢? 第二题是鹈鹕土星环骑自行车 SVG 测试,这个效果不行。第一,转弯肯定是不行的,都倒过来了;第二,到了上方的时候图形并没有挡住鹈鹕,让人感觉土星环没有环绕土星,也就是土星在土星环之外;第三,鹈鹕的翅膀在中间,那它是怎么凭空多出一只手来扶着车把的;第四,鹈鹕的脚没有踩到脚踏上。 第三题是复合弓射箭 SVG 测试。第一,箭头是反的;第二,人手一直像僵尸一样直直的,拉弓时也没见弯曲;第三,弓箭没有射中靶心。 第四题是实现一个精美的浏览器操作系统。这一个实现花了相当长的时间,估计快两个小时,原因有三...
Jeff!Jev开源平替!0.8B本地随便跑!
闭源 API 按毫秒卖钱的决策模型,有老哥自己烧卡训了个 0.8B 的开源平替:二十几毫秒出结果,还分文不收。这就是 Jeff,上线 10 天 GitHub 就攒了 1400 多颗星。 它对标的就是最近大火的 TypeSafe 那个闭源收费的 Jev——参数不公开,官方演示一次调用要 100 多毫秒。而 Jeff 连请求格式都跟 Jev 对齐,当平替接过去就能用,不用改客户端。 玩法是把大模型留着干重活,杂活全丢给它:比如这条评论是不是垃圾、客户这句话想干嘛、Agent 该调哪个工具。它直接给带概率的答案,没把握就转给大模型,最多能吃 254 个选项。 消费级显卡、自己电脑就能跑。相对于之前跟大家介绍过的拉雅(Laya),它不会选项一多就掉链子。想省推理成本的,可以先挑业务里最烧钱的那类高频判断换上去试一试。 访问入口
Nano Banana 2.1 测评报告!究竟有多能打?
这期我们测评刚发布的 Nano Banana 2.1,用的还是那套祖传测试用例。应粉丝要求,第三题「不同角度人物一致性」的题目做了更新,Benchmark 也随之升级到 V1.2。本次依然直接在 OpenRouter 的 Playground 上实测。 第一题是中文长文本排版支持测试——水彩风珠海五天行程插画。这道题的表现可能是之前测过的所有模型里最好的,文字整体只错了一处:第一天「渔民佬鹈鹕海鲜餐厅」里的「鹕」字缺失了。与文字无关的问题也有一个:第一天渔女的形象不对,珠海渔女应该是双手捧着东西举起来的。 第二题是文生图综合能力测试——左撇子咖啡馆写信,问题就比较多了。第一,提示词要求左手拿笔、右手拿烟斗,它反过来了。第二,杯子里的清水应该满到快溢出来。第三,墙上时钟要求显示 3:45,时针和分针都没有指对地方。第四,提示词要求明信片上写着清晰可读的「亲爱的阿珍:见字如面」,但这张 2K 的图我放到最大都看不清写了什么,字数也明显不对。第五,提示词要求窗玻璃映出执笔的左手,但因为它左手拿了烟斗,这一条也算错。 第三题是同一角色多视角一致性测试,女孩四宫格不同角度图片。首先这...
Coucou!AI编程神器!桌面悬浮卡通助手!
这个 GitHub 上开源的小工具叫 Coucou,能把 Claude Code 和 Codex 这些 AI 编程 Agent 的一举一动搬进你 Mac 和 iPhone 的刘海和灵动岛,甚至可以在你离开电脑时通过手机一键审批各种授权。开源仅一周,GitHub 上已经攒了 3800 多颗星。 有了这个小工具之后,Claude Code 等每读一个文件、每改一行代码,刘海上都实时看得见:动了哪个文件、加了几行、删了几行都标着,点开就是完整的 diff。权限请求弹出来就是 Allow / Deny / Always 三个按钮,随手一点就完了,不用来回切终端。想知道是哪个会话在等你,一下就能跳到那个终端。 人走开也不耽误:Mac 一锁,它就跟到 iPhone 的锁屏和灵动岛上,权限在锁屏上就能点头;人在外面用语音就能把下一条指令发回 Mac。 它现在盯着 Claude Code、Cursor、Codex、Gemini CLI、Antigravity 这些 Agent;CI 跑没跑过、部署上没上线,刘海里瞄一眼就知道。 天天挂在 Codex 和 Claude C...
Ideogram 4.5 测评报告!是否真的能打?
应粉丝要求,这一集用祖传测试用例测评一下最新的 Ideogram 4.5 模型,直接在官网上测。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):几个问题。首先第一天的渔女形象就不符合真实情况,搞得像个自由女神一样——估计这个模型并不知道珠海渔女长什么样子;第二,每一天下面都是一大堆乱七八糟的文字,我数都数不过来。 Q2 文生图综合能力测试(左撇子咖啡馆写信):第一,提示词要求左手拿笔、右手拿烟斗,它反过来了,而且拿烟斗的方式很奇怪;第二,杯子里的清水应该是满到快溢出来的;第三,拿铁应该是半杯;第四,大家看一下墙上的时钟,要求时间是 3:45,时针和分针都没有指对地方;第五,提示词要求写的字「亲爱的阿珍:见字如面」清晰可见,但这张 2K 的图片我放到最大了,都看不清楚里面写了啥。 Q3 同一角色多视角一致性(女孩四宫格不同角度):首先这很明显不是四宫格布局;第二看站位,正面的有了、侧对着的有了,背对着的没有,3/4 视角的半身照也没有;第三,提示词要求左手抱着猫咪,这里没有一个是对的。 Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):问题有点多。第一,...
SenseNova U1 Pro 测评报告!结果有点意外!
这一集测评的是商汤最新的文生图模型 SenseNova U1 Pro,这次直接在官网上测。同时我们的祖传测试用例也做了一次升级,升级到 V1.1:原来的第二题推理题换成了「文生图综合能力测试」,第四题物理常识题则明确了自拍用的是后置摄像头。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):这个模型的生成时间明显比之前测试过的模型都慢,大概要 5–10 分钟。但效果是真的可以——整张图只有第一天「鹈鹕海鲜餐厅」的「鹈鹕」两个字,以及第五天「庞都」的「庞」字写错,这应该是所有测评过的模型中错得最少的一次。 Q2 文生图综合能力测试(左撇子咖啡馆写信):这一题有两个问题。第一,提示词要求左手拿笔、右手拿烟斗,它给反过来了;第二,明信片上写的文字是面向镜头的,而不是面向人物自己的。其他条件看了一下,应该都是满足的。 Q3 同一角色多视角一致性(女孩四宫格不同角度):四宫格的排列是对的,四张图的站位也是对的;唯一有问题的是左下角的第三张图,抱着猫咪的手变成右手了。 Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):这一题错得有点离谱。第一,镜子里面的女孩拿着手机,而镜子外面...









