大语言模型中的投机解码究竟是什么鬼?
今天有粉丝在 B 站私信问:大语言模型里的投机解码(Speculative Decoding)到底是怎么一回事?要把它讲清楚,得先从最基础的 Transformer 说起。 先看一个最简单的大语言模型——只有一层 Transformer、不涉及 MoE 的那种——是怎么工作的。我们输入一段提示词(prompt),第一步是 tokenization:tokenizer 把中文这类文字切成一个个 token。拿到 token 之后,还要去查 word embeddings 这张表,把每个 token 变成对应的向量。向量有了,就往下走 self attention 那一层,算出各个 token 与上下文之间的关系,接着过 FFN。顺带一提,现在常说的 MoE 其实就是在上层加一个路由、用专家池取代传统的 FFN,听不懂也不影响理解后面的内容。 FFN 出来之后还有一个 LM head。它本身很简单,就是一个线性变换:把主干 Transformer 最后输出的隐藏向量作为输入,做一次线性变换,再走一个 softmax 算出概率,判断词表里哪个 token 应该是下一个词。整条链路...
Qwen Image 2.1 Turbo 测评!真的能打吗?
本期测评新发布的 Qwen-Image-2.1-Turbo 图片生成模型,全程在官方千问 AI 平台上实测,并用我们最新的 Benchmark 六道题逐一打分。 第一题考验中文长文本排版,要求生成水彩风的珠海五天行程插画。结果第一天的渔女是测评过的众多模型里做得较好的一个,更让人惊喜的是「鹈鹕」两个字竟然写对了;不过仍有瑕疵——第三天「外伶仃」的「仃」字写错,第五天「推荐」的「推」字也崩了。 第二题是文生图综合能力测试,画面是左撇子咖啡馆里写信的场景。问题不少:提示词要求左手拿笔、右手拿烟斗,模型却反了过来;杯子里的清水本应满到快溢出,也没做到;墙上时钟要求指向 3:45,时针分针都没指对位置;要求清晰可见的「亲爱的阿珍,见字如面」旋转过来看后发现字不对、字数也不对;提示词还要求窗玻璃映出执笔的左手,最终同样没能实现。 第三题考同一角色多视角一致性,要求画出女孩四宫格不同角度的图片。首先布局就不是四宫格;提示词要左手单手抱猫,四个都没做对;粉色发夹应在右鬓却戴到了左边;猫咪眼睛本应左蓝右黄,图一、图三都不对;人物左眉的痣几乎看不到,图一放大后依稀可见反倒在右边;缺口门牙这一...
可灵图片3.0测评报告!结果惨不忍睹!免费没好货啊!
这一集用最新的 Benchmark 测评可灵免费用户当前能用的最高图片版本可灵3.0,看下和之前测过的各种文生图模型比起来表现如何。 第一题:中文长文本排版支持测试(水彩风珠海五天行程插画) 生成效果问题颇多。首先左边”珠海渔女”完全不是珠海渔女的形象,上次测的 Nano Banana 2.1 和 Flux 3 生成的渔女都比它好。其次文字布局混乱,有些在上方有些在下方,数字也杂乱无章让人摸不着头脑——渔女和日月贝下面各标了个”2”,长隆海洋王国下面也有个”2”,不知道想表达什么。第三错别字太多,多到懒得去数。国产模型生成中文水平如此,实在出人意料。 第二题:文生图综合能力测试(左撇子咖啡馆写信) 生成图完全不对。首先完全看不到男人,其次很难判断右上方那个男人是镜子内的像——提示词说的是窗外反射看到拿笔的左手,并没有要求有镜子。第三左手拿笔右手拿烟斗的肢体要求也完全反了。第四文字方向不对。第五文字内容应该是”亲爱的阿珍,见字如面”,实际完全不符。第六杯子里的水应该满到快溢出,实际不是。第七咖啡应该是半杯。第八要求有个空杯子没看到。第九墙上的挂钟明显不是三点四十五分。问题太多...
千问办公实战(32)!AI表格数据可视化神器!
老板给你一张销售明细Excel表,想要做成精美的数据看板,过去可能要花上几个小时,现在用千问办公的AI技能,10分钟就能搞定。 我们打开千问办公客户端,点击左侧菜单栏的「技能」,找到官方内置的「AI表格数据可视化」Skill,一键安装。随后开启新的任务会话,用斜杠命令唤起这个Skill,直接上传你的Excel文档。接下来只需要告诉AI你想要做成什么样的数据看板,比如「做成钉钉数据看板」,AI就会自动在钉钉文档上为你创建好数据,并生成一张漂亮的可视化图表。 整个过程全程不需要10分钟,从数据上传到看板生成全部自动化。对于需要经常做销售数据汇报的运营、市场、财务人员来说,这个Skill大幅提升了数据呈现的效率,让汇报者能把更多精力放在分析结论而非制图操作上。 访问入口
ARTEX!AI 自主渗透开源神器!Agent 攻防赛冠军!
开源才两天,就传出黑客拿它真打银?这个名叫 ARTEX 的冠军级 AI 渗透系统,让一群 Agent 自己收资、拆任务、跑工具、找漏洞、写报告,连”修没修好”都有复测 Agent 自动回填。配个 Key、配个域名,红队活儿几乎全自动,界面上 Planner 怎么想、Worker 怎么打,全过程留痕。Docker 一键起,2000+ Star 只是个开始。 ARTEX 由 Autumn-27 团队开发,核心创新是双图架构:资产图统一管理域名、子域名、IP、端口、服务、端点等资产数据,探索图跟踪攻击目标、意图、事实和发现成果。Planner 负责生成攻击意图和任务分解,Worker 执行具体任务并调用真实安全工具(nmap、nuclei、curl、bash 等)。 系统内置人机审批工作流,高风险操作需人工确认,全程记录流量并支持审计与干预。所有发现、资产和攻击路径持久化到 PostgreSQL,解决了大语言模型常见的上下文溢出问题。支持 Docker 一键部署,默认运行在 8787 端口。需要注意的是,该工具仅限本地隔离环境使用,严禁直接对线上系统发起未经授权的扫描。 访问入...
ArtCraft!开源免费版Adobe全家桶!由Claude像素级复刻!
Adobe 全家桶一年收费 6,000 块,这让无数设计师望而却步。如今一个团队另辟蹊径:他们用 Claude Opus 5.5 配合 Rust 语言,从零将 Adobe 全家桶免费开源重写了一遍,还把快捷键都一并抄好——Photocraft 对标 Photoshop、Vectorcraft 对标 Illustrator,其余工具也一一对应。发布仅数小时便冲上 2 万颗星,目前快接近 3 万。 最令人震惊的是开发者的声明:他没碰 Adobe 一行代码,没有逆向工程,没有扒取源码,完全是让 AI 照着功能和界面从零写出,愣是实现了像素级复刻。Photocraft 能直接读写 PSD 文件,图层蒙版一样不少,快捷键与 PS 保持一致,老用户打开就能直接干活。 其余六个工具也全部排上日程:Filmcraft 负责剪辑、Vectorcraft 绘制矢量、Lightcraft 修图、Effectcraft 做动效、Pdfcraft 管理 PDF、D esigncraft 排版。此外还有一个隐藏彩蛋——因为软件本来就是 AI 写的,每个仓库都配备了 CLI 和一本 agents.md ...
Workbuddy 实战(38)!右键AI编辑文件!最新独立文件浏览器!
Workbuddy 这次把文件编辑器做成了独立入口——以后让 AI 改文件,不用再上传了。 用法很简单:在文件上点右键,选 Workbuddy 打开就行。窗口分成左右两半,左边是文件本身,右边是 AI。Word、Excel、PPT、PDF、Markdown、图片都能开,不用上传,也不用从头交代背景。一份 30 页的合同要挑重点、一份乱糟糟的 Excel 要理干净,或者一份英文报告想边看边翻,直接在旁边问它就完了。 比较让人放心的是它的改动方式:动你的文件之前,它会先用黄色标出来打算改哪里,你点头了才写回原文件,不满意就打回重来。你甚至能和它在同一个窗口里各改各的,互不打架。 有个细节挺良心:光打开看文件、自己手动改,这些都不扣积分,真叫 AI 干活了才按任务收费。官方也说明它只碰你主动打开的文件,不会翻你整个硬盘。 经常跟文档表格泡在一起的打工人,可以先挑那份拖了一周没整理的文件,右键打开,看它几分钟能给你收拾成什么样。 访问入口
AI智能体发展简史!Muse究竟是个什么鬼?
personal agent 最近火得不行。先是马斯克的 Grok bot 出来,当时没掀起多大动静;紧接着 Meta 的 Muse 一炮而红;随后离开 Meta 的 Manus 推出了 cue,OpenAI 也端出了据说是基于 OpenClaw 搞的 dots——海外这片战场算是遍地开火。反观国内却安静得多,大概是国庆大家都忙着放假玩去了。 那这个 personal agent 又是怎么回事?和我们常用的 OpenClaw、千问办公(QwenWork)、WorkBuddy 这些有什么区别?要说清楚这个,估计得先扒一扒 agent 的进化史。 从对话框到工具调用:agent 的三级跳最早出场的当然是大语言模型。GPT-3.5 在 2023 年出来一炮而红,之后很长一段时间里,我们对它的用法就是对着对话框提问、等它吐答案。用得多了就发现问题:问稍微新一点的事情,模型老是出现幻觉。可 OpenAI 也没法一天发一个新模型,把当天的新知识都喂进去,于是考虑了下,实现了一个叫 function calling 的东西,让大语言模型可以调用外部工具去搜索。 后来从 OpenAI 出走...
GPT-6-Luna-Decisions!OpenAI版Jev决策模型!
OpenAI 也下场做决策模型了。Decisions API 这两天开公测,价格倒是 Jev 的两倍多。 三个问法几乎是照着 Jev 搬过来的。Jev 那边叫 noul、choice、score,OpenAI 这边叫 predicate、choice、score —— 换了个名字接着用。你把要判断的东西喂进去,文字、JSON 都行;OpenAI 这边多吃一样:图片。 出来直接就是数。是还是不是,给你一个 0 到 1 的概率;几个候选你选哪个,把每个的概率列出来;按档位打分,还给个加权分 —— 三档 0、1、2,它返你一个 1.1,意思是卡在两档中间。 答案旁边带着信心值。比如丢一张商品照片问有没有磕碰,它返 0.816,你就可以定条线:超过 0.8 转人工。一次请求最多塞 200 个问题。 官方说它比同一个模型走普通的 Responses API 快 10 倍。价钱摊开看:Jev 100 万输入 token 收 0.042 美元,它收 0.1 美元;但 Jev 只认文字,图片接不了。另外现在能跑的模型也只有 GPT-6 Luna 一个,还是公开测试版,输出那个数不单独收费。...
千问办公入门(31)!如何做一份专业的竞品分析?
这一集教程,我们学习在千问办公中怎么做竞品分析。开始之前,先看一份 DeepSeek 做的竞品分析——以千问办公和 Workbuddy 为例。它输出的是一个看着像模像样的对比页面:两款产品各一句话定位,加一张覆盖厂商定位、功能、商业模式等十几个维度的对比表,再有相同点、关键差异和选型建议。结构是完整的,但通篇没有任何数据来源,内容全靠模型记忆泛泛而谈,还把基本事实搞错了——它把 Workbuddy 说成京东系产品,而它其实是腾讯家的。看着热闹,经不起推敲。 再看千问办公用同样提示词做的这份:开头就标注了 6 大维度、10 张对比表、12 项数据来源、数据截止日期。它是真联网调研过的,信息来自两家官网、掘金和 CSDN 的第三方横评、用户长测等,每个板块都挂着出处。内容也全是硬货——定价精确到每一档,口碑做成了结论和好评差评对照表,功能矩阵 20 多项逐项标注支持情况,还给两家各做了一套 SWOT,最后落到按优先级排序的差异化机会点。 一句话总结:DeepSeek 教的是一篇作文,千问办公教的是一份能直接拿去开会用的报告。 那千问办公是怎么做到的呢?很简单,靠 Skill。我...









