security-audit-skill:Cloudflare下场造Skill!补全分为编程最后安全这一环!
只要是网民,Cloudflare 的安全验证你肯定见过——它可以说是全球网络安全领域的扛把子了。而 Cloudflare 前两天在 GitHub 上开源了一个叫 security audit skill 的技能,只要你对项目代码有安全需求,都建议看一看。目前它在 GitHub 上已经 12K 颗星了。 它干的事说白了就一件:给你的 Claude Code 这类 AI 编程助手加上代码安全审计的能力。 用法也很简单,一行命令装上,然后跟 agent 说一句”帮我审一遍这个项目”,它就会分 6 个阶段干活——先摸清架构、画出攻击面,再派一堆相互隔离的 agent 分头找漏洞。比如接口有没有越权、依赖包有没有被投毒、AI 功能会不会被提示注入骗走数据,它都挨个排查。 值得注意的是,找漏洞的和验证漏洞的不是同一个 AI。每个疑点都会丢给一个全新的 agent 去反驳,驳不倒的才算实锤。挖出来的漏洞会直接标好哪个文件、哪一行,开发拿到就能改。 它管的也宽:第三方库有没有被人动过手脚、服务器配置有没有留后门、网页代码会不会被塞恶意脚本,十来个大类都替你盯着。官方测过一遍,就能抓到差不多...
BrowserSkill!AI接管已登录浏览器!腾讯最新开源神器!
现在只需要对 DeepSeek Harness 说一句”帮我看下B站流量情况”,它就直接进入你已经登录好的B站后台干活——不用另开浏览器让你重新登录。这就是腾讯开源的 BrowserSkill,GitHub 上已经四千多颗星。 安装只需三步:一行命令装好叫 BSK 的 CLI,给浏览器加个扩展,再跑一下 BSK doctor 确认连上。之后后台的订单数据、竞品挂的价格、邮箱里等着回的邮件,都能在你的登录态里直接搞定。 它不霸占你的浏览器。任务跑在一个独立可见的 Agent 窗口里,你自己的窗口照常干活。真要动你开着的标签页,得先申请借用,用完还得还回来。碰到验证码、扫码登录确认弹窗这种机器搞不定的坎,它会停下来喊你接手,你点完它接着往下跑。 它不挑 Agent,Cursor、Claude Code、Codex、DeepSeek Harness 这些能在 Shell 里跑命令的都接得进来。Chrome 和 Edge 装个扩展就行。天天让 AI 帮忙点网页的兄弟可以先装上,挑一个只有登录才看得到的页面让它读一遍试试。 访问入口
GLM 5.3 FlashX测评报告!究竟有多能打?
智谱最新发布的 GLM 5.3 FlashX 测评报告来了,还是在 PI 中接入、思考深度放大最高。来看看这个高速版本实际表现如何。 第一题:强约束指令遵循——句子生成测试。 生成速度相当快,有点 DeepSeek V4 Flash 的味道,起码比 GLM 5.3 Flash 快多了。仔细检查生成的句子,第四、六、七、八、十句为了凑成数字结尾都硬生生去掉了单位,读起来不太通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 效果不错,虽然这几期提示词难度调低了,但 GLM 5.3 FlashX 依然是第一个实现得比较完整的模型,值得肯定。 第三题:复合弓射箭 SVG 测试。 如果不吹毛求疵的话,还算是可以的了。非要挑毛病的话也有不少:箭是被弓箭手推出去的而不是射出去的,弓弦应该在复合弓左边,但弓箭手却用右手拉弓,存在方向矛盾。 第四题:精美浏览器操作系统。 UI 看上去不错,右上角弹窗、dock 栏应用功能都没有问题,太空射击游戏则是这题的压轴大戏——可惜效果不大行,飞机和子弹离得太远,不移动的话根本看不出子弹是从自己飞机发射出去的,子弹大、飞机小,如果游戏能实现得更好这题应...
Qwen 3.8 Omni Flash 全模态测评!究竟有多能打?
Qwen 3.8 Omni Flash 全模态模型来袭,我们的测评报告当然不能落下。因为是全模态模型,所以先测多模态能力,然后再看大家要求要不要测推理和编程。由于在线上测试,不知道免费额度能测多少,本次测试按最关心的顺序来。 第一题:HTML 游戏复刻。 给它一个简单的左右移动接住星星的小游戏视频,让它通过 HTML 复刻这个游戏。实现完成后打开看,实际效果像模像样,但有个问题:只能通过鼠标控制,键盘上下左右无法操控——而这个游戏明显应该支持键盘控制。 第二题:鸳鸯图片辨别。 给它一张鸳鸯图片,让它分辨雄鸳鸯和雌鸳鸯的数量。图片中应该有五只雄鸳鸯、四只雌鸳鸯,最左边是一只野鸭。模型回答四雄五雌,刚好说反了。 第三题:图像细节辨析。 让模型找出图片中的不同之处,它指出第一行第四列的菱形不端正、有所倾斜。实际检查后确认确实如此,判断正确。 第四题:电影出处匹配(老无所依)。 给一张老无所依电影截图,看模型是否能找出出自哪部电影。第一次给了截取较远的图,模型回答星际穿越,错了。这道题很少有模型能做对——不是辨别不了图片内容,而是在根据内容匹配电影时出错。换成更清晰的截图后,这次成...
Union Alpha 神秘模型测评报告,真的能打吗?
OpenRouter上突然出现的神秘模型Union Alpha,开发者信息仅标注为”Stealth”,没有任何实验室背书,上线首日就消耗了20亿Token,目前预览期完全免费。赶紧来测一测它到底能不能打。 测试说明:本次测试保留了三道SVG题目(鹈鹕骑车等),难度略有降低;由于模型目前免费且限速,测评过程中会出现限速报错,属正常现象。 第一题:强约束指令遵循测试。 句子生成测试要求每句话结尾都是1到10的数字。实测发现第七句不符合结尾要求,第八句严格来说也不够通顺。 第二题:鹈鹕土星环骑自行车SVG测试。 相比之前的测试难度有所调整。总体效果不错,尤其是左边转弯做对了。细节上还有两个问题:自行车骑到右边时还是倒过来了,以及骑到顶部时不是在土星环上面骑而是骑到了土星顶部去了,空间感稍差。但这是第一个做对一半转弯的模型,还是值得肯定的。 第三题:复合弓射箭SVG测试。 复合弓做得比较简陋,弓箭箭头是反的、第二根弦没看到、拉弦方向也有问题,轮子缺少拉距调节模块和瞄准镜等细节。整体比较水。 第四题:实现精美浏览器操作系统。 UI比较清新,弹窗没问题,Dock栏应用功能正常。压轴的太...
一只鹈鹕难倒海内外一众顶尖大语言模型!
想将一张视频封面图片里”小鸟”的文字改成”鹈鹕”,竟然发现难倒了海内外一众号称最能打的模型,最终只有最后一个做到。 首先看一下字节豆包的效果——风马牛不相及。Kimi 则是把可怜的免费积分用完了都没弄完,还自己写代码去做,最后恬不知耻地告诉用户”代码写好了直接跑,你这些都是虚拟机上的路径和环境,我跑个毛线啊”。百度的文心一言做出来的也不知道是什么鬼,不忍直视。腾讯混元选了 HY4 Preview,也是接近但不行。 国内的全军覆没,那看一下海外最强的两家。谷歌的 Nano Banana Pro 有点意外,前面的题字对了,但第二个字错了,如果偏旁也做成古字就成功了。OpenAI 最新的 GPT Image 2.5 其实成功生成了”鹈鹕”两个字,只是没有调整原来文字的位置和大小,导致挤压在一起了。迄今为止生成中文最接近的竟然是个海外模型,心里五味杂陈。 最后看下千问的——竟然成功了,简直不敢相信自己的眼睛。以防万一再试一次,卧槽还是成功了,国内模型扳回一局。 整个测试下来发现,中文文字结构稍微复杂点,大部分大模型都处理不好,但大家都在高大上地吹 AI 要取代人类了。要不先做好”鹈...
豆包2.1 Pro测评报告!真的能打吗?
豆包刚出的 doubao-seed-2.1-pro 测评报告来了。这次测评依然在 Pi 上接入来做,上下文、Max tokens 和思考模式全都开到最大。 第一题是强约束指令遵循句子生成测试。句子确实都从 1 到 10 结尾,乍看没什么问题——但不仔细看差点被它糊弄过去:只看尾部几个字的话所有句子都挺顺,可读完整句就会发现,第 5、7、9 句都是不通顺的,挺狡猾。 第二题鹈鹕土星环骑自行车 SVG 测试,前几天测了好几个国内顶尖大模型都做不好,结果豆包更离谱——鹈鹕和自行车直接不见了。 第三题复合弓射箭 SVG 测试,真抠细节的话问题不少:头断了,轮子也不是复合弓的轮子,反而像个闹钟。不过毕竟是 SVG,可能不用太强求。这里比较严重的问题是弓弦只有一根,而复合弓和一般弓箭不同,不会只有一根弦。 第四题浏览器内操作系统,UI 看上去还可以,但右上角的弹窗点下去却跑到左上角去了;Dock 栏的计算器不工作,点几次等于号都没算出结果;压轴的太空射击游戏其他都还好,就是没法移动——按下左右键一放手,飞机立刻回弹到原来的位置,根本没法好好控制。 第五题 3D 赛车游戏,画面太模糊,根...
千问办公实战(26),一键生成专业图表!数据可视化神器!
做数据展示时,手动绘制专业图表费时费力。千问办公内置的 EChart 技能,可以让你用自然语言一句话生成折线图、饼图、柱状图等多种专业图表。 操作方法很简单:点击左侧技能菜单,找到 EChart 技能并安装。EChart 是前端开发者熟悉的专业图表库,千问办公的这项 skill 背后调用的正是该库的能力。安装完成后,新建任务,通过斜杠命令唤起技能,直接输入提示词描述你想要的图表即可。 以折线图为例,只需告诉它你要展示的数据维度和标题,几秒钟内就能生成一张带样式主题的专业图表。适合需要经常做数据汇报、做 PPT 写文档的朋友收藏使用。 访问入口
AI智能体开发(第一集)!初识LangChain!
大语言模型能输出文本,但本身无法调用命令行或外部工具。要让模型按需求执行实际操作,需要在语言模型基础上加一层 Harness——结合模型的推理能力与工具调用能力,这就是我们常说的 Agent。 做 Agent 开发可以从零调用 LLM API 写起,但这就跟不用任何 Web 框架、从纯 HTML/JS 写 Web 应用一样:能做,只是麻烦。LangChain 就是 Agent 开发领域的”Vue / React”——一个成熟、易用的第三方框架,能让开发效率大幅提升。本系列所有示例均使用 Node.js,适合有编码经验的朋友直接上手。 本集从 LangChain 版 Hello World 入手。代码逻辑很简单:向大语言模型提问”1+2等于几”,把返回结果打印出来。 运行前需在项目根目录放置 .env 文件,配置大语言模型的访问入口和 API Key。当前使用 DeepSeek,提供 OpenAI 风格和 Anthropic 风格两种接入方式——这是目前行业两家主流标准,所以其他模型基本都会兼容这两种格式,方便用户迁移。 LangChain 通过 Chat...
Ghidra,可执行程序秒变源码!开源免费逆向神器!
你信不信,世界上最强的逆向工程工具之一,是白送的。它叫 Ghidra,美国安全局 NSA 出品,原本是他们内部分析恶意软件、挖漏洞的主力工具,后来整个往 GitHub 上一扔,安全圈直接炸了——现在已经 7 万多颗星。 用法一句话就能说完:丢一个二进制文件给它。比如一个疑似病毒的可执行程序,直接丢进去,它会自动反汇编加反编译,把机器码一行行变成能读懂的 C 代码。里面有哪些函数、调用了谁、偷偷往哪些进程里注入、启动的时候干了什么,调用关系图全给你画出来;哪里可疑,点过去就能看那段代码。 没有源码的程序、设备固件,它都是这么处理的,几百种处理器架构和文件格式通吃,Windows、Mac、Linux 随便跑。 玩恶意软件分析、漏洞研究、固件逆向的兄弟,建议先装到机器上,丢个平时看不透的小程序进去,看看它里面究竟在搞什么鬼。 访问入口









