Sirchmunk!传统RAG已死!免向量自进化知识库!
做过 RAG 的人都懂那套流程有多累:PDF、Word、Excel 先解析,再切片、算 embedding,然后灌进向量库。索引建完半小时过去了,文件一改还得重跑。更麻烦的是,检索捞出来的经常是碎片——答不上来的时候,你都不知道到底是模型笨,还是上下文早被切没了。 Sirchmunk 干脆把这层直接撤了。它的判断是:切片等于把文章拦腰砍断,向量化等于把内容压成一串数字,而压缩就有损失;大模型本来就能读原文,何必先去看残骸?于是它靠关键词和文件路径一层层把范围收窄,先锁定是哪一段,再去读那一段。装完 pip、指向你的目录就能开口提问——比如「这鉴权在哪实现的」「去年那份合同付款条件怎么写的」。 配一个 OpenAI 兼容的接口即可使用。Deep 模式十几二十秒就能交出带原文出处的报告,Fast 模式两三秒就出结果。搜完的结果不会丢,会沉淀成一层层的知识树;同样的问题再问一遍,直接命中缓存,省下 Token。数据全程留在自己机器上,模型也可以换成本地的,Docker 四核 2G 就能跑,Apache 2.0 协议可商用。 做 AI 知识库和 RAG 的兄弟可以去试试,建议先拿你...
Arnis!用你家乡的地图玩《我的世界》!
你现在可以用家乡,或者说任何城市的地图来玩《我的世界》了。这个叫 Arnis 的开源项目,在 GitHub 上已经攒了 17,000 多颗星。 用法很直接:打开软件,在地图上框一块地,选好存档点,真实世界的山脉、河流、马路就按真地形搬进游戏了,连你家那栋楼也会一起出现,房屋内饰都能一并生成。 缩放比例自己调。你可以把老家县城做出来逛一圈,还原自己读过的学校,或者干脆让整座城市变成朋友联机的地图。 数据取自 OpenStreetMap 的路网,加上实测高程,所以地形起伏不是瞎编的。Windows、Mac、Linux 三个平台都能跑。 建议先拿家乡生成一遍——看着你走过十几年的那条街,一格一格出现在方块世界里。 访问入口
千问办公入门(25)!免API Key生成图片!
第 25 期《千问办公入门》继续聊技能(skill)的用法,这期要解决的是一个很实际的需求——在千问办公里直接生成图片,既不用跳出千问办公,也不用填写任何 API Key。 打开千问办公后进入技能列表,找到「图像创作」这个 skill。它是千问办公官方自己做的,所以我们不需要接入任何 key,装上就能用——对不想折腾 API Key 的用户来说,这是最省事的一条路径,站内就把生图这件事闭环了。 安装完成后,新建一个任务,用斜杠命令唤起这个 skill,接着就可以直接输入提示词让它生成图片了。比如让它生成一张「上海城市微缩图」,几步操作就走完了整个流程。 从实际体验看,生成速度相当快,出图质量也不错。对于一般的个人使用和日常办公需求来说,这个 skill 已经够用了;如果你的生图需求不算重度,就没必要再去单独接一套第三方生图服务。下集见…… 访问入口
Vocalremover!一键分离音乐人声和伴奏!自媒体神器!
今天要分享的是一款 vocal remover AI 工具,它可以把音乐分离成人声和伴奏两条音轨。 先听一下原始的音乐,再来听分离之后的人声——是不是很清晰?接着单独听伴奏,可以看到人声和伴奏已经完全分离开来了。 使用方式也非常简单,直接把音频上传上去,一键就搞定了。 这个工具最大的优势就是免费。市面上不少收费的 AI 工具同样能做到人声分离,但你得先打开那些工具、还得付费,一圈折腾下来并不轻松。所以这个免费方案就显得格外难能可贵。如果大家还是找不到入口,可以在评论区跟我说一声。 访问入口
Kimi K2.8 测评报告!真的能打吗?
Kimi K2.8 Preview 的测评报告终于来了。这次测试用的 key 由 B站网友「非著名思想公智」提供,评测依然放在 PI 平台上进行,尽量把 Harness 的影响降到最低,思考模式同样拉到最高。 不过在开始之前有个问题想先问大家:既然 Kimi K3 都已经出来了,为什么现在才推出 K2.8 Preview?知道的朋友可以在评论区聊聊。 推理能力测试 第一题是强约束指令遵循的句子生成,要求所有句子分别以「一到十」结尾。这一题有点大跌眼镜——十句里明显只有第一句和第四句符合结尾要求,通读下来这两句是通顺的。 第二题是新版 24 点,需要给出三个解。结果非常棒,三个解都完全符合提示词要求。 第三题是难度更高的新版密码锁推理,答案是 7294364,判断正确。 编程能力测试 第四题要求实现一个精美的浏览器操作系统。第一版点上去没有反应,毕竟花了几十分钟开发,直接判失败有点可惜,于是让它返修了一次,之后就能正常使用了。右上角的弹窗表现还算可以,Dock 栏里的应用功能也没什么问题,但压轴的太空射击游戏直接报错,这一项不行。 第五题是 3D 赛车游戏。车道方向就不对,游...
小米 MiMo X Pro 测评报告!真的能打吗?
小米 MiMo X Pro Preview 测评报告来了!作者申请内测权限等了两天没拿到,多亏群里周黑鸭哥哥帮忙跑完全套祖传测试用例还提供录屏,非常感谢。 第一题:约束指令句子生成 所有句子都按要求以 1 到 10 结尾,通读后发现 4、7、8、9 几句读起来不通顺,第 6 句表达也比较别扭,日常很少会这么描述。 第二题:新版 24 点要求三组独立解法 三组答案全部违规,都重复使用了题目限定数字,不符合规则。 第三题:七位数密码锁推理 顺利输出正确答案。 接着开始代码项目测评,浏览器操作系统系统弹窗正常,UI 中规中矩,Dock 栏应用运行没问题,但是太空射击游戏无法发射子弹,按键和鼠标点击都没有响应。3D 赛车游戏打开之后完全没有交互,看着就像一张静态图,直接测试失败。Trello 看板 UI 风格比较普通,卡片无法编辑标题,列表不能拖动,删除按钮显示禁用状态却可以点击删卡,存在明显异常,仅列表删除功能正常。 整套测试结束,周黑鸭同学反馈本次测评消耗掉 1% 的内测周额度,测评结果留给大家自己评判,欢迎在评论区聊聊你的看法…… 访问入口
Deepseek V4.1 Flash正式版测评!究竟有多能打?
Deepseek V4.1 Flash 正式版实测来了!模型刚上线就惦记着测试,抽时间在 pi 平台开启测评,尽量降低 harness 带来的干扰,思考模式直接拉满开始测试。 推理能力测试 第一题 · 强约束指令句子生成:要求全部句子以「一到十」结尾,通读全部语句都通顺达标。 第二题 · 新版 24 点:要求给出三组解法,结果三组答案全都违规——数字重复使用,不符合「每个数字只能用一次」的硬性规则。 第三题 · 七位数密码锁推理:高难度推理题顺利算出正确答案。 编程项目测评 浏览器操作系统:桌面带有动态动画效果,还有精致小组件,弹窗、Dock 应用运行正常,可惜压轴太空射击游戏无法交互,差了最后一步。 3D 赛车游戏:让人眼前一亮,是这么多轮测评里完成度顶尖的作品,画面精致,车辆模型完整,整体效果非常惊艳。 Trello 看板:采用深色 UI,审美因人而异,卡片拖拽动画效果一般,其余基础功能都正常可用。 整套测试下来,24 点推理题和太空射击项目留下遗憾,但 3D 赛车的代码实现确实足够亮眼。大家怎么看待 Deepseek V4.1 Flash 正式版的这套实测表现...
讯飞星火 X2.5 API测评报告!究竟有多能打?
想知道讯飞星火 X2.5 真实实力?接入 API 放到 pi 平台跑全套祖传测试用例!第一题强约束指令遵循句子生成测试,5、7、8 句不通顺,第十句口语化。第二题24点截断只算出一组解法。第三题高难度七位数密码锁推理顺利答对,推理能力让人意外。编程题:浏览器 OS UI 观感不错,右上角弹窗效果在线,Dock 正常,附带太空射击游戏可玩但偏难;3D 赛车正常但车速偏快;Trello 看板卡片拖动正常,列表拖动失效,输入标题有显示 bug。整体表现不错,全国产算力训练是亮点,适合对数据安全敏感的团队,大家怎么看这次实测结果呢…… 访问入口
Mercury 2.5测评报告!自回归大语言模型杀手?
扩散大语言模型这条路走得通吗?称生成速度上千 token 每秒的扩散大模型 Mercury 2.5 实测来了!粉丝点名让我测试这款刚在 OpenRouter 上线的 Diffusion LLM,这类模型和普通自回归模型不一样,不会逐个输出 token,而是一次性批量吐出多个 token,理论上速度直接拉满。 我在今年 3 月就测过旧版本,当时表现很差,期待新版本能有所改善。本次通过 OpenRouter 在 pi 环境接入,思考模式开到最高,逐项实测: 第一题·强约束指令生成:生成速度肉眼飞快,不用快进,但全部句子语句不通顺,直接翻车; 第二题·新版 24 点:要求三组解法,模型直接表示无法求解,要求去掉数字 2 才能作答; 第三题·七位数密码锁推理:给出的答案完全错误,三道推理题全军覆没。 接着测试编程任务: 浏览器操作系统缺少弹窗,仅计算器勉强可用; 太空射击游戏完全失效; 3D 赛车 UI 简陋,越过第一个障碍物之后不再刷新障碍; Trello 看板初始化界面异常,创建列表后无法新建卡片和拖拽。 整套测评下来,这款扩散大模型空有极速生成的噱头,推理和代码落地能...
GPT-Image 2.5最新测评报告!究竟有多能打?
GPT Image 2.5 全量开放,免费账号也能直接用!今天拿祖传图片测评用例实测,左侧图片菜单旁出现新标识,点开 template 模板看到对应 logo 就代表是最新版本。 第一道压轴题上传多人图片,要求互换左右两个人物位置,画面看似完成交换,但出现明显 bug——人物交换后还残存了多余的手部图像。 第二道测试中文能力,生成水彩风格珍珠海 5 天行程插画,整体画面尚可,但图内出现错字,更换提示词生成桂林手绘三日行程图,模型能自主推理规划行程,可文字错误字更多,能看出中文文字渲染依赖旧短短板明显。 第三题生成 3D Q 版两层咖啡杯造型星巴克建筑,画面效果惊艳,提示词遵循到位。 第四题上蚂蚁巢穴城市天气卡,构图观感很好,耗尽只能终止测评。这套实测能看出它图像生成有亮点,但中文文字渲染、图像物体编辑仍存缺陷,你觉得 GPT Image 2.5 表现如何,有优质测评用例欢迎分享,后续我加到祖传测评集里…… 访问入口









