Octop!开源workbuddy平替!适合公司私有部署!
这不就是可私有部署的 Workbuddy 开源版本吗?这个叫 Octop 的开源项目,能把一台闲置服务器变成小团队共用的私人 AI 助手团队,在 GitHub 上已经拿下 6000 多颗星了。 装起来也简单,只要一行命令,然后 octop init 初始化、octop run 跑起来,就能在网页上跟 AI 专家聊天。写周报、整理会议纪要、管日程这些事,直接甩给它就行。团队里每人各有各的账号和专属智能体,互不打扰。 它还内置了专家库和专家市场,调好的专家能直接分享给同事用,不用每个人从零折腾一遍。每个智能体的性格和说话风格也能自己调,想要个毒舌的还是严谨的,全看口味。接入的聊天软件也多,飞书、钉钉、企业微信都行,平时在哪个软件里办公就能在哪实操。 它还支持用大白话设定定时任务,到点自动干活;遇到复杂任务,还能派出一个调度员,带着多个专家分工干活。模型方面,OpenAI 兼容接口、通义千问、Ollama 本地模型都能接。 所有对话和数据都留在自己服务器上,代码采用 MIT 协议、允许商用。想给小公司小团队搞个私有 AI 助手的朋友可以试试——先装到一台闲置机器上跑一周,看看它能...
Openmuse!Muse开源平替来了!
小扎的 Muse 相信大家都知道,但能用上的没有几个——Meta 到现在都没全面开放,普通人想排队都找不着入口。不过用不上也别急着删,开源这边已经有人把同类的东西做出来了,叫 OpenMuse。 思路跟 Muse 是一个方向:说一句话想要什么结果,它就自己开浏览器查资料、在 Linux 容器里跑命令处理文件,干完把成果交回来。目前在 GitHub 上攒了 3400 多颗星,克隆下来装好依赖、配上自己的 key 就能跑。支持的模型不是只有 Kimi、智谱随便挑——比如让它盯着某个网页有没有更新,把邮箱里的报名表 PDF 填好再起草回复,或者把一整年的消费表格导进去生成分类账单,都可以直接丢给它。 比较戳我的是它的活是持久化的。任务跑一半断了能靠数据库恢复,还能暂停、取消、重试。有怀疑就点 Take Control,钻进它那个浏览器会话里亲手检查。它还能接 Gmail 和日历,每次读写都要你审一遍才执行。整个项目可以本地自托管,也支持一键部署到 Render。 目前还是 Alpha 阶段。想做个人 AI 助理产品,或者想给自己的应用加一层代理执行能力的兄弟,建议先克隆跑起来,挑...
Qwen 4(疑似)测评报告!究竟有多能打?
注意 Qwen 4 后面要括弧加个”疑似”——真实代号是 Qwen latest series Invite 2,609。测评环境是在 Deepseek Harness 上进行的,具体思考深度未知,稍后获悉会在评论区补充。 第一题:强约束指令遵循句子生成测试。 第 5 和第 8 句结尾不是从 1 到 10 结尾的。其他句子中第 3 句不通顺,第 6 句也不太通顺(如果改成”掷出的点数正好是 6”会更通顺)。 第二题:鹈鹕土星环骑自行车 SVG 测试。 整体感觉不错。右边转弯时仔细看会发现鹈鹕的屁股先转,然后才 180 度转正,稍微有点瑕疵。 第三题:复合弓射箭 SVG 测试。 整体效果不错,复合弓结构和弓箭抛物线都没有问题。唯一的问题是人物右手拿弓、左手拉弓,但弓箭却在右手外侧,特别是拉到身体部位时左手被挡住,弓箭感觉是被无形的手在拽着,不合常理。 第四题:实现个精美浏览器操作系统。 UI 看上去还是不错的。右上角弹窗功能没有问题。日历高亮日期部分不应做成椭圆形,而应做成圆形或带圆角的方形。Dock 栏应用没有问题。 第五题:3D 太空射击游戏。 初始速度太猛,开车水平不行...
GPT 6.1 Sol 测评报告!究竟有多能打?
GPT 6.1 Sol 测评报告来了。这期本来打算在 B 站做直播,但第一次直播不太熟悉,效果也不太好,测评过程没有录制完整,所以这次视频的做法和以往不同——测试过程大家看不到了,只演示最后的结果。测试用例一共 6 题,都放在视频里,大家需要的话可以自己对照着看。最后也会给大家看一下这次测试一共花了多少钱。 第一题是强约束指令遵循句子生成测试,要求每句话的结尾分别从 1 到 10 收尾。我把所有句子都看完了,都是顺畅的,这一题做得很好。 第二题是鹈鹕土星环骑自行车的 SVG 测试。整体看效果还是非常不错的,只有在向左转弯的时候,头部 360 度旋转有点恐怖。 第三题是复合弓射箭 SVG 测试。复合弓做得不错,箭的抛物线也没有问题。唯一的毛病是:一开始明明是右手握弓,然后左手穿插过来、右边拉弓,一下子左手就穿过了脖子,看上去像左右手互换了一样,很诡异。 第四题是实现一个精美的浏览器操作系统。整个 UI 看上去不错,唯一的问题是中文提示词它却默认给英文效果。看下右上角的弹窗,其他没有问题;唯一就是日历的高亮部分不应该用椭圆形,用圆形或者带弧度的方形就好。再看 Dock 栏应用,...
Claude Opus 5.5 生成视频怎么玩?精美提示词大全!
前两天我们做了 Claude Opus 5.5 的测评,当时主要测的是推理和编程能力,结论是确实能打。不过我在海外逛了一圈之后发现,大家用它用得最多的其实是拿它来生成视频——你现在看到的这些视频,都是它做出来的。不得不说,这玩意做视频的能力确实太强大了。 这里要说清楚一点:Opus 5.5 并不是直接生成视频画面,而是把动画写成代码——HTML、Canvas、SVG、Three.js 这些——再渲染成画面。所以仓库里的分类也集中在动态图形、解析说明、3D 场景和游戏互动这几个方向。 当然,就像我以前说过的,每一个牛逼的东西出来,GitHub 上总会冒出一个 awesome 开头的项目,这次也不例外。这个叫 Awesome Opus 5.5 Videos 的项目,目前已经收集了 389 条用 Opus 生成视频的提示词,README 里精选了 100 条,每条对应一个不同的提示词,并且每个条目都附上了创作者的原帖链接。 更棒的是,它已经帮我们做好了分类:动态图形设计(Motion graphics)58 条、解析说明(Explainers)16 条、3D 场景(3D scen...
Claude Sonnet 5.5 有多能打?价值50大洋的测评报告!
最新 Claude Sonnet 5.5 测评报告来了。统一在 PI 平台上测试,模型通过 OpenRouter 接入,思考模式开到最大。说实在的,测的时候确实开心,一看账单就心凉了——文末给大家看具体花了多少钱。 第一题:强约束指令遵循句子生成测试。 要求生成十个句子,每个句子分别以数字 1 到 10 结尾。检查结果发现,每个句子确实都以目标数字结尾了,但质量参差不齐:第二句和第七句明显是为了硬凑”倒数第二个字不能是’地’”而牺牲了通顺度,其他句子虽然偶有非常用表达,但整体尚可接受。这题 Claude 做到了指令的字面遵循,只是语言自然度有所欠缺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 生成的 SVG 效果整体不错,两只骑车鹈鹕都出现了,土星环也完整。唯一明显问题是转弯处理:用了淡入淡出来掩盖转弯方向突变,而非真实的弧线转向。考虑到 SVG 动画的复杂度,这个表现已经算是相当可以接受。 第三题:复合弓射箭 SVG 测试。 问题比较明显:弓上完全看不到副弦,看起来就像一把普通弓箭;人物姿势也存在”长了两只右手”的视觉歧义——握着弓的手背是朝前的,挡住了弓弦,但拉弓的手...
AirLLM!4G显存跑70G大模型!穷人Deepseek部署指南!
手头没有强劲显卡、又想本地部署几十上百 B 参数大模型的兄弟,这个开源项目值得看一下——不过有言在先,速度肯定是慢的。它就是 AirLLM,号称 4G 显存就能跑 70B 大模型,目前在 GitHub 上已经攒了 38K 多颗星。前两天分享的 FreeToken 用 4G 显存跑 35B 已经够厉害,AirLLM 更夸张。 用法简单到离谱:pip 装上 airllm,一行代码把 HuggingFace 的模型名传进去,就能在自己的游戏本上跑推理。原理说穿了不复杂——大语言模型由多个 Transformer 构成,每个 Transformer 又分多层,AirLLM 让显存里一次只放一层参数,其他参数躺在硬盘上,用的时候再搬进来。所以显存占用取决于「单层有多大」,而不是模型总大小。 关键在于:不用量化、不用裁剪,精度一点不打折。往上加码也不虚——405B 的 Llama 3.1 用 8G 显存就能跑,671B 的 DeepSeek V3 只要 12G,连 2.8 万亿参数的 Kimi K3 都号称 4G 以内能跑,Mac 上苹果芯片照样能玩。更狠的是,它现在还能在 6G 显存...
Hindsight!大模型跨会话记忆终极方案!四路检索记忆引擎!
用过 Claude Code 的人大概都有这种体验:聊得再久,换个项目它就把你忘干净了。它自带的 auto memory 只是往本地一个 memory.md 里写笔记,上限 200 行,超了直接砍,而且每次开工都要把整个文件原样塞进上下文,谈不上任何检索。开源项目 Hindsight 要解决的就是这些问题,目前已经拿到 39,000 多颗星。 Hindsight 存记忆不是记流水账。它会先把对话里的人物、事件、谁和谁有什么关系都挑出来分门别类存好。等你提问的时候,它从四个方向同时翻账本——意思相近的、带关键词的、人物关系对得上的、时间上对得上的,各查各的再汇总,只把跟当前问题有关的那部分记忆递给 AI,而不是像原方案那样整个文件硬塞。 它对「前后说法变了」的处理也很讲究。比如你上个月说项目用 A 方案,这个月改成 B,它会把新旧说法都留着并标清楚谁先谁后,而不是用新的把旧的直接抹掉。此外还有一步 reflect,让 AI 自己回头归纳,把零散事实沉淀成可以持续更新的心智模型。 安装上也不复杂。官方出了 Claude Code 的 MCP 插件,一条命令装上之后,多个智能体就...
Minimax M3.1 Flash 测评!究竟有多不能打?
MiniMax M3.1 Flash Preview 的测评报告来了。这个模型的 API 还没有完全放开,只能在他们自家的 MiniMax Code 客户端里用,所以这次只能把客户端下载下来测。之前 PI 上接 M3 测评时表现太差,本来希望这次在专属客户端上能表现好一点,否则真就谁都别赖了。思考模式直接开到最高,用平台送的 800 积分跑我们这套祖传测试用例。 第一题是强约束指令遵循的句子生成测试,情况不太妙:第三到第十句全都没有按 1 到 10 结尾,也就是说只有前面两句对了。第二题是鹈鹕土星环骑自行车的 SVG 测试,先看积分,两道题跑完只剩 430,差不多用掉了一半。效果上,两个鹈鹕骑车同时出现了——这是第一次有模型犯这种指令遵循的错误;转弯也明显不行,根本没有转弯,鹈鹕骑到下方还是倒着走的。 第三题是复合弓射箭 SVG,跑完剩 310 积分。问题不少:上下滑轮是同方向转动的;拉弓时明显能看到箭不在弦上;右手握弓、弓弦却跑到了手背这一边,那左手还怎么拉弓;左手拉弓时,箭又明显在右手外侧,这个拉弓姿势该有多别扭。 第四题是实现一个精美的浏览器内操作系统,差一点点就做完...
Jev Router 路由大模型测评报告!真的能打吗?
这一集测的是 OpenRouter 上刚上线的路由模型 Jev Router。TypeSafe 的 Jev 决策模型之前很火,拿来做大语言模型路由再合适不过,Jev Router 估计就是这么应运而生的——它会根据问题的难易程度,用不同的思考深度把请求路由到对应的模型。 不过开测前先看了眼余额:上次 23 号充的钱,测完 GPT6 和 Claude Opus 5.5 就只剩 2 美刀,不太够。所以这次也顺便指望它能多路由到免费模型。 第一题,强约束指令遵循句子生成。 完成得很快,而且没花钱,应该就是路由到了免费模型——OpenRouter 上之前测评过的 Space Bunny,不过那个模型上次表现就不太行。回看结果确实不行:第三、四、五、六、八、十句都不是从 1 到 10 结尾的,其他句子读起来还算通顺。 第二题,鹈鹕土星环骑自行车 SVG。 这次花了 0.02 刀,路由到的是便宜的 DeepSeek V4.1 Flash。从这个回答速度看,Jev Router 应该没给它太高的思考深度。效果上整体结构还可以,就是转弯没处理好,到了上方变成倒着骑行。 第三题,复合弓射箭 ...









