Deepseek多模态终于来了!推理编程能力如何?
发表于|更新于|模型
Deepseek 多模态版本终于上线!V4‑Flash‑Vision‑Exp 抢先测试来了!本次依旧接入 Deepseek‑Harness,使用祖传测试套件检测推理与编程实力,识图多模态能力后续单独出镜实测。
强约束生成任务完成零失误,24 点运算、密码锁推理全部答对,基础推理能力稳稳在线。
来到编程测试环节,精美浏览器操作系统 UI 观感尚可,但是右上角图标弹窗失效;太空射击游戏生成失败,找不到战机且按键毫无响应;3D 赛车游戏成品效果优秀,功能整洁只是难度偏高;Trello 看板耗时将近一小时生成,卡片、列表增删拖拽全部正常可用。
本次测评耗时太长,新版模型推理速度和编程产出耗时问题值得留意,你打算第一时间上手体验这款新模型吗……
相关推荐

2026-09-25
Deepseek V4.1 Flash 新版鹈鹕SVG测评报告!
之前有粉丝留言,希望我把 Benchmark 里「鹈鹕骑车」这道题的难度调低之后再重测一遍,这样也能和其他几个模型、包括最近测过的 GPT-6 放在一起横向对比。这一期就来兑现这个承诺。 说起来,这道题原版的提示词确实太难了。后来我专门标注了「转弯的时候动作必须自然平滑,不能出现车身倒立或瞬间闪现掉头」,把难度降了下来,这次就先从 DeepSeek 开始测。开始之前,我们先回顾一下上一次的测评效果。 看结果:这次鹈鹕终于是沿着土星环骑行了,转弯的效果比之前好了很多,整个转弯过程也算比较顺畅。 不过问题还是得说。第一,自行车下方那个很大的「鸡爪」是什么鬼?第二,鹈鹕的翅膀没有扶着车把;第三,鹈鹕的脚跑哪去了?这三个问题在上一次测评里都是没有出现过的,可见 DeepSeek 对这道题的处理确实很不到位。 其余题目没有改动,所以博客上的分数我会继续沿用之前的得分。坦白说,这次总体结果并不比上次好。大家怎么看呢? 访问入口

2026-09-11
Deepseek V4.1 Flash正式版测评!究竟有多能打?
Deepseek V4.1 Flash 正式版实测来了!模型刚上线就惦记着测试,抽时间在 pi 平台开启测评,尽量降低 harness 带来的干扰,思考模式直接拉满开始测试。 推理能力测试 第一题 · 强约束指令句子生成:要求全部句子以「一到十」结尾,通读全部语句都通顺达标。 第二题 · 新版 24 点:要求给出三组解法,结果三组答案全都违规——数字重复使用,不符合「每个数字只能用一次」的硬性规则。 第三题 · 七位数密码锁推理:高难度推理题顺利算出正确答案。 编程项目测评 浏览器操作系统:桌面带有动态动画效果,还有精致小组件,弹窗、Dock 应用运行正常,可惜压轴太空射击游戏无法交互,差了最后一步。 3D 赛车游戏:让人眼前一亮,是这么多轮测评里完成度顶尖的作品,画面精致,车辆模型完整,整体效果非常惊艳。 Trello 看板:采用深色 UI,审美因人而异,卡片拖拽动画效果一般,其余基础功能都正常可用。 整套测试下来,24 点推理题和太空射击项目留下遗憾,但 3D 赛车的代码实现确实足够亮眼。大家怎么看待 Deepseek V4.1 Flash 正式版的这套实测表现...

2026-09-29
AirLLM!4G显存跑70G大模型!穷人Deepseek部署指南!
手头没有强劲显卡、又想本地部署几十上百 B 参数大模型的兄弟,这个开源项目值得看一下——不过有言在先,速度肯定是慢的。它就是 AirLLM,号称 4G 显存就能跑 70B 大模型,目前在 GitHub 上已经攒了 38K 多颗星。前两天分享的 FreeToken 用 4G 显存跑 35B 已经够厉害,AirLLM 更夸张。 用法简单到离谱:pip 装上 airllm,一行代码把 HuggingFace 的模型名传进去,就能在自己的游戏本上跑推理。原理说穿了不复杂——大语言模型由多个 Transformer 构成,每个 Transformer 又分多层,AirLLM 让显存里一次只放一层参数,其他参数躺在硬盘上,用的时候再搬进来。所以显存占用取决于「单层有多大」,而不是模型总大小。 关键在于:不用量化、不用裁剪,精度一点不打折。往上加码也不虚——405B 的 Llama 3.1 用 8G 显存就能跑,671B 的 DeepSeek V3 只要 12G,连 2.8 万亿参数的 Kimi K3 都号称 4G 以内能跑,Mac 上苹果芯片照样能玩。更狠的是,它现在还能在 6G 显存...

2026-08-01
Deepseek V4 Flash最新测评!Claude Code版!
上期完成 DeepSeek V4 Flash 在 Codex 平台测评,本期统一拉满 High 思考深度接入 Claude Code 复测,用全套标准化用例横向对比模型真实表现: 基础指令、24 点运算、密码锁逻辑推理全部答对,仅十条顺序句子存在单句通顺度瑕疵 代码生成环节暴露统一痛点,所有大型开发任务耗时动辄数十分钟,判断是新模型上线调用高峰算力拥堵导致 自制桌面操作系统成品完整性不及 Codex 版本,太空射击游戏交互简陋体验一般 3D 赛车等待 44 分钟但画面与操控效果出色 无第三方库 Trello 看板 UI 清爽,增删拖动全功能无异常 两次跨工具测评输出水准稳定没有大幅波动,能兼顾低成本开发需求,但重度代码项目等待成本偏高。程序员、AI 开发智能体玩家可结合自身任务轻重按需选择使用。 访问入口

2026-09-08
Deepseek V4.1 多模态测评!能打吗?
Deepseek V4.1 预览版多态实测来了!上一轮我们测试推理与编程能力,今天直接拿祖传多态测试用例检验图像能力,该模型暂不支持视频,所以只做图片测试。 首先传入《老无所依》电影截图片名询问影片名称,任务跑了二十多分钟,Deepseek Harness 浏览器几乎卡死,只能终止任务。过程中模型可以识别画面内容,但始终识别不出电影名字。换一张同影片简单截图,耗时五分钟多才成功识别出来。 接下来判断图片里对话亭相对黄色货车的方位,模型准确答出右侧,答案无误。 找不同题中,精确定位第一行第四列倾斜十二度,多观察能力可圈可点。再提升难度,统计画面里雄鸳鸯数量,雄性 5 只识别正确,雌性统计出错——把画面左侧的野鸭错误计入雌性鸳鸯数量。 原本准备两道视频测试题,受限于模型不支持视频输入无法开展。整体图片测试有亮点也有明显短板,大家觉得这个模型多模态水平到底如何…… 访问入口

2026-08-22
Deepseek最新多模态模型测评报告!
万众期待的 Deepseek V4-Flash-Vision-Exp 识图专项测评来了!上期测完推理编程能力,本期专门实测它的图片解析实力,注意这款模型仅支持读取图片,并不能生成图像。 测试前记得将 Deepseek-Harness 升级至 0.1.1-rc2 最新版本,目前也仅有官方 Harness 适配该模型。本次准备了三张实测素材:JS 报错截图、大模型 SWEbench 评分图表、个人博客页面截图。 上传 JavaScript 报错图,模型精确定位未定义变量并给出修复方案;解析跑分图片,完整提取全部数据并整理成表格,解读出关键信息;博客截图转 HTML 代码,生成页面外观高度还原原图,仅次要菜单未开发。整体识图表现亮眼,那么在你心里这款多模态模型究竟打几分…… 访问入口
公告






