Deepseek V4 Pro新架构测评报告!能打吗?
发表于|更新于|编程工具
DeepSeek V4 Pro采用了全新的模型架构,本视频对其进行全面的独立测评。新架构在推理效率、上下文长度和知识密度方面都进行了重大优化。通过大量实际测试,评估V4 Pro在编程、数学推理、长文本处理和多轮对话等核心任务上的表现,并与GPT-4、Claude Opus等顶级模型进行对比分析。
相关推荐

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口

2026-08-21
Deepseek多模态终于来了!推理编程能力如何?
Deepseek 多模态版本终于上线!V4‑Flash‑Vision‑Exp 抢先测试来了!本次依旧接入 Deepseek‑Harness,使用祖传测试套件检测推理与编程实力,识图多模态能力后续单独出镜实测。 强约束生成任务完成零失误,24 点运算、密码锁推理全部答对,基础推理能力稳稳在线。 来到编程测试环节,精美浏览器操作系统 UI 观感尚可,但是右上角图标弹窗失效;太空射击游戏生成失败,找不到战机且按键毫无响应;3D 赛车游戏成品效果优秀,功能整洁只是难度偏高;Trello 看板耗时将近一小时生成,卡片、列表增删拖拽全部正常可用。 本次测评耗时太长,新版模型推理速度和编程产出耗时问题值得留意,你打算第一时间上手体验这款新模型吗…… 访问入口

2026-08-28
Deepseek Harness 入门(15)!峰谷费用仪表盘!
这款 dsh-cost-meter 插件能帮你精准把控费用!安装之后左下角实时展示账号余额、当日消费金额,还会贴心提示距离峰谷收费切换的剩余时长,方便大家错峰使用节省成本。 每一轮对话结束,对话框下方立刻显示本次聊天产生的花费,哪怕只是发送一句 hi,也能看到产生了三分多钱的消耗。进入插件设置里的费用菜单,还可以查看详尽的用量报表、开启高峰期弹窗提醒,各类自定义选项十分丰富。 想精细化管控模型开销的开发者,不妨亲自上手体验一下。 访问入口 dsh-cost-meter 插件(峰谷费用仪表盘插件)

2026-07-20
Deepseek V4 Pro 最新测试!最新benchmarks!
本期带来 Deepseek V4 Pro 最新 benchmark 全面测评,涵盖编程、推理、数学、多模态等核心维度对比。DeepSeek-V4 Pro 是幻方量化推出的高性能大语言模型,采用 MoE 架构,拥有超长上下文处理能力。本期视频通过最新 benchmarks 数据,直观展示 V4 Pro 在各大榜单的表现,与 GPT-4o、Claude 3.5 等头部模型的差距,帮你判断这款国产开源模型是否值得信赖。 访问入口
2025-08-31
DeepSeek的豪赌!别再抱怨R2难产了!
相信大家都知道DeepSeek最新发布了3.1版本了,我上几天也发过视频去测评在推理和编码方面提升不大,但最近发现这次DeepSeek这次发布真正要突破的并不是这些方面,而是对使用国产芯片来进行训练,减少对老美依赖的尝试。看来我的格局真的小了…

2026-08-22
Deepseek最新多模态模型测评报告!
万众期待的 Deepseek V4-Flash-Vision-Exp 识图专项测评来了!上期测完推理编程能力,本期专门实测它的图片解析实力,注意这款模型仅支持读取图片,并不能生成图像。 测试前记得将 Deepseek-Harness 升级至 0.1.1-rc2 最新版本,目前也仅有官方 Harness 适配该模型。本次准备了三张实测素材:JS 报错截图、大模型 SWEbench 评分图表、个人博客页面截图。 上传 JavaScript 报错图,模型精确定位未定义变量并给出修复方案;解析跑分图片,完整提取全部数据并整理成表格,解读出关键信息;博客截图转 HTML 代码,生成页面外观高度还原原图,仅次要菜单未开发。整体识图表现亮眼,那么在你心里这款多模态模型究竟打几分…… 访问入口
公告





