Kimi K3 真实测评报告!是否真的能打?
发表于|更新于|大语言模型
Kimi K3是月之暗面(Moonshot)推出的最新大语言模型,本视频带来真实的独立测评。通过覆盖语言理解、长文本处理、编程能力和中文创作等多个维度的实际测试,客观评估Kimi K3的真实水平。并与GLM-5、DeepSeek V4、Qwen等国产模型进行横向对比,帮助用户判断Kimi K3是否”真的能打”。
相关推荐
2025-09-09
Kimi K2 0905发布!不全面测评报告!
Kimi K2 模型刚发布了 0905 最新版本,号称编程能力进一步做了增强,上下文长度从 128K 扩展到 256K,还提供了支持 60到100 Token每秒输出速度的高速版 API。可惜的是还是没有支持多模态和推理模式。在手机app和官方网页版已经全量进行了升级。这里为了响应粉丝“欧豪的小格格”的要求,准备对其进行下测评,这次主要会测评下编程能力。同时也会测几道推理题。好,那就开始吧 访问入口

2026-07-18
Kimi K3 泄露!究竟有多能打?
Kimi K3是月之暗面(Moonshot)正在开发中的下一代大语言模型,其相关信息在社区中”泄露”后引发了广泛关注。本视频基于泄露的信息,分析Kimi K3在架构设计、能力预期和定位上的可能方向。结合Kimi K2系列的实际表现,推测K3可能在长文本处理、推理能力和多模态理解方面的升级。同时也会对比其他国产厂商的最新模型动态,帮助读者了解国产大模型的竞争格局和发展趋势。

2026-07-19
Qwen 3.8 预览版测评报告,打得过Kimi K3吗?
千问 3.8 Max Preview 实测测评,对比此前 Kimi K3 的测评表现如何呢? 统一标准祖传测试用例实测,约束文本生成全对且速度更快,24 点、密码推理答题准确;编程项目生成效率大幅提升,浏览器系统配套太空射击游戏 UI 与功能完整,3D 赛车运行流畅无操控故障,复刻 Trello 看板还原度极高,仅缺少单条待办删除按钮一处小瑕疵。 对比 Kimi K3 存在答题失误、赛车失控、界面 bug 且生成耗时极长等短板,千问新版本综合实力更出众,响应速度优势突出。 关注 AI 产品狙击手,持续更新各类 AI 模型实测干货! 访问入口
2025-09-28
Manus国内平替?Kimi通用智能体杀到!
说到通用AI智能体方面,相信大家脑海立刻出现的就是manus,但访问要魔法是一直让人诟病的。今天要介绍的Kimi K2最新推出的OK Computer,也许能成为你国产版的manus。可惜的是,每个月只有3次的免费额度,这相比manus人家每天都有免费额度赠送就差得有点远了。不过我们总有办法可以绕过去的。哈哈。这就不提了。大家喜欢的话赶紧用起来吧… 访问入口

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口

2025-03-12
Gemma3:谷歌开源多模态大模型打败DeepSeek v3!
谷歌发布最新开源多模态模型Gemma-3,从纯粹的大语言模型华丽转身成多模态大模型,27B甚至在LMArena上打败了DeepSeek v3,另外一个亮点就是支持funcition calling和工具调用,用在这几天分享的用来自动操作电脑的OpenManus这些智能体上,堪称perfect… 访问入口
公告





