GLM 5.3 测试报告!究竟有多能打?
发表于|更新于|大语言模型
GLM 5.3 测试报告,本此在 Claude Code 完成测试,推理设置 high、编程拉满 max 思考深度;强约束指令测试第五句不符合结尾规则,其余语句通顺,24 点、密码锁推理全部作答正确;编程任务浏览器操作系统、太空射击游戏完成度优秀,3D 赛车画面精致但按键左右反转,Trello 看板功能仅好拖动动画质感一般,整体无严重 bug,综合表现属于上乘水准……
相关推荐
2025-10-09
GLM 4.6 测评报告!国产Claude 4.5?
昨天的视频分享了对Claude 4.5的测评,今天打算测下也是刚出来的智普的GLM 4.6。废话不多说,赶紧开干。我们来到网页客户端。这次主要还是测试下我关注的推理和编程。推理的话,我会先关闭深度思考,如果做错了,我再会打开深度思考测一遍。其他情况我都会开深度思考… 访问入口
2025-04-18
OpenAI 发布 O3和o4-mini:你想知道的都在这了!
OpenAI今天发布了最新的o3和o4-mini,专门针对工具调用做了大幅度提升,还支持将图片直接嵌入到思维链中,最后还开源了他们的codex CLI….
2025-11-07
大语言模型为什么知道回答?
如果大家有看过我以前说大语言模型原理的视频的,应该知道大语言模型核心工作方式就是,你输入一句话,它猜下一个字应该是啥。那为什么我们输入 “我国古代四大发明” 时,它不是接着输出 “研究报告” 或者 “趣事” 等,而是给我们介绍是哪四大发明呢?秘密就藏在Chat Template里,是它帮模型明确了 “该做什么”

2025-02-06
DeepSeek R1 是怎么训练出来的?
这几天发了不少DeepSeek的视频,看到有不少同学对V3和R1的关系不是很清楚,这里简单说下我自己的理解。首先,我们要知道大语言模型的训练最开始是用各种网络数据训练出能对语言有基本理解的模型,这通常叫做预训练过程,得出来的模型通常叫做Base Model,比如这里的DeepSeek-v3就是个base model,这个base model就像一个打破任督二脉的武林高手,一身知识和内功,但是不懂怎么运用…
2025-04-21
Gemini 2.5 Flash:炸裂功能及测评报告!
谷歌最新发布了gemini 2.5 flash,这应该是他们最具性价比的推理多模态模型了。可以输入音频视频和文字,有着百万tokens的context window,针对不同的思维策略进行校准,从而获得更准确的输出。另外一个以前没有见过的是它可以调整推理时消耗的tokens的多少,以防推理使用过多的tokens。也就是可以让它思考久一点或者快一点。API 调用的话,它的百万tokens输入价格是15美分,输出是60美分,比起OpenAI和Claude那些动不动就是美元甚至10美元为单位的推理模型,这个模型可谓是非常便宜的了… 访问入口

2025-01-17
Minimax 01:国产最新开源大模型测评.mp4
支持400万Tokens的免费开源够产大语言模型啊!今天我们要测评下的是minimax最新的01模型,这是个MoE模型,也就是Mixture of Expert,混个专家模型了,大家不清楚的可以翻下我以前视频有专门介绍这些概念的。然后它的总参数是456亿,最牛逼的是他一个开源模型竟然支持400万个tokens,这基本就是其他模型的20到32倍啊。不过今天我们不会测试这么大的tokens输入,我们还是循例问下一些其他大语言模型经常做错的题目… 访问入口
公告






