Grok3官方测评报告:9.12比9.9还大?
发表于|更新于|大语言模型
昨天测评了官方版的grok3推理模型,发现效果不如deepseek r1, 今天想测试下非推理模型,看performance是不是更烂…
相关推荐
2025-04-21
Grok 3 免费RAG:直接和你的文档进行对话!
上几天跟大家分享了马斯克最新的Grok 3 Studio,可以让我们实时预览和编辑文档及代码运行结果。其实Grok还有另外一个免费功能也是挺好用的,就是Workspaces功能,通过它我们可以直接和文档进行对话,也就是所谓的RAG,检索增强生成了。这个功能虽然不新鲜,但是像OpenAI和Claude等相关的功能都是付费才能用的,这就是Grok难能可贵之处了。好,废话不多说,赶紧demo下… 访问入口

2025-02-21
Grok3推理模型测评:打败DeepSeek r1?
Grok3 reasoning model推理模型测试报告啊。今天终于发现可以在官网上免费用上Grok3了,鉴于上次在lmarena上测试的是early-grok-3,这次准备在官网上正式测试下,我们这次先测试的是推理模型。去到官网,看到这里已经是grok 3了,选择Think,打开推理模式… 访问入口

2025-04-16
Grok 3 Studio:AI编程IDE加Markdown编辑!
Grok 免费推出Grok 3 Studio,其实说白了就是OpenAI等的canvas,估计是马斯克为了搞差异化,所以将其叫做Studio,通过它,我们可以实时预览grok编写的代码和文章,废话不多说,赶紧demo下… 访问入口
2026-02-16
GLM 5 测评报告!推理编程有多强?
上个视频测评了刚出来的GLM-5的agent,说的如何如何的厉害,测两个cases花了我一个多小时时间,还有各种的幺蛾子。这一集我们来继续用我们的祖传测试用例测评下它的推理和编码能力… 访问入口://z.ai)
2025-07-15
国产版Claude?Kimi K2测评报告!
moonshot 推出开源 kimi k2,这是个万亿参数的混合专家架构,每次激活 320 亿参数,直接对标claude opus!如此厉害,我们来实测下它真是的performance究竟如何… 访问入口

2025-03-26
Gemini 2.5 Pro 测评:最强推理大语言模型!
昨天测评了下最新的DeepSeek V3.1,着实惊艳!有粉丝留言说希望我测试下最新的Gemin 2.5 Pro,义不容辞啊!首先大家要知道这是个推理模型,所以我今天的测试加了几道粉丝提供的推理题,然后它在lmarena上多个benchmarks上打败了o3-mini, gpt-4.5, claude 3.7,deepseek r1等模型… 访问入口
公告





