Qwen3-Max-Thinking吊打GPT 5.2?测评报告!
发表于|更新于|大语言模型
阿里发布千问旗舰推理模型 Qwen3-Max-Thinking,总参数超万亿。据说在 19 项权威基准测试中,其性能可媲美 GPT-5.2-Thinking、Claude-Opus-4.5 和 Gemini 3 Pro 等顶尖模型。如此牛逼,赶紧拿出我们的那套测试用测试下…
相关推荐
2026-02-02
Kimi K2.5 结果不是我要的!测评报告!
昨天被刚出来的Kimi k2.5给惊艳到了,特意做了个视频分享了它根据我博客录制的视频就能帮我完美复刻出一模一样的网站。今天打算搬出我们得那套测试用例,探一探它推理和编程能力的深浅… 访问入口

2025-04-11
Optimus Alpha测评:可能是OpenAI开源模型!
OpenRouter上最新加了个叫做Optimus Alpha的神秘免费模型,据称可能是OpenAI最新的开源模型,但也可能是o4 Mini,据称性能不俗,特别是在编程方面。废话不多说,赶紧去测评下… 访问入口
2025-06-10
炸裂网页自动化工具!自动操作浏览器!
如果有做个自动化测试的,应该对selenium不陌生,这一集给大家推荐是selenium base这款开源软件,可以几行代码就轻松的实现网页自动化相关任务 访问入口

2026-04-27
混元HY3!是否真的能打?真实测评报告!
腾讯混元HY3(Hunyuan 3)的真实测评报告!混元是腾讯的AI大模型系列,HY3是最新版本。本视频从语言理解、代码能力、多模态处理、中文创作等多个维度进行全面测试。通过与其他国产和海外主流模型的对比分析,客观评估混元HY3的真实实力,帮助用户在众多AI模型中选择最合适的工具。 访问入口
2024-11-29
GPT4翻车事件:LLM为何做不对简单数学题?
GPT-4等顶级大语言模型在复杂编程、论文写作上表现出色,却在简单的数学计算上频频”翻车”,连「5.8+2.1」这样的基础运算都可能出错。这背后的核心原因在于:大语言模型本质上是基于概率的文本生成系统,它依赖海量训练数据中的模式匹配来”猜”答案,而非像计算器那样进行精确符号运算。视频深入剖析了LLM在数学推理上的根本局限性,解释了为什么模型在简单算术上反而比复杂推理更容易出错,以及当前解决这一问题的技术方向,包括引入外部计算工具和思维链(Chain-of-Thought)等方法。
2025-06-25
一键安装MCP!小白也能轻松用上MCP!
MCP是个好东西,但就是各种MCP Server太分散太难找,就算找到了,一般人也不懂得配置,就算配置好了,跑在你本机上你也担心不安全,谁知道这个server的开发者会不会埋个病毒!而今天淘到的这个Docker MCP Toolkit就是来解决你所有这些问题的。容器里面跑,够安全了吧,一键安装配置到cursor,claude等客户端,足够简单了吧, 提供大量的MCP servers让你免费用,足够集中了吧。废话不多说,立刻给大家demo下怎么用 Docker官网
公告






