腾讯Hy3测评报告!推理几近全军覆没!
发表于|更新于|大语言模型
腾讯混元Hy3的推理能力专项测评——“推理几近全军覆没”!本视频通过大量逻辑推理、数学推理和常识推理测试,发现混元Hy3在推理任务上的表现远低于预期。对比其编程、写作等其他能力的出色表现,推理能力的不足可能会限制它在某些场景下的应用。本视频提供详细的测试数据和原因分析。
相关推荐

2026-07-18
快手KAT-Coder-Pro-V2.5 测评报告!真的能打吗?
快手KAT-Coder Pro V2.5是快手推出的AI编程专用模型,本视频对其进行独立的全面测评。通过涵盖算法题、实际项目开发、代码审查和调试等多个场景的测试,评估其在编程领域的专业能力。与Claude Code、Codex、DeepSeek等主流编程模型进行对比分析,帮助开发者判断这款专用编程模型是否值得使用。

2026-07-18
混元Hy3 AiStudio版测评报告!结果大相径庭!
腾讯混元Hy3的AiStudio版本测评报告——“结果大相径庭”!本视频测试发现,混元Hy3在AiStudio平台上的表现与独立版本存在显著差异。通过大量的对比测试,分析两个版本在回答质量、推理能力和速度上的不同,以及造成这种差异的可能原因。对于使用混元模型的用户来说,选择哪个版本可能需要根据具体场景来决定。

2026-07-18
Workbuddy入门(六)!文件上下文详解!
Workbuddy入门第六集!深入讲解文件上下文(File Context)机制——它让Workbuddy能够理解你项目中的文件内容和结构。本视频教你如何配置文件上下文的范围、设置关键文件索引、以及如何利用文件上下文让AI更精准地回答关于你项目的问题。掌握文件上下文的配置,是让Workbuddy深入理解你项目的关键。

2026-07-18
Workbuddy入门(三)!三种工作模式实战!
Workbuddy入门第三集!深入讲解Workbuddy的三种核心工作模式及其实战应用。包括:对话模式(日常问答)、任务模式(执行复杂指令)和Agent模式(自主规划执行)。通过实际案例演示每种模式的最佳使用场景和切换技巧,帮你根据不同任务选择最合适的工作模式,最大化AI效率。

2026-07-18
大语言模型为什么每次输出不一样?温度和top-k是什么鬼?
使用大语言模型时,你可能会发现同一个问题每次得到的答案都不一样。这背后的关键参数是temperature(温度)和top-k/top-p采样。Temperature控制输出的随机性——温度越高,输出越多样但有风险;温度越低,输出越确定但可能缺乏创意。Top-k和top-p则控制AI在生成下一个词时考虑的范围。本视频用通俗语言解释这些核心概念,帮你更好地控制和调教AI的输出风格。

2026-07-18
Workbuddy入门(十)!专家和专家团详解!
Workbuddy入门第十集!全面详解专家(Expert)和专家团(Expert Group)功能。专家是Workbuddy中专精于特定领域的AI角色,专家团则是一组专家的协作组合。本视频教你如何创建、配置和使用专家,如何组建专家团来处理复杂任务,以及如何利用专家系统提升AI在垂直领域的表现。
公告





