文心5.1!真的能打吗?快速测评报告!
发表于|更新于|大语言模型
百度文心一言5.1的快速测评报告!文心5.1是百度最新的大语言模型版本,本视频通过快速的基准测试和实际任务验证其在语言理解、知识问答、中文创作和逻辑推理等方面的能力。并与文心4.0以及竞品模型进行对比,帮助用户判断这一版本是否值得升级使用。对于那些关心国产大模型进展的读者来说,这是一份及时的评测参考。
相关推荐

2026-05-18
百度文心5.1思考模型能打吗?实测报告!
百度文心5.1思考模型的实测报告——这是百度新加入”深度思考”能力的模型版本。与标准版文心5.1不同,思考模型会在给出最终答案前进行内部推理和验证,类似于OpenAI o1的”慢思考”模式。本视频测试其在复杂推理、数学题和编程任务上的表现,并与o1、Claude的思考模式进行对比。 访问入口
2025-04-21
Grok 3 免费RAG:直接和你的文档进行对话!
上几天跟大家分享了马斯克最新的Grok 3 Studio,可以让我们实时预览和编辑文档及代码运行结果。其实Grok还有另外一个免费功能也是挺好用的,就是Workspaces功能,通过它我们可以直接和文档进行对话,也就是所谓的RAG,检索增强生成了。这个功能虽然不新鲜,但是像OpenAI和Claude等相关的功能都是付费才能用的,这就是Grok难能可贵之处了。好,废话不多说,赶紧demo下… 访问入口
2025-05-03
DeepSeek数学模型测评:难道是我打开方式不对?
昨晚分享了DeepSeek最新推出的专门做数学题的DeepSeek-Prover-V2-671B,今天就发现huggingface已经有space托管出来了,我们立刻上去看下。 既然是专门处理数学模型的,我们就找一些数学题给他做下吧… 访问入口

2026-01-06
Claude Code 入门(三)!项目编程指南!
claude code 入门第三集!这一集我们将要学习claude.md,在上一集视频我们可以看到,当我们在一个老项目中叫claude code做代码修改时,它会花很长时间去扫描整个项目,好对这个项目做一个了解,比如用的是什么编程语言,项目的架构等,然后才会开始修改。但是如果每次都需要耗时间在这上面,那这效率也太低了。这时claude code提供了一个命令…
2025-06-03
DeepSeek Engineer!免费创意变App!
兄弟们,还记得之前跟大家介绍过的超简洁AI编程工具DeepSeek Engineer V1吗? 这几天他们更新了!新版 V2 超好用,是个轻量级 AI 编码助手,本地就能玩。 Github项目访问入口
2024-11-29
LongWriter: 怎么解决大模型不能生成千字长文章问题的?
LongWriter是清华大学等机构提出的解决方案,针对大语言模型无法生成长文本(如千字以上文章)的技术难题。传统的LLM在生成长文本时往往会出现”上下文丢失”、”重复循环”或”逻辑混乱”的问题。LongWriter通过改进的训练策略(AgentWrite方法)和模型架构调整,让模型能够生成连贯、有逻辑的万字长文。本视频介绍LongWriter的原理和使用方法,帮助你解决AI写长文的各种问题。 访问入口
公告





