Grok 4.2 杀到!编程能力爆表!
发表于|更新于|大语言模型
马斯克的 Grok 除了前两天以搞黄色的负面消息冒了个泡,已经好长时间没有走入我们的视野了。但就在大家以为它要掉队时,代号为 Obsidian 的 Grok 4.2 早期测试版正在悄悄惊艳所有人。这次升级最让大家咂舌的不是它搞黄色,而是它的“审美”和“代码力”竟然双双爆表,简直像从一个叛逆少年变成了全能的设计师加程序员…
相关推荐
2024-11-29
RouteLLM:打造更快更便宜的LLM产品!
RouterLLM(或LLM Router)是一种智能的大语言模型路由技术,它的核心思想是:不是所有问题都需要最强的GPT-4来回答。RouterLLM可以根据问题的复杂度,自动将简单问题路由到便宜快速的小模型(如Llama、Mistral),复杂问题才使用顶级模型。这可以在保持回答质量的同时大幅降低API成本和提升响应速度。对于需要大规模使用LLM的生产级应用来说,RouterLLM是一种极其重要的成本优化技术。 访问入口
2024-11-29
RWKV测评报告
RWKV是一种创新的开源大语言模型架构,由华人开发者彭博独立提出。它巧妙地将Transformer的注意力机制与RNN的循环结构相结合,既具备了Transformer的强大表达能力,又拥有RNN的高效推理优势(线性复杂度,显存占用低)。这意味着RWKV可以在消费级GPU上运行,并且推理速度远超同等规模的Transformer模型。本视频对RWKV进行全面测评,测试其在文本生成、理解、推理等任务上的表现,并与同规模的传统Transformer模型进行对比,帮你评估RWKV是否值得在你的场景中使用。 开源地址
2025-09-25
超乎想象!首个端到端全模态大模型!全面测评报告
阿里发布并开源首个端到端全模态 Qwen3-Omni 模型,据说性能出色且功能强大,既然说得这么厉害,还是首个端到端的全模态,那当然要去测评下了。最终结果超乎你想象! 访问入口
2025-08-21
DeepSeek V3.1 对比测评报告!效果真有这么炸裂吗!?
DeepSeek 3.1对比测评报告来啦!上个视频跟大家介绍了DeepSeek最新的版本,承诺会找些cases来测评下推理和编程能力,来到官网,我们留意到原来的R1选项已经没有了,取而代之的是“深度思考”这个选项,所以应该是没有选上这个选项的话,我们用的就是普通的3.1版本,勾选上的话,不再像以前一样切换的R1模型,而是依然用的是3.1版,但估计系统提示词会让DeepSeek 3.1做深入思考再来回答。这次我们会用同一套cases测试没有勾选“深度思考”和勾选了“深度思考”的情况好做对比。 那就来吧 访问入口
2024-11-29
MaaS开放平台深体验:强大工具模型开发实战
MaaS(Model as a Service,模型即服务)开放平台是阿里云等云厂商推出的AI模型服务平台,让开发者可以通过API调用各种大语言模型和AI能力。本视频深度体验了MaaS平台的各项功能,包括模型调用、工具链集成、开发实战等。涵盖了:如何注册和使用MaaS、支持哪些模型、如何调试和优化API调用、以及实际开发项目的全流程演示。对于想要在应用中集成AI能力的开发者来说,这是一份实用的MaaS入手指南。 访问入口

2025-04-09
腾讯混元T1推理模型测评:没有对比就没有伤害!
昨天测评了腾讯混元大模型的通用模型,一般问答都挺好,但编程能力拉胯,今天再测评推理模型T1,最后会对比下它和deepseek r1的编程能力… 访问入口
公告





