腾讯混元T1推理模型测评:没有对比就没有伤害!
发表于|更新于|免费AI工具
|浏览量:
昨天测评了腾讯混元大模型的通用模型,一般问答都挺好,但编程能力拉胯,今天再测评推理模型T1,最后会对比下它和deepseek r1的编程能力…
相关推荐

2025-03-26
Gemini 2.5 Pro 测评:最强推理大语言模型!
昨天测评了下最新的DeepSeek V3.1,着实惊艳!有粉丝留言说希望我测试下最新的Gemin 2.5 Pro,义不容辞啊!首先大家要知道这是个推理模型,所以我今天的测试加了几道粉丝提供的推理题,然后它在lmarena上多个benchmarks上打败了o3-mini, gpt-4.5, claude 3.7,deepseek r1等模型… 访问入口

2025-02-08
OpenAI终于免费开放搜索和推理功能
OpenAI 给免费用户开放搜索和推理功能,直接取代掉Perplexity啊!我知道搜索功能推出有段时间了,但是一直没有全部覆盖到免费用户,但今天我用我一个免费账号试了下,已经可以用上了。 而推理功能是最新的,估计是迫于DeepSeek R1的压力才推出的。这两个功能就算你不登录,只是临时聊天也是可以用上的。快速去Demo下… 访问入口

2025-03-08
Lightning AI:免费微调DeepSeek r1
这可能是最简单的用自己数据微调出自己的DeepSeek r1的方法了。今天淘到的这个AI工具叫做lightning ai,它让我们只需要简单几步就能微调出自己的DeepSeek r1. 而它每月提供免费的GPU额度给我们用,足够我们一般人玩耍了。废话不多说,我们立刻看Demo… 访问入口

2024-12-22
Kimi视觉推理大模型:差评!
看网上都在吹Kimi的视觉推理大模型,说得神乎其技,可以取代OpnAI 200刀每月的专业版之类的,真有这么厉害吗?这里我们也来快速测试下。 首先,我们来个简单都英语填空题,这种题一般的大模型都能做对,本来就是大语言模型的强项,仅作为最基本验证,它也是没有问题的。 再看第二道题,来个脑筋急转弯,分析推理确实是一大堆的,答案也和预期一样,但是它是实打实的脑筋不转弯都从语言学等角度得出的答案,其实这里在中文语境中用脑筋急转弯思路就能很快得出答案,太阳公公嘛,那太阳肯定是男都啰。况且太阳叫做sun,儿子也读作son,也能得到印证。所以我推定它是不适合做脑筋急转弯的,起码不适合做中文的脑筋急转弯。 下一道数学题,“一口井7米深,有只蜗牛从井底往上爬,白片爬3米,晚上下坠2米。问蜗牛几天能从井里爬出来?”这里要注意解题的关键点是最后一天可能它不会滑下来了。我们看它分析,前几天都没有问题,第四天,白天爬3米,就是到了6米,晚上滑下来2米,到了第4米,第五天,白片爬3米,4+3刚好7米,所以就爬出来了,就不用考虑晚上往下滑了。所以答案是5天就能爬出去。我们看它最终做了一大堆装模作样的推理...

2024-12-26
QVQ-72B:世上唯一开源免费视觉推理大模型
这应该是当今世上唯一一个完全开源免费的视觉推理大模型,相比海外如OpenAI等贵的要命的o3模型,阿里巴巴最新推出的这个QVQ-72B视觉推理大模型遵循都是Apache 2.0的协议,也就是说权重等完全开源,如果我没有搞错的话,这应该是当今世上唯一一个完全开源免费的视觉推理大模型,它只有72B的参数量,但是它在MMLU多模态测试集和MathVision等数学视觉等测试集上的benchmarks得分却不容小觑。下面我们快速的去魔撘上玩下… 访问入口

2025-01-27
DeepSeek R1:怎么实现国产免费加强版Perplexity
国产加强版Perplexity啊!我们知道Perplexity可谓是大语言模型应用落地最成功的产品,他可以将网络搜索的内容帮我们整理好再给我们答案,不需要我们点开各个搜索结果网页查看,但它做的更多还是将拿回来的网站内容文本做总结,并不确保结果一定合理。如果我们将它这个网络搜索总结能力结合推理大模型的能力,那我们将会得到加强版的Perplexity了。而这,就是今天我要跟大家分享的最强免费推理大语言模型deepseek r1了,通过它的深度思考和网络搜索能力… 访问入口
公告





