sensenova-6.8-flash-lite测评,能打吗?
粉丝点名测评翻车!商汤 sensenova-6.8-flash-lite 免费又如何?今天接入 Claude Code 拿祖传全套用例实测,顺便对比它和 Agnes 孰强孰弱。 强约束生成足足跑了 5 分钟,十条句子仅有两句合格,其余全部跑偏;24 点、密码锁推理顺利通关。 可一到编程大题直接上演噩梦,浏览器操作系统任务从下午两点半等到七点半,API 反复中断失联,重试多次始终拿不到完整代码,后面两道编程测试也只能被迫放弃。这已经不是生成慢的问题,而是接口直接停止返回结果,三道编程项目成绩堪忧,整场测评体验拉胯,综合表现不尽人意…… 访问入口
千问办公入门(17)!怎么一键分享自己的作品?
还在苦恼做好的网页小工具只能自己偷偷欣赏?以前使用千问办公这类 AI 办公助手,好不容易做出精美的网页或者实用工具,做完之后却无人欣赏。 现在大家不用孤芳自赏了,千问办公上线了「我的网页」功能,可以把我们的作品一键发布到网上给朋友直接使用。输入提示词让千问办公生成介绍 AI 产品狙击手 IP 的落地页,提交之后确认发布,任务完成,回到「我的网页」列表就能找到这份作品,点击链接即可线上访问。 就算本机已经关机,其他人依旧能够浏览页面。往后大家就可以放开脑洞,制作各类好玩的小工具,轻松分享给朋友同事,独乐乐不如众乐乐…… 访问入口
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口
腾讯混元Hy4-Preview测评报告!价值十块的测评报告!能打吗?
腾讯混元全新 Hy4‑Preview 实测报告出炉!这个测评花费了10块多钱,刚测完就收到电汇说我欠费了,而且花了大约半天时间来测的,大家多支持我吧!其实我原本打算在 AIstudio 开展测试,却遇到输出截止、上下文丢失的问题,受限于 64K 最大输出,于是付费接入 Claude‑Code 开启全套祖传测试。 强约束生成任务两处不符合要求,24 点解题出现重复数字、阶梯越界等问题,密码锁推理顺利答对。编程项目中浏览器操作系统和太空射击游戏的 UI 挺惊艳,3D 氛围感拉满;但 3D 赛车游戏代码生成中途报错未能完成,Trello 看板出现多余符号、排版错乱等小 bug。全程最突出的问题就是生成速度极慢,多次触发请求限额报错。如果后续算力跟上、稳定性优化到位,这款模型的潜力还是非常值得期待的…… 访问入口
GLM 5.3 Flash测评报告!究竟有多能打?
爆炸全网的神秘 Ox‑Alpha 终于官宣身份——它就是智谱 GLM‑5.3‑Flash!本期测评在 ZCode 平台,用全套用例深度实测它的真实实力。 一、推理题强约束指令遵循(句子结尾 1-10)句子生成整体通顺,第二句”独一无二”用法存疑,应为”独一无二”才通顺——扣1分。 24 点运算答案正确 ✅ 密码锁推理(答案:1 2 7 5 3)答案正确 ✅ 二、编程题实现精美浏览器操作系统 WiFi 图标位置错误(应在右上角,实际在左侧) 弹窗超出边界 Dock 栏应用正常 太空射击游戏近期看到最好的实现之一,有 3D 氛围感。如敌机不是石头而是真实飞机效果会更佳。 3D 赛车游戏整体效果优秀,如非撞一次就 Game Over 可玩性更大。 无第三方库实现高颜值 Trello 看板 UI 视觉舒适 卡片和列表的增删改查、拖拽功能全部正常 总结得益于 ZCode 自带自修复能力,代码完成后自动测试有问题即时修复,产出质量更进一步。综合来看,GLM‑5.3‑Flash 属实是一款实力非常强劲的模型,感兴趣的小伙伴不妨亲自上手一试…… 访问入口
Deepseek Harness 入门(15)!峰谷费用仪表盘!
这款 dsh-cost-meter 插件能帮你精准把控费用!安装之后左下角实时展示账号余额、当日消费金额,还会贴心提示距离峰谷收费切换的剩余时长,方便大家错峰使用节省成本。 每一轮对话结束,对话框下方立刻显示本次聊天产生的花费,哪怕只是发送一句 hi,也能看到产生了三分多钱的消耗。进入插件设置里的费用菜单,还可以查看详尽的用量报表、开启高峰期弹窗提醒,各类自定义选项十分丰富。 想精细化管控模型开销的开发者,不妨亲自上手体验一下。 访问入口 dsh-cost-meter 插件(峰谷费用仪表盘插件)
Qwen 3.8 Flash!千问办公省积分指南!
千问办公性价比实测来了!之前评测过 Qwen3.8-Flash 推理、编程、多模态实力出众,这次就在千问办公平台,用相同任务对比测试 Qwen3.8-Flash 和 Max 两款模型的效果以及积分消耗。 上传一份 70 页广东高考投档线 PDF,要求生成志愿填报 PPT,Flash 版本仅消耗约 14 积分,去掉文档解析成本,生成 PPT 只需 10 积分上下。反观千问 3.8 Max,完成一模一样的任务直接耗掉九十多积分,几乎用光每日赠送的 100 免费积分。而两份 PPT 成品效果差距并不大。 由此可见普通 PPT、文档处理这类低难度任务优先选 Flash 更加划算,1000 积分甚至有机会生成上百份 PPT。以后不用再心疼积分,根据任务难度选对模型就能省下一大笔成本。 访问入口
Qwen 3.8 Flash 多模态测评!究竟有多能打?
Qwen 3.8‑Flash 多模态专项测评来了!在上一期测试推理与编程实力之后,本期就用专属祖传测试用例,深度检验它识图、视觉理解的真实水平。 电影截图识别一题翻车、一题答对;空间方位判断、细微倾斜图形辨别表现出色;鸳鸯计数出现误判,将野鸭归类成了雌性鸳鸯。视觉时序测试中,并线时间识别准确,右转时间判断却出现了较大偏差。综合来看,这款 125B 参数的模型图像感知能力可圈可点,但在复杂识别、长视觉时序轴判断上依旧存在短板,感兴趣的小伙伴可以亲自动手实测感受一下…… 访问入口
Qwen 3.8 Flash测评报告!究竟有多能打?
期待已久的 Qwen‑3.8‑Flash 实测报告新鲜出炉!这款全新的 MoE 多模态大模型,主参 125B,每次仅激活 6B 参数,原生 256K 上下文最高可扩容至 1M,API 定价性价比极高,网传办公编稿实力十分强悍。本次依旧使用祖传全套测试用例,在 Claude Code 上将思考模式拉满展开测评。约束生成、24 点运算、密码推理题全部顺利通过,推理表现亮眼。但深度编程测试当中,浏览器操作系统、太空射击游戏、Trello 看板等项目出现了界面布局、物体方向、按钮排版等小 bug,3D 赛车游戏整体完成度较高。综合来看它的推理能力稳定在线,编程实力可圈可点,想要上手的小伙伴可以参考这份实测结果…… 访问入口
Deepseek Harness入门(14)!Tokens都去哪了?
你有没有遇到过,在 Deepseek‑Harness 没聊上几句,Token 就飞快见底?罪魁祸首很可能就是你装的一堆插件!借助 dsh‑context 这款宝藏插件,就能看清 Token 消耗的真相。仅仅发送一句简单的 hi,1M 上下文就消耗了 11.5k Token,系统提示词只占一小部分,而工具定义却占到 78%。只要你安装了插件,每次发起对话,所有工具的描述、调用参数都会一次性传给大模型。插件装得越多,这份工具清单就越长,额外吃掉的 Token 也就越多。这款 dsh‑context 插件可以把上下文消耗明细分完整展示出来,帮你监控插件带来的隐形开销,及时清理多余插件省下大量 Token…… 访问入口









