OmniVision: 可本地跑的多模态大模型
发表于|更新于|大语言模型
OmniVision是一款由Nexa AI开发的多模态大语言模型,它能够在本地设备上运行,支持同时处理文本、图像和视频输入。与云端多模态模型不同,OmniVision针对移动设备和边缘计算进行了优化,可以在手机上流畅运行。它能够理解图片内容、分析视频帧、回答关于视觉输入的问题。本视频介绍OmniVision的安装部署和实际使用体验。
相关推荐
2024-11-29
Nexa AI OmniVision:本地部署多模态大模型
Nexa AI OmniVision的本地部署教程!本视频手把手教你如何在自己的电脑上安装和运行OmniVision多模态大模型。涵盖了:系统要求检查、模型下载、安装配置、API调用示例和性能优化技巧。OmniVision支持处理图像和视频输入,能够在本地完成复杂的视觉理解任务。无需GPU也能运行优化版本,是本地AI部署领域值得关注的多模态模型。 官方博客
2024-11-29
谷歌最新文生图Imagen3测评报告
Google Imagen 3文生图模型的深度测评报告!Imagen 3是Google最新最强大的AI图像生成模型,在真实感、细节表现和文字渲染方面都有了质的飞跃。本视频通过大量对比测试,评估Imagen 3在写真、绘画、概念设计和商业素材等不同场景下的表现。并与Midjourney 6、DALL-E 3和Stable Diffusion 3等旗舰模型进行全面对比。 访问入口

2024-12-22
Kimi视觉推理大模型:差评!
看网上都在吹Kimi的视觉推理大模型,说得神乎其技,可以取代OpnAI 200刀每月的专业版之类的,真有这么厉害吗?这里我们也来快速测试下。 首先,我们来个简单都英语填空题,这种题一般的大模型都能做对,本来就是大语言模型的强项,仅作为最基本验证,它也是没有问题的。 再看第二道题,来个脑筋急转弯,分析推理确实是一大堆的,答案也和预期一样,但是它是实打实的脑筋不转弯都从语言学等角度得出的答案,其实这里在中文语境中用脑筋急转弯思路就能很快得出答案,太阳公公嘛,那太阳肯定是男都啰。况且太阳叫做sun,儿子也读作son,也能得到印证。所以我推定它是不适合做脑筋急转弯的,起码不适合做中文的脑筋急转弯。 下一道数学题,“一口井7米深,有只蜗牛从井底往上爬,白片爬3米,晚上下坠2米。问蜗牛几天能从井里爬出来?”这里要注意解题的关键点是最后一天可能它不会滑下来了。我们看它分析,前几天都没有问题,第四天,白天爬3米,就是到了6米,晚上滑下来2米,到了第4米,第五天,白片爬3米,4+3刚好7米,所以就爬出来了,就不用考虑晚上往下滑了。所以答案是5天就能爬出去。我们看它最终做了一大堆装模作样的推理...

2024-12-26
QVQ-72B:世上唯一开源免费视觉推理大模型
这应该是当今世上唯一一个完全开源免费的视觉推理大模型,相比海外如OpenAI等贵的要命的o3模型,阿里巴巴最新推出的这个QVQ-72B视觉推理大模型遵循都是Apache 2.0的协议,也就是说权重等完全开源,如果我没有搞错的话,这应该是当今世上唯一一个完全开源免费的视觉推理大模型,它只有72B的参数量,但是它在MMLU多模态测试集和MathVision等数学视觉等测试集上的benchmarks得分却不容小觑。下面我们快速的去魔撘上玩下… 访问入口
2024-11-29
Moshi:实时语音通话大语言模型
Moshi是由法国AI研究机构Kyutai开发的实时语音对话大语言模型,被广泛认为是”语音版GPT-4o”。与传统的语音助手不同,Moshi具备真正的实时语音对话能力——它能同时理解和生成语音,支持打断、语气感知、情感表达等自然对话特征。Moshi的延迟极低(约200ms),对话体验接近真人交流。Kyutai将Moshi完全开源,包括模型权重和训练代码,这对于语音AI领域来说是一个里程碑式的事件。 访问入口

2024-12-12
Gemini 2.0:6大原生多模态炸裂新功能
Gemini 2.0 原生多模态模型炸裂功能初体验啊!它在benchmarks上有多炸裂我这就不说了,这里是迫不及待的想和大家分享它的几个炸裂功能。首先,我们进入到谷歌ai studio上进行gemini 2.0的访问,免费的credits足够我们用的了。先试下第一个功能实时语音, Hi Gemini, how are you, (Hi,I am doing great , thanks for asking, how can I help you today) can you speak faster please, (sure , …..), can you speak in a way that you are so quiet and whispering?(回答: ….) 牛逼吧? 第二个功能,视频对话。 can you let me know what i am holding now, and count number of items。 (回答:。。。。) 第三个功能,屏幕分享。 what do you see in my screen, ( i can ...
公告






