nari-lab dia:能生成笑声咳嗽的开源TTS工具!
发表于|更新于|音频工具
今天的AI日报分享了可以生成笑声和咳嗽等的开源TTS项目DIA, 这么牛,肯定得去demo下了。 我们先来到github对应的repo看下,它在hugging face有提供托管,一会可以上去玩下。 如果想自己部署的,看快速入门这里,没有几步的。好,我们去到hugging face上…
相关推荐
2026-01-09
Chatterbox:开源版 11 Labs!支持中文情绪语气!
我们都知道海外的 ElevenLabs 很牛逼,是 AI 语音方面的翘楚,但可惜价格不菲。今天大家走运了,刚淘到个开源免费的平替,新出来的,叫做 … 访问入口
2026-01-27
开源最强声音克隆!Qwen 3 TTS!
Qwen3-TTS是通义千问(Qwen)开源的最强声音克隆TTS(文本转语音)系统。你只需提供几秒钟的语音样本,Qwen3-TTS就能精准克隆该声音,并用这个声音朗读任意文本。合成效果极其自然——包括语调、停顿、情感表达都接近真人。与其他声音克隆方案相比,Qwen3-TTS在中文语音合成方面表现尤为出色。完全开源免费,支持本地部署。本视频详细介绍安装使用方法和效果测评。 访问入口
2025-11-24
手动RAG已死!凶手是谷歌!
这两天都在谈微调和RAG,其实一个好的RAG搭建起来还是需要点技术的,比如你首先要去对文档分片,然后要找到好的word embeddings词向量数据库来将你文档分片进行向量化,好进行检索。 然而,正是这些对分片策略、向量模型选择以及高昂数据库运维的持续投入,让许多希望快速部署知识问答系统的开发者望而却步。Google 文件搜索 API 的推出,正是为了终结这种复杂性。这项集成在 Gemini API 中的托管式 RAG 解决方案,将所有繁琐的底层工程——包括智能分块、高性能向量嵌入和索引管理——全部自动化封装,让您无需再为此耗费精力。它不仅提供了企业级的 RAG 能力,更以颠覆性的成本结构改变了游戏规则:文档存储完全免费,您只需为计算嵌入和模型使用检索到的上下文付费,极大地降低了应用的边际成本…展开更多 文档入口
2025-11-24
Claude Code怎么用国内模型?其实很简单!
今天和朋友聊天,发现他竟然不知道claudecode不是一定要用claude模型的,他也是搞软件开发的,让我有点诧异,如果他都不知道,那我相信还有很多其他朋友可能也不清楚,所以这里简单跟大家说下怎么做…

2025-04-16
Minimax Audio:免费克隆自己声音!
minimax推出免费声音克隆工具啊!提minimax可能有些朋友没有听过,但是提海螺AI的话,相信没有谁不知道的。而海螺AI就是Minimax搞出来的。今天要分享的就是minimax最新推出的Audio功能,大家既可以在海螺上玩,也可以在minixmax io上玩。但是海螺上是没有声音克隆的,所以我这次demo呢就到minimax io上… 访问入口
2025-08-13
GLM 4.5V:AI视觉革命!开源即巅峰!
太炸裂了!上两周我才分享了智普AI的GLM 4.5表现不俗,这两天它们又发布了全新的开源视觉语言大模型GLM 4.5V。这款模型并非等闲之辈,它基于GLM 4.5 Air架构,拥有高达1060亿的庞大参数量,并激活120亿参数进行推理。在MMBench、MathVista及OCRBench等多项权威视觉基准测试中,GLM-4.5V均取得了接近90分的顶尖成绩,全面展示了其技术硬实力展开更多 访问入口
公告






