#语音合成

阿里 CosyVoice Studio 实测:一站式 AI 语音平台,能听能说能聊
8 月初,阿里接连发布多个重磅产品。 千问办公开启公测,对标 WorkBuddy;Qwen3.8-Max 正式上线,总参数量 2.4 万亿;视频生成模型 Wan3.0 开启公测,单次可生成 30 秒视频。 不过最值得关注的是阿里新上线的 C…
Qwen-Audio-3.0-TTS 发布:16 语种+20 方言的开源 TTS 模型,Artificial Analysis 榜单夺冠
阿里云发布了 Qwen-Audio-3.0-TTS 实时语音合成模型,包含两个版本:Flash(面向实时交互,首包延迟约 300ms)和 Plus(面向高质量生成,自然度和音色还原度更优)。在全球第三方权威榜单 Artificial Ana…
Out Loud:免费开源、本地离线、注重隐私的 AI 语音合成工具,内置 50 种自然人声,支持 8 种语言
Out Loud 是一款免费开源的 AI 文本转语音工具。它完全离线运行,保护用户隐私,无需联网即可将文本转换为自然语音。适用于阅读文章、文档等场景,提供 50 多种语音和 8 种语言支持。 Out Loud功能 完全离线运行:所有处理…
7款免费文本转语音工具盘点,效果堪比付费软件
想做短视频配音,又不想花钱买专业配音软件?这两年免费 TTS 工具的进步非常大,一年前还是电子音,现在不少工具的还原度已经能媲美付费产品了。 以下是 7 款真正好用的免费文本转语音工具,按场景分类推荐。 TTSMaker(马克配音)&mda…
GPT-SoVITS声音克隆实战,从安装到一键调用的完整教程
不需要先成为语音算法工程师。准备一段自己的录音,再找一个能够操作终端和浏览器的 AI Agent,你就可以把 GPT-SoVITS 安装、训练和封装成日常可调用的工具。 最近我完整体验了一次 GPT-SoVITS:从下载安装到第一次语音合成…
VoxCPM2:国产开源 2B 参数 TTS 模型,支持 30 种语言与语音克隆
VoxCPM2:国产开源 2B 参数 TTS 模型,支持 30 种语言与语音克隆 OpenBMB 团队发布了 VoxCPM2 文本转语音(TTS)模型。该模型拥有 2B 参数,支持语音克隆、语音设计和高质量语音合成,涵盖英文、中文、日语、韩…
Gemini 3.1 Flash TTS 实测:3 个避坑指南 +2 个 Audio Tags 神技详解
苏米注:Gemini 3.1 Flash TTS 发布后,我花了 3 小时深度测试,发现了 3 个官方没说清楚的坑和 2 个实用神技。今天这篇文章帮你避开这些坑,同时充分利用它的强大功能。 一、坑①:中文发音偶尔翻车,专业术语直接"翻译腔…
刚刚!阿里 Qwen3-TTS 发布,语音合成能力大幅提升!
继发布Z-Image(造相)广受好评后,阿里又上好货了。 就在刚刚发布 Qwen3-TTS,版本号 2025-11-27,这次更新解决了语音合成的几个核心问题。 音色大幅扩展49 种高品质音色,覆盖不同性别、年龄和角色设定。具体包括撒娇搞…
Kyutai TTS:一款开源TTS文本转语音模型,超低延迟语音合成工具
Kyutai TTS 是一款针对实时应用优化的文本转语音模型。它提供超低延迟、高准确率的语音合成,并支持文本流式输入和长音频生成,适用于各种需要实时语音交互的场景,例如语音助手、实时字幕生成等。Kyutai TTS 的独特之处在于其延迟流…
UntitledPen:AI语音生成平台,文本转语音和语音转文本
UntitledPen 是一款AI语音合成工具,能为您的内容创作出自然逼真的语音。它支持文本转语音和语音转文本,并提供多种语言和音色选择,让您可以轻松创建高质量的音频内容,适用于各种场景,例如有声读物、视频配音、广告制作等。其AI辅助写作…