10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI学习教程

本地离线语音方案:SenseVoiceSmall + MeloTTS 组合实战指南

1月前 AI学习教程 388 0

本地离线语音方案一直是开发者的痛点。云端语音服务虽然方便,但在电梯、地下车库、飞机上等无网场景完全失效。本文对比并推荐了"SenseVoiceSmall(语音识别)+ MeloTTS(语音合成)"组合,两个模型加起来不到 500MB,在普通 CPU 上即可实时运行。

一、模型选型对比

语音识别(ASR)

SenseVoiceSmall 是最优解:242MB 的 ONNX 量化版,中文准确率 95%+,非自回归架构比 Whisper 快 15 倍,支持中/英/粤/日/韩,且完全不需要 GPU。

语音合成(TTS)

MeloTTS 日常全覆盖:192MB 纯 ONNX,CPU 秒级合成,中英混读自然流畅。需要克隆特定人声时可换 CosyVoice2。

二、为什么小模型比大模型更好用?

1. 速度才是硬道理

Whisper-large-v3 是自回归模型,1 分钟音频可能要 30 秒。SenseVoiceSmall 是非自回归模型,同样音频 不到 2 秒 完成。差了 15 倍。

2. 中文场景更优

SenseVoice 和 Paraformer 是阿里达摩院出品,针对中文优化。AISHELL 测试集上,Paraformer 的字符错误率(CER)仅 1-2%。

3. 量化无损

SenseVoiceSmall 的 ONNX 量化版(242MB)与原始 funasr 版(940MB)准确率几乎无差别,推理速度提升 30% 以上。

三、跑通本地语音识别

1. 安装依赖

pip install funasr
pip install onnxruntime
pip install modelscope

2. 下载模型

from modelscope import snapshot_download

model_dir = snapshot_download(
    "FunAudioLLM/SenseVoiceSmall",
    cache_dir="./models"
)

3. 转写脚本

from funasr import AutoModel

model = AutoModel(
    model="./models/SenseVoiceSmall",
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
)

result = model.generate(
    input="test_audio.wav",
    language="auto",
    use_itn=True,
)

print(result[0]["text"])

4. 实时麦克风识别

使用 pyaudio 采集 16kHz 音频,每累积 2 秒调用 model.generate 即可实现实时转写。

四、跑通本地语音合成

pip install melotts
from melo.api import TTS

model = TTS(language='ZH_MIX_EN')

text = "你好世界!This is a test. 效果真的很不错!"
model.tts_to_file(text=text, speaker_id=0, output_path="output.wav", speed=1.0)

MeloTTS 支持 ZH / ZH_MIX_EN / EN / JP / KR / ES / FR。

五、ASR + TTS 串联

将识别与合成串联,即可构建完整的语音助手。结合 sounddevice 录音播放,实现"听-处理-说"闭环。

六、多模型切换

如需更高准确率,可切换到 Paraformer,只需改一行代码:

model = AutoModel(
    model="paraformer-zh",
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
)

七、避坑指南

  • 音频采样率:SenseVoice 要求 16kHz 单声道,需用 librosa 或 ffmpeg 重采样。
  • 长音频切分:启用 VAD 自动切分,避免 OOM。
  • TTS 语速:speed 参数建议保持在 0.8-1.2 之间,过快会导致中文部分模糊。

八、方案总结

场景 ASR TTS 大小
日常语音助手 SenseVoiceSmall MeloTTS ~434MB
高精度转写 Paraformer-zh MeloTTS ~1.1GB
极致轻量 sherpa-onnx-small MeloTTS ~300MB
声音克隆 SenseVoiceSmall CosyVoice2 ~1.2GB

核心优势:完全离线、中英混合、CPU 实时、模型小巧、开源免费。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:本地离线语音方案:SenseVoiceSmall + MeloTTS 组合实战指南
#语音识别 #TTS #SenseVoice #MeloTTS #离线AI #本地部署 
收藏 1
8 个 GitHub 神级开源项目推荐:让 AI 生成网页告别千篇一律的模板感
Wechatsync 开源工具:自媒体内容一键多平台同步发布指南
推荐阅读
  • Hermes Agent v0.10.0 从入门到精通,支持 MCP 协议与 16 个消息平台
  • Cherry Studio + Skills 技能大公开(附 Agent 设计教程)
  • Claude Code 接入国产模型报 400?保姆级降级教程帮你解决
  • 手把手教你用阿里云服务器+百炼Coding Plan,超低成本搭建OpenClaw智能助手实操指南
  • 腾讯文档接入 WorkBuddy,AI 知识库打通后的工作流上手指南
评论 (0)
请登录后发表评论
分类精选
Cursor永久免费攻略:无限邮箱注册+重置机器码+Cursor试用期重置工具实现永久免费使用
50853 1年前
手把手教你如何使用扣子Coze搭建“文生图” AI Bot
21957 2年前
n8n新手入门指南:5 分钟本地部署 + 中文汉化 + 快速启动,玩转工作流(Docker版)
20323 1年前
安装字节Trae登录提示App Unavailable(应用程序不可用)解决办法,这份官方指南请收好!
19545 1年前
零基础上手 VSCode + Claude Code + GLM-4.6 保姆级安装配置教程
18232 10月前
手把手教你用国内VISA信用卡直接订阅ChatGPT、Claude、Google Gemini等海外AI服务
17600 7月前
Gemini CLI 装好了,登录异常怎么办?手把手教你解决 Gemini CLI 登录问题
17490 1年前
AI 概念篇:Token是什么?一文讲清楚Token分词、窗口、计费与常用计算工具
16799 8月前
一文搞懂什么是 Vibe Coding?Vibe Coding工具推荐及Cursor编程开发实践
16070 1年前
手把手教你使用 Gemini 2.5 Pro 免费 API搭建本地知识库,一键接入 Gemini!
15534 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 MiniMax-H3 视频提示词写作教程:T2VA/I2VA/FL2VA/L2VA 四种任务全解析
2 Higgsfield 开源 AI 长视频制作全流程:95 分钟 AI 电影,50 万美金制作费全公开
3 NAS 本地部署 llama.cpp 教程:Vulkan 核显加速,流畅运行 Qwen3.5 模型
4 MiniMax H3 本地部署教程:RTX 3060 即可运行,0 成本制作 AI 漫剧
5 Cherry Studio V2 进阶玩法:Agent 自主执行、MCP 集成与 Skill 生态
6 Modal 每月免费 30 美元:轻松部署 Kimi K3 等开源模型
7 Claude Code 接入免费 Kimi K3,Modal 平台每月 30 美元额度教程
8 DeepSeek V4-Flash 接入 Codex:一行命令配置,性价比对标 GPT-5.6 Luna
9 Trae官方知识库开源:40万字场景化教程覆盖30+工作场景
10 用 TRAE Work 搭建科技媒体研究助理:规则+技能+自动化
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联