OpenBMB 一系面向高效语音的模型;适合关注中文社区与轻量部署方案、希望与 CPM / 工具链协同的读者。
相关检索与扩展主题
若你在找「最好的 tts 模型」「免费 tts 模型」:开源权重可在下文仓库与 HF TTS 列表横向对比;云端付费接口的质量/速度/价格可参考 Artificial Analysis。「免费」多指可自托管的开放权重,能否商用仍以各模型 License 为准。
「最好的语音识别模型」「免费语音识别模型」属于 ASR(语音转文字),与本文 TTS 方向相反,请到 Hugging Face 的语音识别任务筛选:https://huggingface.co/models?pipeline_tag=automatic-speech-recognition(常见如 Whisper 系及多语种流式模型)。
「字幕生成模型」「免费字幕生成模型」在工程上多为 ASR + 时间轴对齐,可选机器翻译或大模型润色;通常先选 ASR 再组字幕管线,而非单一「字幕模型」名称。
更多模型与商业 API 对比
- 开源列表(按任务筛选):https://huggingface.co/models?pipeline_tag=text-to-speech
- 大模型 / 云 API 质量·速度·价格对照(第三方评测):https://artificialanalysis.ai/text-to-speech/models?price=speed-vs-price — Artificial Analysis 的 TTS 独立对比与 Speech Arena 类指标,适合评估付费接口与产品选型。
下列开源仓库(节选)
点击仓库名在 Hugging Face 打开模型卡、推理示例与许可证说明。下载量与点赞数为页面编写时常见量级,以官网为准。
来自 k2-fsa(与语音识别、流式推理生态相关)的语音方向模型,在 HF 上互动量高,适合已有 Next-gen Kaldi / sherpa-onnx 等链路、想做端侧或流式场景的用户调研。
MOSS 团队的超小参数量(约 100M 级)TTS,便于教学、实验与资源紧张环境;同系列另有更大或实时变体可在组织页浏览。
Mistral 推出的 Voxtral 语音模型(约 4B),与 Mistral 生态、许可证与 API 策略一并发布;适合已使用 Mistral 产品栈的团队评估统一供应商。
仅约 82M 参数却长期位居 TTS 下载前列,推理轻量、社区衍生多(多语言、ONNX、MLX 等端口常见)。适合「先要跑起来」的原型与本地朗读场景。
微软 VibeVoice 系列中偏生成质量的规格之一(模型卡标注参数量级以 HF 为准),适合关注大厂开放权重与论文配套实现的开发者。
Fish Audio 的 S2 Pro(大参数量级),面向高自然度与多说话人 / 多语言等能力;常与 Fish 系工具链、API 与社区 Space 一起评估。
同系列中强调低延迟、实时交互的较小规格,适合语音对话、陪伴式应用与边生成边播放的工程验证。
通义 Qwen3 语音方向开源权重之一,强调采样率与自定义音色 / 语音克隆等能力(以官方 README 与协议为准);适合与 Qwen 语言模型、工具链一起做产品原型。
使用提示
开源权重不等于「可任意商用」:请在各模型卡的 License 与声纹数据来源说明中自行合规审查。云端 API 的报价与 SLA 以各云厂商为准;Artificial Analysis TTS 对比页便于横向浏览质量、速度、每百万字符价格等维度,与 HF 开源列表互补。