dots.tts - 小红书联合上海交大开源的语音合成基础模型

최신 AI 리소스3시간 전에 게시 됨 AI 공유 서클
1.1K 00
堆友AI

dots.tts是什么

dots.tts 是小红书 dots 团队(rednote-hilab)与上海交大 X-LANCE 实验室联合研发的 20 亿参数全连续端到端自回归语音合成基础模型,架构为「语义编码器 + Qwen2.5-1.5B 大模型 + 自回归流匹配声学头」,运行于 48kHz AudioVAE 之上,全程不使用离散 token,支持 24 种语言和零样本声音克隆。在 Seed-TTS-Eval 中英文基准上取得平均最佳成绩,多语言基准平均说话人相似度达 83.9。

dots.tts - 小红书联合上海交大开源的语音合成基础模型

dots.tts的功能特色

  • 全连续端到端架构:语义编码器 + LLM + 流匹配声学头,全程无离散 token。
  • 제로 샘플 사운드 복제:免训练克隆音色,专用 soar 检查点主打最高相似度。
  • 多语言高保真合成:支持 24 种语言,48kHz 输出,多项基准成绩领先。
  • 低延迟实时推理:MeanFlow 蒸馏版与双流版,首包延迟低至 54ms。
  • 指令式语音编辑:独立 edit 检查点,支持按指令修改语音。
  • 开源可商用与部署生态:Apache-2.0 协议,7 个检查点开放,已适配 vLLM-omni 与 MLX 等推理框架。

dots.tts的核心优势

  • 全连续技术路线:不经过离散 토큰 量化,从根源上避免信息损失,音质上限更高。
  • 基准成绩领先:Seed-TTS-Eval 平均最佳,24 语言多语言基准说话人相似度 83.9 居同期最优。
  • 克隆与一致性强:流匹配头利用全历史条件,长语音音色韵律稳定;soar 检查点专攻高相似度克隆。
  • 实时性突出:MeanFlow 蒸馏最低 1 步去噪,双流模式首包延迟仅 54ms,可直接支撑 LLM 实时对话。
  • 一套模型覆盖全场景:基座微调、克隆、加速、双流、编辑共 7 个检查点,按需选用。
  • 开放且落地门槛低:Apache-2.0 可商用,已接入 vLLM-omni,MLX 版可在 Mac 本地运行(量化后约 2.4GB)。

dots.tts官网是什么

  • GitHub 리포지토리:https://github.com/studio-dots-ai/dots.tts
  • 허깅페이스 모델 라이브러리:https://huggingface.co/collections/dots-studio/dotstts
  • arXiv 기술 논문:https://arxiv.org/pdf/2608.02673

dots.tts的操作步骤

  • 런타임 환경 준비하기:建议用 conda 新建 Python 3.10–3.12 的独立环境。
  • 安装推理库::pip install dots.tts(PyPI)或克隆源码以可编辑模式安装。
  • 选择模型检查点:按任务在 Hugging Face 的 7 个检查点中挑选:克隆选 soar、低延迟选 mf 系列、实时对话选 stts、编辑选 edit、微调选 base.
  • 执行合成推理:三种入口任选:
    • CLI 命令行 dots.tts(支持续写式克隆、x-vector 克隆、无参考默认音色三种模式)
    • Python API(DotsTtsRuntime.generate())
    • Gradio Web Demo(apps/gradio/app.py 本地起网页)
  • 语音编辑(可选):使用独立的 dots.tts.edit 入口或 Edit Playground,上传源音频并给出标签化编辑指令。
  • 进阶定制(可选)사용 train_dots_tts.py 微调,或以 soar 为教师模型做 MeanFlow 蒸馏。
  • 服务化部署(可选):高并发场景接入 SGLang Omni(流式 PCM、连续批处理);轻量场景也可用 ComfyUI 插件或 MLX 在 Mac 本地运行。

dots.tts的适用人群

  • AI 应用开发者与创业团队:Apache-2.0 可商用、提供 Python API 与 CLI,适合快速给产品接入高质量 TTS 能力。
  • 实时语音交互产品团队:语音助手、智能客服、AI 陪伴等场景,双流模式首包延迟低至 54ms,可直接对接 LLM 流式对话。
  • 内容创作者与自媒体:视频配音、有声内容、播客等,零样本声音克隆 + 多语言 + 一键部署镜像,无需算法背景即可上手。
  • 有私有化与定制需求的企业:开源权重 + 官方微调脚本(train_dots_tts.py),可用自有数据训练专属音色并内网部署。
  • 语音算法研究者:全连续、无离散 token 的新架构路线,论文与 base 检查点开放,适合作为研究与二次开发基座。
  • 个人开发者与本地玩家:MLX 版可在 Mac 本地运行(量化后约 2.4GB),也有 ComfyUI 节点插件融入创作工作流。

dots.tts的常见问题

Q:开源吗?能商用吗?

A:可以。代码与 7 个模型检查点均以 Apache-2.0 协议发布,允许商业使用。


Q:和主流 TTS(如离散 token 方案)有何不同?

A:采用「语义编码器 + LLM + 自回归流匹配声学头」架构,运行在 48kHz AudioVAE 之上,全程不使用离散 token,避免了量化带来的信息损失。


Q:支持多少种语言?

A:24 种,含中、英、日、韩、法、德等,输出为 48kHz 高保真音频。


Q:能克隆声音吗?怎么操作?

A:支持零样本克隆,无需训练:上传几秒参考音频即可,克隆推荐使用 dots.tts-soar 检查点(说话人相似度最高)。


Q:效果如何?

A:Seed-TTS-Eval 平均最佳(中/英/难中文 WER 为 0.94% / 1.30% / 6.60%);24 语言 MiniMax 多语言基准平均说话人相似度 83.9,居同期最优。


Q:能用于实时语音对话吗?

A:可以。MeanFlow 蒸馏版 + 双流模式(mf-2steps-stts)首包延迟低至 54ms,专门面向 LLM 实时对话场景。


Q:能用自己的数据微调吗?
A:可以。官方提供 train_dots_tts.py 微调脚本,并支持以 soar 为教师模型做 MeanFlow 蒸馏,进一步压缩延迟。
© 저작권 정책

관련 문서

댓글 없음

댓글에 참여하려면 로그인해야 합니다!
지금 로그인
없음
댓글 없음...