Fish Speech

English | 简体中文 | Portuguese | 日本語 | 한국어

Discord

Docker

Huggingface

此代码库及模型根据 CC-BY-NC-SA-4.0 许可证发布。请参阅 LICENSE 了解更多细节.

特性

零样本 & 小样本 TTS：输入 10 到 30 秒的声音样本即可生成高质量的 TTS 输出。详见语音克隆最佳实践指南。
多语言 & 跨语言支持：只需复制并粘贴多语言文本到输入框中，无需担心语言问题。目前支持英语、日语、韩语、中文、法语、德语、阿拉伯语和西班牙语。
无音素依赖：模型具备强大的泛化能力，不依赖音素进行 TTS，能够处理任何文字表示的语言。
高准确率：在 5 分钟的英文文本上，达到了约 2% 的 CER（字符错误率）和 WER（词错误率）。
快速：通过 fish-tech 加速，在 Nvidia RTX 4060 笔记本上的实时因子约为 1:5，在 Nvidia RTX 4090 上约为 1:15。
WebUI 推理：提供易于使用的基于 Gradio 的网页用户界面，兼容 Chrome、Firefox、Edge 等浏览器。
GUI 推理：提供 PyQt6 图形界面，与 API 服务器无缝协作。支持 Linux、Windows 和 macOS。查看 GUI。
易于部署：轻松设置推理服务器，原生支持 Linux、Windows 和 macOS，最大程度减少速度损失。

免责声明

我们不对代码库的任何非法使用承担任何责任. 请参阅您当地关于 DMCA (数字千年法案) 和其他相关法律法规.

在线 DEMO

快速开始本地推理

inference.ipynb

视频

1.4 介绍: https://www.bilibili.com/video/BV1pu46eVEk7

1.2 介绍: https://www.bilibili.com/video/BV1wz421B71D

1.1 介绍: https://www.bilibili.com/video/BV1zJ4m1K7cj

文档

例子 (2024/10/02 V1.4)

鸣谢

赞助

数据处理服务器由 6Block 提供

Fish Audio 在线推理与 Lepton 合作