[!IMPORTANT] 许可证声明
本代码库及其相关模型权重依据 FISH AUDIO RESEARCH LICENSE 发布。请参阅 LICENSE 以获取更多详情。我们将对任何违反许可证的行为采取行动。
[!WARNING] 法律免责声明
我们对本代码库的任何非法使用不承担任何责任。请参阅您所在地的 DMCA 及其他相关法律。
快速开始
面向人类
以下是 Fish Audio S2 的官方文档,请按照说明轻松开始使用。
[!IMPORTANT] 对于 SGLang 服务器,请阅读 SGLang-Omni README。
对于 vLLM Omni 服务器,请阅读 vLLM-Omni Fish Speech S2 Pro Recipe 和 用户指南。
面向 LLM Agent
Install and configure Fish-Audio S2 by following the instructions here: https://speech.fish.audio/install/
Fish Audio S2 Pro
最先进的多语言文本转语音(TTS)系统,重新定义语音生成的边界。
Fish Audio S2 Pro 是由 Fish Audio 开发的最先进的多模态模型。S2 Pro 在覆盖超过 80 种语言 的 1000 万小时 以上音频数据上进行训练,结合 双自回归(Dual-AR) 架构与强化学习(RL)对齐,生成极其自然、逼真且情感丰富的语音,在开源和闭源系统中均处于领先地位。
S2 Pro 的核心优势在于其支持使用自然语言标签(例如,[whisper], [excited], [angry])对韵律和情感进行 子词级别 的细粒度控制,同时原生支持多说话人和多轮对话生成。
访问 Fish Audio 网站 体验实时演示,或阅读我们的 技术报告 和 博客文章 以获取更多详情。
模型变体
| 模型 | 规模 | 可用性 | 描述 |
|---|---|---|---|
| S2-Pro | 4B 参数 | HuggingFace | 功能齐全的旗舰模型,具有最高的质量和稳定性 |
有关模型的更多详细信息,请参阅 技术报告。
基准测试结果
| 基准测试 | Fish Audio S2 |
|---|---|
| Seed-TTS Eval — WER (Chinese) | 0.54% (best overall) |
| Seed-TTS Eval — WER (English) | 0.99% (best overall) |
| Audio Turing Test (with instruction) | 0.515 posterior mean |
| EmergentTTS-Eval — Win Rate | 81.88% (highest overall) |
| Fish Instruction Benchmark — TAR | 93.3% |
| Fish Instruction Benchmark — Quality | 4.51 / 5.0 |
| Multilingual (MiniMax Testset) — Best WER | 11 of 24 languages |
| Multilingual (MiniMax Testset) — Best SIM | 17 of 24 languages |
在 Seed-TTS Eval 中,S2 在所有受测模型(包括闭源系统)中实现了最低的 WER:Qwen3-TTS (0.77/1.24)、MiniMax Speech-02 (0.99/1.90)、Seed-TTS (1.12/2.25)。在 Audio Turing Test 中,0.515 比 Seed-TTS (0.417) 高出 24%,比 MiniMax-Speech (0.387) 高出 33%。在 EmergentTTS-Eval 中,S2 在副语言特征(91.61% 胜率)、问题(84.41%)和句法复杂度(83.39%)方面取得了尤为强劲的成绩。
亮点
通过自然语言实现细粒度内联控制
S2 Pro 为语音带来了前所未有的“灵魂”。使用简单的 [tag] 语法,您可以在文本的任意位置精确嵌入情感指令。
- 支持 15,000+ 个独特标签:不仅限于固定预设;S2 支持自由形式的文本描述。尝试使用
[whisper in small voice]、[professional broadcast tone]或[pitch up]。 - 丰富的表情库:
[pause][emphasis][laughing][inhale][chuckle][tsk][singing][excited][laughing tone][interrupting][chuckling][excited tone][volume up][echo][angry][low volume][sigh][low voice][whisper][screaming][shouting][loud][surprised][short pause][exhale][delight][panting][audience laughter][with strong accent][volume down][clearing throat][sad][moaning][shocked]
创新的双自回归(Dual-AR)架构
S2 Pro 采用主从式 Dual-AR 架构,由一个仅解码器的 transformer 和一个 RVQ 音频编解码器(10 个码本,约 21 Hz)组成:
- 慢速 AR(4B 参数):沿时间轴运行,预测主要语义码本。
- 快速 AR(400M 参数):在每个时间步生成其余 9 个残差码本,重建精致的声学细节。
这种非对称设计在显著提升推理速度的同时,实现了峰值音频保真度。
强化学习(RL)对齐
S2 Pro 采用 组相对策略优化(GRPO) 进行后训练对齐。我们直接使用同一套模型进行数据清洗和标注,并将其作为奖励模型,完美解决了预训练数据与后训练目标之间的分布不匹配问题。
- 多维奖励信号:全面评估语义准确性、指令遵循度、声学偏好评分和音色相似度,确保生成的每一秒语音都符合人类的直觉。
极致流式性能(由 SGLang 提供支持)
由于 Dual-AR 架构在结构上与标准 LLM 同构,S2 Pro 原生支持所有 SGLang 推理加速特性,包括连续批处理(Continuous Batching)、分页 KV 缓存(Paged KV Cache)、CUDA 图(CUDA Graph)以及基于 RadixAttention 的前缀缓存(Prefix Caching)。
在单张 NVIDIA H200 GPU 上的性能:
- 实时因子(RTF):0.195
- 首音频时间(TTFA):~100 ms
- 极致吞吐量:在保持 RTF < 0.5 的同时,达到 3,000+ 声学 token/s
强大的多语言支持
S2 Pro 支持 80 多种语言,无需音素或特定语言的前处理:
- Tier 1: 日语 (ja), 英语 (en), 中文 (zh)
- Tier 2: 韩语 (ko), 西班牙语 (es), 葡萄牙语 (pt), 阿拉伯语 (ar), 俄语 (ru), 法语 (fr), 德语 (de)
- Global Coverage: sv, it, tr, no, nl, cy, eu, ca, da, gl, ta, hu, fi, pl, et, hi, la, ur, th, vi, jw, bn, yo, xsl, cs, sw, nn, he, ms, uk, id, kk, bg, lv, my, tl, sk, ne, fa, af, el, bo, hr, ro, sn, mi, yi, am, be, km, is, az, sd, br, sq, ps, mn, ht, ml, sr, sa, te, ka, bs, pa, lt, kn, si, hy, mr, as, gu, fo, 等。
原生多说话人生成
Fish Audio S2 允许用户上传包含多位说话者的参考音频,模型通过 <|speaker:i|> 令牌处理每位说话者的特征。随后,您可以通过说话者 ID 令牌控制模型的表现,使单次生成包含多位说话者。不再需要为每位单独的说话者上传单独的参考音频。
多轮生成
得益于模型上下文的扩展,我们的模型现在可以利用先前的信息来提升后续生成内容的表现力,从而增加对话的自然度。
快速声音克隆
Fish Audio S2 支持使用短参考样本(通常为 10-30 秒)进行精确的声音克隆。模型捕捉音色、说话风格和情感倾向,无需额外微调即可生成逼真且一致的克隆声音。 有关 SGLang Server 的使用,请参阅 SGLang-Omni README。
致谢
技术报告
@misc{fish-speech-v1.4,
title={Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis},
author={Shijia Liao and Yuxuan Wang and Tianyu Li and Yifan Cheng and Ruoyi Zhang and Rongzhi Zhou and Yijin Xing},
year={2024},
eprint={2411.01156},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2411.01156},
}
@misc{liao2026fishaudios2technical,
title={Fish Audio S2 Technical Report},
author={Shijia Liao and Yuxuan Wang and Songting Liu and Yifan Cheng and Ruoyi Zhang and Tianyu Li and Shidong Li and Yisheng Zheng and Xingwei Liu and Qingzheng Wang and Zhizhuo Zhou and Jiahua Liu and Xin Chen and Dawei Han},
year={2026},
eprint={2603.08823},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2603.08823},
}