
【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载FireRedTTS3 是一款统一语音生成与编辑系统其核心RedAE 音频自编码器负责把 24kHz 原始波形压缩为25Hz 的连续语音表示Latents再无损还原回波形。本文从原理到源码带你搞懂这套「语义增强连续语音表示」为何能成为 FireRedTTS3 多语种、多方言语音克隆与编辑的关键。RedAE 是什么FireRedTTS3 的语音「翻译官」传统语音合成常把音频切成离散 token信息容易丢失。RedAEReal-valued AutoEncoder走的是另一条路——连续表示continuous representation编码器Encoder把波形压缩成低帧率的连续向量序列瓶颈Bottleneck一个仅64 维的紧凑潜空间解码器Decoder把潜向量重建回 24kHz 波形整个模块封装在 redae.py 中继承自 HuggingFace 的PreTrainedModel配置类为RedAEConfig。它像语音世界的「JPEG 压缩器」既大幅降低数据量又尽量保留语义与音色信息。25Hz 连续语音表示为什么低帧率是关键这是 RedAE 最巧妙的地方——两级降采样阶段帧率说明原始波形24000 Hz输入采样率Patchify 后50 Hz每 480 个采样点20ms作为一个 patch额外降采样后25 Hz每 2 个 50Hz 帧再合并为 1 个 25Hz 帧低帧率意味着1 秒音频仅需 25 个向量来描述序列长度大幅缩短让下游的语言模型Backbone Transformer能以极低的计算成本「读懂」整段语音同时仍能承载说话人音色、情绪等语义信息。 「语义增强」正体现在此25Hz 帧里既有内容语义又保留了说话人特征是克隆与编辑任务的基础。编码器设计480 采样点 Patchify Qwen3 骨干核心代码在RedAEAudioEncoder中流程可拆为三步。从 24kHz 波形到 50Hz 序列首先用audio.unfold()把波形切成480 采样点的块audio_patch_size480得到 50Hz 的 patch 序列再经两层Linear投影到 896 维送入Qwen3大语言模型骨干做自注意力编码xs audio.unfold(dimension1, sizeself.audio_patch_size, stepself.audio_patch_size) xs self.in_proj(xs) outs self.qwen3(inputs_embedsxs, attention_maskNone)用 CLS Token 二次降采样到 25Hz关键创新在Qwen3ClsDownsample它借鉴 BERT 的[CLS] token思想把每 2 个 50Hz 帧拼在一起附加一个可学习的 CLS token用一个小 Qwen34 层做全局注意力取最后一个位置的输出作为这 2 帧的「摘要」从而实现 50Hz → 25Hz 的平滑降采样而非粗暴的池化。最终经out_proj投影到64 维瓶颈得到(b, t//960, 64)的连续潜变量。解码器与 ISTFT 重建把 Latents 还原为音频RedAEAudioDecoder是编码器的镜像上采样先用Linear把 25Hz 潜变量翻倍回 50HzQwen3 解码用镜像的 Qwen318 层恢复细节ISTFTHead 重建这是波形还原的精髓。它不做常见的复数谱预测而是分别输出幅度谱exp激活防止溢出与相位谱cos/sin表示直接合成复数谱再用自定义的ISTFT逆短时傅里叶变换配合 Hann 窗 Overlap-Add还原成 24kHz 波形。这种「幅度 相位」参数化 可微 ISTFT 的设计让重建损失能直接反传保证音质清晰。RedAE 在 FireRedTTS3 管线中的位置RedAE 并非孤立存在它是整条合成链路的基石。在 fireredtts3_base.py 中可以看到参考音频编码RedAE.encode()把 prompt 音频压成 64 维潜变量作为克隆的音色参考PatchEncoder DiT语言模型LLM自回归预测下一段 25Hz 潜变量再由流式 DiT 头去噪波形解码RedAE.decode()把生成的潜变量还原为 24kHz 输出关键参数速览参数默认值含义audio_patch_size480每个 patch 的采样点数20ms24kHzaudio_sample_rate24000输入/输出采样率enc_extra_downsample_rate250Hz → 25Hz 二次降采样bottleneck_dim64连续潜空间维度enc_num_hidden_layers18编码器 Qwen3 层数dec_num_hidden_layers18解码器 Qwen3 层数hidden_size896Qwen3 隐藏维度这些默认值集中定义在 redae.py 的RedAEConfig中方便按需调整。总结FireRedTTS3 的 RedAE 音频自编码器用Patchify Qwen3 骨干 CLS 降采样三板斧把 24kHz 波形压缩成信息密集的25Hz、64 维连续表示再用镜像结构 可微 ISTFT 高保真还原。正是这套「语义增强连续语音表示」支撑起了 FireRedTTS3 在 24 种语言、21 种中文方言上的零样本语音克隆以及自然语言驱动的音色设计与语音编辑能力。理解 RedAE也就抓住了整个 FireRedTTS3 架构的「咽喉要道」。赞分享【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载相关推荐GTCRN 流式语音增强 Dart 示例深度解析GTCRN 流式语音增强 Dart 示例深度解析 技术要点速览 模型 gtcrn_simple.onnx GTCRN 流式语音增强模型16 kHz 单声人工智能语音音频本地部署DeepFilterNet3语音降噪终极指南48kHz实时音频增强深度解析DeepFilterNet3语音降噪终极指南48kHz实时音频增强深度解析 在当前远程通信和语音AI应用日益普及的背景下DeepFilterNet3语音降噪人工智能语音音频深度学习预训练DualCodec 实战指南基于 Amphion 的低帧率语义增强神经音频编解码器DualCodec 实战指南基于 Amphion 的低帧率语义增强神经音频编解码器 本文围绕 Amphion 仓库中的 DualCodec 模块 model音频语音媒体生成深度学习创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考