Metadata-Version: 2.5
Name: fireredtts3-mnn
Version: 0.2.0
Summary: FireRedTTS3 zero-shot TTS on MNN int8 (CPU, torch-free, ~4x faster)
License: Apache-2.0
Requires-Python: >=3.10
Requires-Dist: huggingface-hub
Requires-Dist: mnn
Requires-Dist: numpy
Requires-Dist: tokenizers
Description-Content-Type: text/markdown

# fireredtts3-mnn

FireRedTTS3（零样本语音克隆 / 多语言 TTS）的 MNN 部署：ONNX → MNN 分段转换 + int8 权重量化（`--weightQuantBits 8`），纯 CPU、无 torch 依赖，相比 MNN fp32 基线约 **3.6 倍加速**。

## 一键运行（uvx）

```sh
uvx fireredtts3-mnn
```

首次运行自动从 Hugging Face 下载 tokenizer（~11MB）与 MNN w8 权重量化产物（~4.7GB），然后启动 HTTP TTS 服务：

```
POST /tts
{
  "text": "今天天气很好，我们一起去公园散步吧。",
  "prompt_text": "参考音频对应的文本",
  "prompt_audio_b64": "<参考音频 wav 的 base64>",
  "prompt_audio_sr": 16000,
  "language": "Chinese"        # 可选，默认 Chinese
}
-> {"audio_b64": "<合成 wav base64>", "sample_rate": 24000}

GET /health
```

单次合成（不启动服务）：

```sh
uvx fireredtts3-mnn --text "你好世界" --prompt-wav ref.wav --prompt-text "参考文本" --out gen.wav
```

## 模型目录

默认缓存到 `~/.cache/fireredtts3-mnn`：
- `weights/` 文本 tokenizer（来自 `FireRedTeam/FireRedTTS3`，运行时为纯 numpy，无需原始权重）
- `mnn/` 转换产物（19 个分段 MNN：campp / redae 编解码 / patch_encoder / dit / 线性头 / embed / norm / prefill_seg1-4 / step_seg1-4，backbone 8.5GB 拆 8 段解决 MNNConvert 无法读 ONNX external data 与 protobuf 2GB 上限）

产物仓库默认 `yunfengwang/fireredtts3-mnn`（w8 权重量化版），可用环境变量覆盖：

```sh
export FIREREDTTS3_MNN_REPO="your-hf-account/fireredtts3-mnn"
```

`HF_ENDPOINT` 环境变量可走 HF 镜像（hf-mirror.com）。

## 转换流程（复现）

```sh
# 1) PyTorch -> ONNX 分段导出（export_split.py：手写层 _LayerCore + dynamo，opset 18）
# 2) inline 合并（inline_onnx.py，<2GB 内联单文件）
# 3) ONNX -> MNN（convert_mnn.py --weight-quant-bits 8 或 fp32）
```

注：本机环境 mnnquant（全 int8 激活+权重）C++ 崩溃不可用，当前发布 w8 权重量化版；
若目标环境 mnnquant 可用，可用 make_calib.py 生成校准数据后做全量 int8。
