StableLearn Logo

搜索内容

AI Tools 5 min read

【重磅发布】Fun-ASR-Nano 技术指南:端到端实时语音识别大模型

FunAudioLLM 于 2025-12-15 发布 Fun-ASR-Nano-2512:端到端语音识别大模型,支持 31 种语言、7 大方言、低延迟实时转写。本文介绍安装、推理与 VAD 结合实战。

Cover image for 【重磅发布】Fun-ASR-Nano 技术指南:端到端实时语音识别大模型

本文发布于 277 天前,内容可能已过时,请注意甄别。

1. 🚀 重磅发布:Fun-ASR-Nano-2512

2025年12月15日,FunAudioLLM 团队正式推出了 Fun-ASR-Nano-2512。这是一款经过千万小时级真实语音数据训练的端到端语音识别(ASR)大模型,专为高精度、低延迟场景设计。

核心亮点

  • 极致性能:支持低延迟实时转写,具备强大的上下文理解能力。
  • 全能覆盖
    • 31 种语言:重点优化东亚、东南亚语言,支持中英日韩等混合识别。
    • 7 大方言:吴语、粤语、闽南语、客家话、赣语、湘语、晋语。
    • 26 种口音:覆盖河南、陕西、四川、重庆、云贵广等 20+ 地区口音。
  • 抗噪能力:针对远场、高噪环境(会议室、车载、工业现场)深度优化,识别率高达 93%
  • 音乐歌词识别:即使在背景音乐干扰下,也能准确识别歌词内容。

官方资源直达:


2. 环境安装

Fun-ASR 的部署非常简洁,建议使用 Python 3.8+ 环境。

   # 1. 克隆代码或直接安装依赖
pip install -r requirements.txt

# 或者手动安装核心库 (FunASR)
pip install funasr modelscope

注意

  • 推荐使用 GPU 进行推理,请确保安装了与 CUDA 版本匹配的 torch
  • Windows 用户建议使用 Conda 环境管理依赖。

3. 快速上手:AutoModel 推理

官方推荐使用 AutoModel 接口,它会自动处理模型下载与加载,代码最简。

3.1 基础识别示例

   from funasr import AutoModel

def main():
    # 指定 ModelScope 模型 ID,自动下载
    model_dir = "FunAudioLLM/Fun-ASR-Nano-2512"
    
    # 初始化模型
    # trust_remote_code=True 是必须的,因为 Nano 模型包含自定义代码
    model = AutoModel(
        model=model_dir,
        trust_remote_code=True,
        remote_code="./model.py",  # 加载模型自定义实现
        device="cuda:0",           # 使用 GPU,CPU 可改为 "cpu"
    )

    # 推理音频
    wav_path = f"{model.model_path}/example/zh.mp3"
    res = model.generate(input=[wav_path], cache={}, batch_size=1)
    
    print("识别结果:", res[0]["text"])

if __name__ == "__main__":
    main()

3.2 进阶:结合 VAD (语音活动检测)

对于长音频,建议结合 VAD 模型进行切分,以提高识别准确率和稳定性。Fun-ASR 无缝集成了 fsmn-vad

       # 初始化带 VAD 的模型
    model = AutoModel(
        model=model_dir,
        trust_remote_code=True,
        vad_model="fsmn-vad",
        vad_kwargs={"max_single_segment_time": 30000}, # 最大单段时长 30s
        remote_code="./model.py",
        device="cuda:0",
    )
    
    res = model.generate(input=[wav_path], cache={}, batch_size=1)
    print("VAD + ASR 结果:", res[0]["text"])

4. 直连推理模式 (Direct Inference)

如果你需要更底层的控制,或者希望绕过 AutoModel 的封装,可以直接调用 FunASRNano 类。

   from model import FunASRNano

def main():
    model_dir = "FunAudioLLM/Fun-ASR-Nano-2512"
    # 加载模型
    m, kwargs = FunASRNano.from_pretrained(model=model_dir, device="cuda:0")
    m.eval()

    # 推理
    wav_path = f"{kwargs['model_path']}/example/zh.mp3"
    res = m.inference(data_in=[wav_path], **kwargs)
    
    # 结果提取方式略有不同
    print("直连推理结果:", res[0][0]["text"])

if __name__ == "__main__":
    main()

5. 常见参数说明

参数说明
model_dir模型名称(ModelScope ID)或本地路径
trust_remote_code必须设为 True 以加载 Nano 模型的自定义架构
remote_code指定模型实现代码位置,通常为 ./model.py
devicecuda:0 (GPU) 或 cpu
vad_model推荐使用 fsmn-vad 进行长音频切分
batch_size批处理大小,根据显存调整,默认为 1

6. 总结

Fun-ASR-Nano-2512 的发布填补了高性能、多语种、抗噪 ASR 模型的空白。结合 CosyVoice 3.0,FunAudioLLM 家族现在提供了一套完整的“听(ASR)”与“说(TTS)”解决方案,非常适合构建全双工语音助手、数字人交互等应用。

分享文章

更多文章

相关文章

暂无相关文章