ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何用 Qwen3-ASR 生成词级时间戳:Qwen3-ForcedAligner 字幕对齐完整教程

如何用 Qwen3-ASR 生成词级时间戳:Qwen3-ForcedAligner 字幕对齐完整教程 如何用 Qwen3-ASR 生成词级时间戳Qwen3-ForcedAligner 字幕对齐完整教程【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR 想给语音自动生成逐词时间戳、一键产出字幕本文带你用最简单的步骤通过 Qwen3-ASR 及其Qwen3-ForcedAligner强制对齐模型把「音频 文本」对齐成毫秒级的词级时间戳轻松解决字幕制作、歌词同步、语音分析三大难题。一、3 分钟搞懂 Qwen3-ASR 时间戳方案Qwen3-ASR 是阿里云 Qwen 团队开源的语音识别模型家族包含三个核心模型模型角色一句话说明Qwen3-ASR-1.7B / 0.6B语音识别支持 30 种语言 22 种中文方言识别出文本与语种Qwen3-ForcedAligner-0.6B强制对齐非自回归模型把「文本 音频」对齐出字/词级时间戳 核心理解ASR 负责「听懂说了什么」ForcedAligner 负责「精确定位每个字/词什么时候说的」。两者组合就是完整的语音转字幕流水线。关键能力速览✅ 对齐11 种语言中、英、粤、法、德、意、日、韩、葡、俄、西语✅ 单段音频最长5 分钟超过会自动切片对齐再拼接✅ 时间精度极高官方基准平均绝对误差AAS仅33~43 毫秒远优于 WhisperX 等工具✅ 支持本地路径 / URL / base64 / 内存波形 4 种音频输入✅ 支持批量推理二、最快配置方法一键安装 qwen-asr 包在干净的 Python 3.12 环境中安装避免依赖冲突conda create -n qwen3-asr python3.12 -y conda activate qwen3-asr pip install -U qwen-asr⚡ 建议GPU 显存充足时再装 FlashAttention 2 可显著降低显存占用并加速对齐模型pip install -U flash-attn --no-build-isolation模型权重在首次加载时会自动下载如需手动下载如离线环境可用 ModelScope 或 Hugging Face 的 CLI 提前拉到本地目录。三、路径 A单独使用 Qwen3ForcedAligner 对齐已有文本当你已经有转录文本或想用其他工具/人工校对过的文本只需 3 步就能拿到时间戳。完整示例见 examples/example_qwen3_forced_aligner.pyimport torch from qwen_asr import Qwen3ForcedAligner # 第 1 步加载对齐模型 model Qwen3ForcedAligner.from_pretrained( Qwen/Qwen3-ForcedAligner-0.6B, dtypetorch.bfloat16, device_mapcuda:0, ) # 第 2 步传入音频 文本 语种执行强制对齐 results model.align( audiospeech.wav, # 也支持 URL、base64、(np.ndarray, sr) text甚至出现交易几乎停滞的情况。, languageChinese, ) # 第 3 步读取每个词的时间戳 print(results[0][0].text, results[0][0].start_time, results[0][0].end_time) 批量对齐audio、text、language都支持传入列表一次对齐多条音频且列表内输入类型可混用URL base64 内存波形混合都没问题。四、路径 BASR 时间戳一步到位推荐 ⭐更省事的做法初始化 Qwen3-ASR 时直接挂载对齐模型转写时开启时间戳开关一条命令搞定「识别 对齐」import torch from qwen_asr import Qwen3ASRModel model Qwen3ASRModel.from_pretrained( Qwen/Qwen3-ASR-1.7B, dtypetorch.bfloat16, device_mapcuda:0, forced_alignerQwen/Qwen3-ForcedAligner-0.6B, # 关键挂载对齐器 forced_aligner_kwargsdict(dtypetorch.bfloat16, device_mapcuda:0), ) results model.transcribe( audio[speech_zh.wav, speech_en.wav], languageNone, # None 自动检测语种 return_time_stampsTrue, # 关键开启时间戳输出 ) for r in results: print(r.language, r.text, r.time_stamps[0])✨ 这个「一体化」模式还内置了三大贴心机制源码位于 qwen_asr/inference/qwen3_asr.py长音频自动切片超 5 分钟的音频会按能量低谷智能切分逐段对齐后再按偏移量拼回全程无缝时间自动偏移校正每片的时间戳会自动加回原始音频中的偏移保证全局时间轴正确语种自动传递识别出的语种会自动作为参数传给对齐模型无需手动标注。五、读懂输出结构词级时间戳长什么样对齐结果是一个可迭代对象每个词/字对应一项定义见 ForcedAlignItem字段含义示例text对齐单元中文按字、英文按词、日语按词nagisa 分词、韩语按词专用词典start_time开始时间秒0.234end_time结束时间秒0.512 中文文本会逐字对齐拉丁语系按空格分词对齐。韩语分词使用的内置词典在 korean_dict_jieba.dict。转成字幕只需两行思路遍历time_stamps把start_time/end_time格式化为HH:MM:SS,mmm写入 SRT/ASS 文件即可——词级时间戳是逐字/逐词高亮字幕和歌词弹词的基石。六、上手体验命令行 Web Demo 可视化时间戳不想写代码官方提供了 Gradio 网页 Demo加上--aligner-checkpoint参数即可在界面上直接看到时间戳可视化脚本位于 qwen_asr/cli/demo.pyqwen-asr-demo \ --asr-checkpoint Qwen/Qwen3-ASR-1.7B \ --aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B \ --backend transformers \ --cuda-visible-devices 0 \ --ip 0.0.0.0 --port 8000浏览器打开http://你的IP:8000上传音频即可体验「识别 时间戳」全流程。注意不传--aligner-checkpoint时时间戳界面会自动隐藏。七、常见问题与最佳实践 FAQ❓ 时间戳精度如何官方强制对齐基准AAS 越低越好显示中文 33.1ms、英文 37.5ms、韩文 37.2ms300 秒长音频拼接场景下也仅约 53ms全面领先 NFA、WhisperX 等传统方案。❓ 音频超过 5 分钟怎么办无需手动切割一体化模式路径 B会自动切片、对齐、偏移校正、再合并直接喂完整音频即可。❓ 流式识别有时间戳吗没有。流式推理vLLM 后端不支持批量和时间戳需要词级时间戳时请使用离线模式。❓ 显存不够 / 追求极致速度换 0.6B ASR 模型精度-效率平衡或改用 vLLM 后端Qwen3ASRModel.LLM(modelQwen/Qwen3-ASR-1.7B, ...)记得将代码包在if __name__ __main__:下以避免多进程错误。❓ 支持哪些语言对齐模型支持Chinese、English、Cantonese、French、German、Italian、Japanese、Korean、Portuguese、Russian、Spanish 共 11 种。语种名写法不敏感如chinese、CHINESE均可但必须是对齐模型支持的语种之一。八、总结选对路径5 分钟产出词级时间戳你的场景推荐路径已有文本只需对齐路径 AQwen3ForcedAligner.align()音频 → 文本 → 时间戳全流程路径 BQwen3ASRModelreturn_time_stampsTrue快速可视化体验qwen-asr-demo--aligner-checkpoint至此你已经掌握了用 Qwen3-ASR 生成词级时间戳的全部核心用法——无论是字幕工坊、播客后期还是歌词同步这套「ASR 强制对齐」组合都能给你毫秒级的精准定位。【免费下载链接】Qwen3-ASRQwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen3-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表