#68 · 主分类: 语音合成与识别

aeneas

alignment audio cli dtw espeak espeak-ng festival ffmpeg forced-alignment linux macos nlp python smil speech srt text text-to-speech tts windows

aeneas 是一个 Python/C 库和一组工具,用于自动同步音频和文本(又称强制对齐)

项目最后更新:07/25/26

GitHub Stars

2.9K

Forks数量

275

贡献者数量

8

许可证

AGPL-3.0

收录理由

aeneas 能将一段朗读音频与对应的文本自动对齐,为每一行或短语生成精确到秒的时间戳,这项技术被称为强制对齐。它通过动态时间规整算法,将音频的声学特征与文本进行匹配;若缺少现成的转写对齐,则会借助语音合成引擎生成参考音频作为比对基准。输出格式覆盖广泛,既包括 SRT、VTT 字幕,也支持 EPUB 3 有声书所需的 SMIL 以及语言学研究中常用的 TextGrid 等。无论是开发有声书应用、卡拉OK式阅读器、字幕工具,还是构建口语语料库,都可以将它的命令行接口或 Python API 集成到自己的流程中。工具支持 38 种语言与批处理任务,文档从单个文件到多级词句对齐都有详细说明。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目