#68 · 主分类: 语音合成与识别
aeneas
aeneas 是一个 Python/C 库和一组工具,用于自动同步音频和文本(又称强制对齐)
项目最后更新:07/25/26
GitHub Stars
2.9K
Forks数量
275
贡献者数量
8
许可证
AGPL-3.0
收录理由
aeneas 能将一段朗读音频与对应的文本自动对齐,为每一行或短语生成精确到秒的时间戳,这项技术被称为强制对齐。它通过动态时间规整算法,将音频的声学特征与文本进行匹配;若缺少现成的转写对齐,则会借助语音合成引擎生成参考音频作为比对基准。输出格式覆盖广泛,既包括 SRT、VTT 字幕,也支持 EPUB 3 有声书所需的 SMIL 以及语言学研究中常用的 TextGrid 等。无论是开发有声书应用、卡拉OK式阅读器、字幕工具,还是构建口语语料库,都可以将它的命令行接口或 Python API 集成到自己的流程中。工具支持 38 种语言与批处理任务,文档从单个文件到多级词句对齐都有详细说明。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。