#77 · 主分类: 语音合成与识别
lhotse
ai
audio
data
deep-learning
kaldi
machine-learning
python
pytorch
speech
speech-recognition
用于处理机器学习项目中多模态数据的工具。
项目最后更新:08/26/26
GitHub Stars
1.1K
Forks数量
277
贡献者数量
109
许可证
Apache-2.0
收录理由
做语音研究的工程师常常发现,把原始数据整理成可训练的格式,比真正训练模型还要耗时。Lhotse 就是为解决这一层麻烦而设计的:它能把音频和对应文本转成纯文本的 manifest 文件,在送入 PyTorch 的数据加载器之前,允许你把录音当作灵活的数据单元进行切分、填充和增强。项目内置了许多常见语料库的现成处理脚本,省去重复造轮子的功夫。随着发展,它的处理范围已经从语音扩展到视频、图像和文本,一条管线就能支撑多模态实验。如果你基于新一代 Kaldi 生态工作,它可以和 k2、icefall 搭配使用,同时也支持 ESPnet 等其它框架。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。