#83 · 主分类: 语音合成与识别

diart

deep-learning real-time speaker-diarization speaker-embedding streaming-audio transcription voice-activity-detection

一个用于构建AI驱动的实时音频应用的Python包

项目最后更新:06/19/26

GitHub Stars

2.0K

Forks数量

165

贡献者数量

13

许可证

MIT

收录理由

Diart 解决了一个多数语音工具避而不答的问题:在对话进行中,实时分辨出谁在说话、什么时候说话。它并不像传统方案那样事后对录音做批量处理,而是将说话人分割模型与嵌入模型接入一个增量聚类流程,随着音频流持续推进,识别结果会越来越准。这种特性让它很适合实时会议、呼叫中心、辅助听力以及需要边听边给出结论的转写产品。除了开箱即用的 SpeakerDiarization 流程,你还可以自行搭建定制化的流式处理管线,调整超参数,做基准测试,并通过 WebSockets 对外提供分离服务。对研究者和工程师而言,它既是一个能直接嵌入的组件,也是探索流式音频处理的上手起点,文档把安装和主要工作流都讲得很清楚。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目