#91 · 主分类: 语音合成与识别
CrisperWhisper
可控转录:逐字(包括每个词、填充词、停顿、口吃、发声)或意图(说话者想表达的意思,优化可读性),附带词级时间戳。
项目最后更新:08/23/26
GitHub Stars
1.4K
Forks数量
86
贡献者数量
5
许可证
Other
收录理由
多数转写工具会把口误和停顿悄悄抹平,只留下一个干净但未必真实的文本。CrisperWhisper 反其道而行,它既能逐字转写,把语气词和发声事件都标出来,也能输出整理过的版本,让数字、日期、邮箱按书写习惯排版。逐词时间戳的边界误差大约在 30 到 40 毫秒之间,对齐这类精细活儿够用了。Verbatimize 模式尤其适合手里已有可靠干净转写的团队:把原始音频和那份干净文本一起喂进去,模型就能把口语中的不流畅原样还原,这在准备 TTS 数据、做临床语音分析,或者把现有干净语料改造成逐字数据集时都很有价值。它覆盖 Whisper 支持的大部分语言,处理长录音也不会出现常见的分段接缝痕迹,直接可以嵌进生产级转写流程,而不只是停留在演示阶段。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。