#91 · 主分类: 语音合成与识别

CrisperWhisper

asr audio detection filler full-duplex-audio labeling recognition speech speech-processing speech-recognition stutter-detection stuttering timestamps transcription turn-taking verbatim whisper

可控转录:逐字(包括每个词、填充词、停顿、口吃、发声)或意图(说话者想表达的意思,优化可读性),附带词级时间戳。

项目最后更新:08/23/26

GitHub Stars

1.4K

Forks数量

86

贡献者数量

5

许可证

Other

收录理由

多数转写工具会把口误和停顿悄悄抹平,只留下一个干净但未必真实的文本。CrisperWhisper 反其道而行,它既能逐字转写,把语气词和发声事件都标出来,也能输出整理过的版本,让数字、日期、邮箱按书写习惯排版。逐词时间戳的边界误差大约在 30 到 40 毫秒之间,对齐这类精细活儿够用了。Verbatimize 模式尤其适合手里已有可靠干净转写的团队:把原始音频和那份干净文本一起喂进去,模型就能把口语中的不流畅原样还原,这在准备 TTS 数据、做临床语音分析,或者把现有干净语料改造成逐字数据集时都很有价值。它覆盖 Whisper 支持的大部分语言,处理长录音也不会出现常见的分段接缝痕迹,直接可以嵌进生产级转写流程,而不只是停留在演示阶段。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目