#75 · 主分类: 语音合成与识别
WhisperJAV
ASR/STT字幕生成器。使用Qwen3-ASR、本地LLM、Whisper、TEN-VAD。针对JAV抗噪。
项目最后更新:08/22/26
GitHub Stars
2.2K
Forks数量
183
贡献者数量
3
许可证
MIT
收录理由
WhisperJAV 针对的是一个具体且棘手的问题:让语音转文字在日语成人视频上真正可用,而通用 ASR 模型在此场景下常常严重失灵。这类音频时长长、噪声大,充斥着耳语、喘息和戏剧化的发声,很容易把标准 Whisper 带偏,输出一堆无意义的文本。项目把 Faster-Whisper、OpenAI Whisper、Qwen3-ASR 以及针对动漫调优的变体等多种后端整合到同一条处理链路里,额外加入场景切分、语音活动检测和幻觉过滤,最后才生成带时间戳的字幕。它同时提供图形界面和命令行工具,解耦后的 ChronosJAV 流程可以接入任何能把音频转成文本的模型。如果你曾为日语对话在原生 Whisper 上反复踩坑,这套方案是对失效模式的扎实工程化修补,而不是简单套一层壳。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。