#14 · 主分类: 生物信息学与基因组学

DNABERT

deep-learning dnabert-model genome gpu kmer kmer-format machine-learning natural-language-processing nlp sequence

DNABERT:预训练的BERT模型,用于基因组中的DNA语言

项目最后更新:01/22/26

GitHub Stars

777

Forks数量

179

贡献者数量

9

许可证

Apache-2.0

收录理由

DNABERT 把自然语言处理领域大放异彩的 Transformer 架构带到了基因组分析中。它先将原始 DNA 序列切分成 k-mer 片段,再预训练一个 BERT 风格的编码器,之后你可以针对启动子预测、剪接位点识别、转录因子结合位点鉴定等具体任务做微调。仓库里提供了模型源码、使用示例、预训练权重和可视化工具,拿到基因组文件就能一步步构建任务专用模型,不必自己从零搭架构。由于代码是在 Hugging Face Transformers 基础上改造的,熟悉那个生态的人会觉得很顺手。需要留意的是,更新一代的 DNABERT-2 训练自多物种基因组,效率更高,但放在另一个独立仓库中。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目