#14 · 主分类: 生物信息学与基因组学
DNABERT
DNABERT:预训练的BERT模型,用于基因组中的DNA语言
项目最后更新:01/22/26
GitHub Stars
777
Forks数量
179
贡献者数量
9
许可证
Apache-2.0
收录理由
DNABERT 把自然语言处理领域大放异彩的 Transformer 架构带到了基因组分析中。它先将原始 DNA 序列切分成 k-mer 片段,再预训练一个 BERT 风格的编码器,之后你可以针对启动子预测、剪接位点识别、转录因子结合位点鉴定等具体任务做微调。仓库里提供了模型源码、使用示例、预训练权重和可视化工具,拿到基因组文件就能一步步构建任务专用模型,不必自己从零搭架构。由于代码是在 Hugging Face Transformers 基础上改造的,熟悉那个生态的人会觉得很顺手。需要留意的是,更新一代的 DNABERT-2 训练自多物种基因组,效率更高,但放在另一个独立仓库中。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
deepvariant
DeepVariant是一个分析流程,利用深度神经网络从下一代DNA测序数据中识别遗传变异。
scanpy
Python中的单细胞分析。可扩展至超过1亿个细胞。
chemprop
用于分子性质预测的消息传递神经网络
Assemblies-of-putative-SARS-CoV2-spike-encoding-mRNA-sequences-for-vaccines-BNT-162b2-and-mRNA-1273
提供COVID-19疫苗mRNA的实验序列数据,以促进RNA-seq研究中疫苗来源读段的识别。
scvi-tools
单细胞和空间组学数据的深度概率分析