
期刊: arxiv 链接: https://arxiv.org/abs/2411.08909v3
简介: 本文提出LC-PLM和LC-PLM-G模型,通过双向Mamba架构提升蛋白质语言模型长上下文能力。前者用双向Mamba-S和掩码语言建模学习通用蛋白质表示,后者在图上下文训练以编码生物交互信息。实验使用UniRef50、UniRef90等数据集,结果显示LC-PLM在神经缩放定律、长度外推能力和下游任务表现上优于基于Transformer的ESM-2;LC-PLM-G在图上下文训练后,能有效捕捉图信息,提升远程同源性预测等任务性能。
期刊: Nature Methods 链接: https://doi.org/10.1038/s41592-025-02636-z 代码: https://huggingface.co/biomap-research
简介: 文章提出xTrimoPGLM统一蛋白质语言模型,通过创新预训练框架解决蛋白质理解和生成任务。模型以GLM为骨干,结合MLM和GLM目标进行两阶段训练,并在大规模数据集上训练1000亿参数模型。实验使用多个蛋白质相关任务数据集,结果表明xTrimoPGLM在18个蛋白质理解基准测试中表现优异,在结构预测和序列生成任务上成果突出。
期刊: arxiv 链接: https://arxiv.org/abs/2403.04197v3
简介: 论文提出In-Context Molecule Adaptation (ICMA)范式,使大语言模型能从上下文示例中学习分子文本对齐,提升在分子-标题翻译任务中的性能。ICMA包含混合上下文检索、检索后重排和上下文分子调整三个阶段。实验采用ChEBI-20和PubChem324k数据集,结果显示ICMA能让模型取得优异成果,且在复杂分子任务中表现出色。
期刊: arxiv 链接: https://arxiv.org/abs/2408.16245v3 代码: https://github.com/nyuolab/OmniBioTE
简介: 本文训练了大规模开源多组学基础模型OmniBioTE,用于蛋白质-核酸相互作用建模。模型基于Transformer架构,在大量核酸和蛋白质序列上预训练,并进行微调以适应不同任务。实验利用ProNAB等多个数据集,结果表明OmniBioTE能学习联合表示,在预测结合能和接触预测等任务中表现出色,且在单组学下游任务也有良好表现。
期刊: arxiv 链接: https://arxiv.org/abs/2504.02148v1 代码: https://github.com/FuhaiLiAiLab/OmniCellTOSG
简介: 论文构建了首个细胞文本组学信号图数据集OmniCellTOSG,用于联合大语言模型(LLM)和图神经网络(GNN)建模,以解码复杂细胞信号系统。该数据集整合多源单细胞转录组数据与文本注释,经数据收集、预处理等步骤构建而成,并开发了CellTOSGDataset包方便数据加载。实验基于该数据集对模型进行评估,在阿尔茨海默病等疾病相关数据上,CellTOSG-Class模型相比传统图神经网络架构表现更优。该研究为细胞信号研究提供了新资源和方法,推动了精准医学发展。
期刊: arxiv 链接: https://arxiv.org/abs/2503.15567v2 代码: https://anonymous.4open.science/r/UAE-3D/
简介: 文章提出UAE-3D和UDM-3D模型,通过构建统一潜在空间解决3D分子生成中多模态集成和SE(3)等变问题。UAE-3D利用关系Transformer等组件将3D分子特征压缩到统一潜在空间,UDM-3D在此基础上使用扩散Transformer进行生成建模。在QM9和GEOM-Drugs数据集上,与多种基线模型对比,UDM-3D在从头生成和条件生成任务中表现卓越,几何精度高、生成分子新颖且质量好,训练和采样效率也大幅提升。该研究为3D分子设计提供了更高效准确的方法。
期刊: arxiv 链接: https://arxiv.org/abs/2503.23668v2
简介: 论文提出分子定位基准测试MolGround,以评估模型将分子概念与特定结构组件联系起来的能力,构建了包含79k问答对的大型基准数据集,并开发多智能体定位原型系统。实验采用8个大语言模型作为基线,在多个分子定位任务上进行评估,结果显示现有模型在这些任务上表现不佳,而该原型系统在部分任务上超越了现有模型,且其定位结果能提升分子字幕和分类任务的性能。
期刊: arxiv 链接: https://arxiv.org/abs/2504.02014v1
简介: 本文提出HCAF-DTA模型,通过超图和双向多头注意力机制,解决现有药物-靶标亲和力预测方法的局限。模型利用树分解算法构建药物分子超图,提取子结构和全局特征,同时基于ESM模型预测的蛋白质接触图构建加权图,提取蛋白质空间特征,最后用双向多头交叉注意力机制融合特征进行预测。在Davis和KIBA数据集上的实验显示,HCAF-DTA在多个评估指标上优于传统深度学习和图基方法,在冷启动实验中也展现出良好的泛化性和鲁棒性。
期刊: IEEE Journal of Biomedical and Health Informatics 链接: https://doi.org/10.1109/JBHI.2025.3556766
简介: 论文提出BFGTP框架,通过整合分子多模态信息及基于预训练BERT模型的两阶段引导学习策略,提升分子毒性预测性能。该框架设计了独立的指纹、图和标记编码器,并运用对比学习和知识蒸馏优化目标。研究使用TOXRIC数据库中的多类毒性数据集,以AUC等指标评估模型性能。实验结果显示,BFGTP在多个数据集上AUC表现最佳,在五项评估指标上平均性能最优,且经消融实验验证了各组件有效性。该研究为分子毒性预测提供了更有效的方法。
期刊: arxiv 链接: https://arxiv.org/abs/2504.02606v1
简介: 文章提出通过不确定性量化提升分子属性预测中反事实解释的真实性。在分子图属性预测任务中,利用不确定性估计技术过滤高不确定性反事实样本,以提高反事实解释与真实属性分布的契合度。研究采用合成和真实世界数据集,对比了深度集成、均值方差估计等多种不确定性量化方法。实验表明,集成均值方差估计方法在降低模型误差和提升反事实真实性方面效果显著。
期刊: arxiv 链接: https://arxiv.org/abs/2504.02698v1
简介: 本文提出SCMPPI框架用于蛋白质-蛋白质相互作用(PPI)预测,将蛋白质序列特征与PPI网络拓扑信息融合,并结合改进的监督对比学习策略,提升预测性能。实验使用酵母、人类等八个基准数据集,采用五折交叉验证,对比多种传统和现有方法。结果显示,SCMPPI在准确率、AUC等关键指标上优于其他方法,在跨物种预测中也表现出色,并成功应用于多个PPI网络预测。
期刊: Advanced Science 链接: https://doi.org/10.1002/advs.202417726
简介: 论文提出DiffMC-Gen双去噪扩散模型,用于多条件分子生成,以解决现有方法难以同时优化候选化合物多种属性的问题。该模型整合离散和连续特征,利用动态可组合多头注意力和3D同构编码算法,结合多目标优化策略。研究使用QM9、CSD和MOSES等数据集,以Glide score等指标评估生成分子质量。实验表明,DiffMC-Gen在2D和3D分子生成任务中,生成分子的新颖性、独特性表现优异,在药物相似性和可合成性方面与传统方法相当,且针对特定靶点生成的分子具有良好生物活性。
期刊: Scientific Reports 链接: https://www.nature.com/articles/s41598-025-87574-8
简介: 文章提出Transformer和Mamba的混合模型TransMamba,通过融合二者优势提升序列建模性能。模型利用Transformer的编码器进行编码,Mamba作为解码器,并采用特征融合技术。研究使用HellaSwag、BoolQ等多个数据集,对比Transformer和Mamba等模型。实验结果显示,TransMamba在零样本和少样本评估中表现优异,在多个任务上超越基线模型,消融实验验证了各组件的重要性。该研究为序列建模提供了更有效的混合模型,不过在与其他前沿模型对比及计算复杂度分析方面有待加强。
期刊: Nature Communications 链接: https://www.nature.com/articles/s41467-025-58250-2 代码: https://github.com/instadeepai/protein-sequence-bfn
简介: 本文利用贝叶斯流网络(BFNs)提出ProtBFN模型用于蛋白质序列建模,解决现有方法在无条件和条件生成方面的不足,还通过微调得到抗体特异性模型AbBFN。研究在UniProtKB等数据集上训练模型,对比ProtGPT2和EvoDiff等模型。实验结果表明,ProtBFN生成的蛋白质序列自然、多样且新颖,能有效覆盖已知蛋白质空间;AbBFN在零样本条件生成任务中表现良好,与专门训练的抗体模型相当甚至更优。
期刊: Nature Communications 链接: https://www.nature.com/articles/s41467-025-58588-7 代码: https://github.com/Adibvafa/CodonTransformer
简介: 论文提出CodonTransformer多物种密码子优化模型,借助Transformer架构和特定序列表示策略,学习不同生物的密码子使用模式,生成符合宿主偏好且含最少负向顺式调控元件的DNA序列。研究使用来自164个生物体的约100万DNA-蛋白质对训练模型,对比其他优化工具。实验显示,该模型生成的序列密码子分布自然,在与自然序列的相似性、预测同义突变效果等方面表现出色,且能有效减少负向顺式调控元件。