预印本访问链接:
https://www.proteingymllm.com/paper
该研究基于ProteinGym v1.3数据集,对13款通用语言模型和95种专业蛋白质预测方法进行比较,评估它们在零样本条件下对蛋白质突变体功能表现进行排序的能力。
报告显示,通用语言模型的佼佼者,比如 Claude Opus 和 GPT5.6 Sol 在这个专业任务上的Spearman相关系数(ρ)已达 0.406 和 0.402,超越了大部分专业模型(49 out of 95)。但距离顶尖的专业模型中还有很大的距离。该预印本将天鹜科技00后AI技术科学家谭扬主导研发的VenusREM(ρ=0.523)列为108款模型中的最优解,并设置为通用大模型对标的权威参照(见图1)。

图1:N=50 条件下 13 款通用语言模型排名
结果表明,通用语言模型具备一定的蛋白质突变筛选能力,但专业模型仍然保持明显优势。
01 从“能不能做”到“做到什么水平”
近年来,GPT、Claude、Gemini等通用大模型已逐步进入生命科学研究流程,能够协助研究人员理解实验方案、解释功能、生成代码。但“理解蛋白质问题”并不等于能精确预测突变效应——蛋白质工程的核心任务是给定一组候选突变,定量排序其功能影响,而非完成知识问答。PG-LLM正是围绕这一具体任务建立。
研究基于ProteinGym v1.3深度突变扫描数据,覆盖186种蛋白质和217组实验测定数据。测试中,通用语言模型仅可获得蛋白质序列、实验方案和候选突变信息,不能使用多序列比对(MSA)或三维结构;专业模型则可以使用完整的结构、MSA等信息。评测采用Spearman相关系数ρ衡量模型排序与实验结果的一致性。
结果显示,Claude Opus 5 以 ρ=0.406 登顶通用语言模型榜单,GPT-5.6 Sol 紧随其后,ρ=0.402。Claude Opus 5 表现超过了全部 95 种方法中的 49 种,其中包括 46 种纯序列方法中的 41 种,和 49 种使用 MSA 或结构等复合方法中的 8 种,得分高于纯序列方法中位数 ρ=0.374,接近于专用蛋白大模型 ESM2-650M 的 0.411,不过仍大幅落后于 VenusREM 的 0.523。
为验证提升推理阶段计算资源是否可以改善通用语言模型的能力,进一步验证结果显示,给模型开放更长思考、输出更多推理文字,所有通用语言模型的相关性均会上涨后逐步收敛,不会超过0.411,无法追上专用蛋白语言模型(见图2)。

图2:规模扩展对模型收益的影响
02 00后主导的VenusREM,成蛋白质突变预测领域专业参照
VenusREM是由天鹜科技AI Lab技术科学家、上海交通大学&上海创智学院00后博士生谭扬牵头研发的面向蛋白质突变效应预测与蛋白质工程的多模态预训练模型,VenusREM 的核心目标是联合利用蛋白质的氨基酸序列、三维结构和同源进化信息,更准确地评估候选突变对蛋白质活性、稳定性等功能性质的潜在影响。
VenusREM相关论文发表于Bioinformatics,全文链接如下:
https://academic.oup.com/bioinformatics/article/41/Supplement_1/i401/8199374

图3:天鹜科技AI Lab技术科学家、上海交通大学&上海创智学院00后博士生谭扬
与仅依赖单一序列信息的传统蛋白语言模型不同,VenusREM将氨基酸序列编码为序列词元,将残基局部三维空间环境离散化为结构词元,通过解耦多头交叉注意力联合建模序列上下文、局部结构及残基间空间关系,从而捕捉序列远距离但空间邻近的残基相互作用。
在此基础上,VenusREM引入检索增强模块,通过多序列比对提取各残基位点的进化保守性和氨基酸替换偏好,并将序列-结构表征与进化信息进行加权融合,实现单点及多点突变的适应度评分与排序。

图4:VenusREM 模型框架
在由哈佛医学院团队构建的ProteinGym蛋白质突变效应评测基准上,VenusREM取得了领先的零样本预测性能,超过了Meta、Microsoft等团队开发的代表性模型。模型及相关代码已全面开源,在Hugging Face平台近30天下载量超过4,000次,累计下载量超过25万次。
VenusREM项目已开源,详情访问链接:
https://github.com/ai4protein/VenusREM
这些成果表明,VenusREM已经成为蛋白质突变效应预测领域具有代表性的开源模型和研究工具。
结语
通用语言模型能否直接承担蛋白质突变筛选任务?PG-LLM 给出了答案:可以,但仍有边界。
通用大模型已展现出一定的突变排序能力,部分模型甚至超过了过半数的专有模型,但专业模型依然优势明显。
VenusREM在此次评测中成为行业权威参照,标志着专业蛋白质模型正从科研工具发展为评价通用大模型能力的重要坐标,我们所共同推动的是让通用模型负责理解复杂任务,让专业模型执行精准预测,最终形成人机协同的蛋白质研发系统。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。
责任编辑:kj005
头屑、头油、头皮瘙痒是很多人常年的头皮困扰:早上刚洗的头发,到下午发根就泛起油光,一挠指甲缝里全是油脂和细碎白屑;穿深色上衣时肩膀总沾着头皮屑,抬手拍屑的动作格...
对很多中老年朋友,尤其是糖尿病人群来说,日常饮食管理是一场需要耐心和细心的持久战要解决这些问题,找到一款能融入日常、长期坚持的营养补充方案,往往比临时救急更重要...
牙凸也就是常见的牙齿前倾、牙性龅牙,主要表现为上前牙外倾突出,容易造成嘴唇外撑、笑容僵硬,大多还伴随牙列拥挤、咬合偏移等问题北京矫正牙凸多少钱?牙凸矫正没有固定...
据2025年品牌趋势报告显示,超过67%的B2B采购商与行业决策者已将生成式AI作为项目调研、供应商筛选及展会比选的首要入口市场背景与现状AI搜索的底层逻辑已从...
全面推进乡村振兴,产业振兴是重中之重座谈会由市政府副市长张耀斌主持会议伊始,全体与会人员共同观看齐齐哈尔市城市宣传片与千喜鹤集团企业宣传片随后,千喜鹤集团董事、...
很多女性在需要做终止妊娠诊疗时,内心都会充满顾虑,大家最关心的莫过于诊疗的安全问题,担心操作不当给宫腔带来负担,影响后续身体健康终止妊娠诊疗的安全保障,依托整套...
四大亮点燃动六边擂台 | 2026 赛季中国武术散打王争霸赛资格选拔赛(郓城站)圆满收官8月6日,2026 赛季中国武术散打王争霸赛资格选拔赛(郓城站)在宋江武...