
这项由阿里巴巴集团与中国人民大学高岭人工智能学院联合开展的研究,于2026年6月15日以预印本形式发布,论文编号为arXiv:2606.16905v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。
科学研究在今天正在经历一场深刻的变革。传统上,一个药物化学家需要用一套工具,一个蛋白质工程师需要用另一套完全不同的工具,一个材料科学家又需要再换一套——每个领域都有自己的专用AI模型,彼此互不相通,就像一家医院里每个科室都配了完全不同的电脑系统,内部数据无法共享,会诊时还要反复打印纸质文件来传递信息。
研究团队希望打破这种局面,构建一个统一的AI系统,让它既能设计药物分子,又能分析蛋白质结构,还能规划化学合成路线,甚至设计新型材料——全部用同一套"语言"完成,全部在同一个模型里运行。这个系统被命名为LOGOS,即"科学生成对象的语言(Language Of Generative Objects in Science)"的缩写。
一、科学界的"通天塔困境":为何我们需要一个统一的科学AI
当今AI辅助科学研究的版图,长期以来像一座古老的通天塔——每个楼层说着不同的语言,相互之间无法沟通。做药物发现的AI模型需要明确的三维坐标数据,需要专门处理几何结构的神经网络;做蛋白质序列分析的模型专注于氨基酸排列;做化学反应预测的模型又有自己的分子表示方式。每个领域的AI都是为本领域量身定做的专才,没有人能横跨多个领域施展手脚。
这种分裂带来了实际的麻烦。药物研发恰恰是一个需要跨越多个领域的工作——你需要了解目标蛋白质的结构,需要分析潜在配体(就是可能与蛋白质结合的小分子药物)的化学性质,还需要规划如何在实验室里合成这个配体,甚至要考虑用什么材料来包裹和递送它。这些环节各自都有专用AI工具,但这些工具之间的知识无法互相流通、互相增强。
更深层的问题是,当前很多AI科学工具采用的是"先理解、再预测"的架构,就像让一个学生先背诵所有的化学公式,然后再回答"这个反应能否发生"的是非题。这种方式固然有效,但它本质上是一种判断型任务,而科学研究更根本的挑战是"生成型任务"——不是判断某个分子有没有价值,而是从零开始设计一个全新的、有价值的分子。能判断不等于能创造,这是一道本质的鸿沟。
LOGOS的核心思路是:所有的科学对象,无论是蛋白质、小分子药物、化学反应、金属有机框架材料,还是它们之间的相互作用,其实都遵循某些共通的结构规律和组合逻辑。就像世界上的各种语言看似天差地别,但它们都有主语、谓语、宾语等基本语法结构一样——不同的科学"方言"之下,存在一套统一的"科学语法"。研究团队的工作,就是设计并实现这套统一语法,让所有科学对象都能在同一套符号系统里被描述、被学习、被生成。
二、那套神奇的"科学语法":如何让蛋白质和药物分子"说同一种语言"
要理解LOGOS的核心创新,可以先想一想现代文字处理器是怎么工作的。当你在Word里输入文字,打出"苹果"这个词,计算机内部并不"认识"苹果这种水果,它只是把两个汉字转化成一串数字编码,然后按照语言模型的规则预测下一个词应该是什么。LOGOS对科学对象做了类似的事情,但对象换成了氨基酸序列、化学结构和材料组成。
具体来说,每种科学对象都被设计了专属的"边界标记"。蛋白质序列被包裹在`<ProteinS>`和`<ProteinE>`两个特殊标记之间,就像给每段文字加上书名号;小分子药物用SMILES格式(一种将化学结构写成线性字符串的方法,例如水可以写成O,咖啡因可以写成一长串字母和符号)包裹在`<MoleculeS>`和`<MoleculeE>`之间;抗体序列有自己的`<AntibodyS>`和`<AntibodyE>`;材料有`<MaterialS>`和`<MaterialE>`,其内部的金属簇有`<MetalS>`和`<MetalE>`,有机连接体则复用小分子的边界标记。
这套设计带来了一个关键优势:不同科学对象可以在同一个序列里自然地拼接和嵌套,就像乐高积木可以随意组合。一个蛋白质-药物复合物,可以被表示为一段蛋白质序列加上若干段用口袋标记圈出的结合位点片段,再加上一段药物分子的SMILES字符串——整个复合体的信息变成了一串连续的、可被语言模型直接"阅读"的字符序列。
然而,最精妙的设计体现在如何处理三维空间信息上。蛋白质结合口袋(也就是药物分子与蛋白质"握手"的那个凹槽)是一个三维结构体——它的形状由哪些氨基酸在空间上靠近彼此决定,而不是由它们在序列上的排列位置决定。这本来是纯语言模型处理不了的问题。LOGOS的解决方案是:不直接处理三维坐标,而是把三维空间中的接触关系和约束模式,通过特定的序列表示方式"编码"进去。
研究团队为每个蛋白质结合口袋设计了四种互补的序列表示方式。第一种是在蛋白质氨基酸序列里,用`<PocketS>`和`<PocketE>`标记出哪些位置属于这个口袋——相当于在一段文字中给关键词加上下划线,把三维空间位置信息"投影"到一维序列上。第二种是把口袋里每个氨基酸的侧链基团(就是氨基酸分子上负责与药物发生相互作用的那部分),展开成对应的SMILES化学结构字符串——这把蛋白质语言和化学语言直接连通起来,就像给蛋白质里的每个"字"注上了化学"拼音"。第三种是在同一个训练样本里同时呈现上述两种表示,并在中间插入一个方向性标记`<Trans>`,让模型学会在氨基酸符号和化学结构之间相互翻译。第四种是给出完整蛋白质序列,后接`<Search>`标记,要求模型预测口袋位置——这直接把"寻找结合口袋"这个重要任务变成了一个语言生成任务。
通过把三维相互作用"语法化"和"标记化",研究团队让LOGOS能够在不依赖任何三维坐标数据或专门几何神经网络的前提下,学习蛋白质口袋与药物配体的空间相互作用模式。这是LOGOS区别于此前所有方法的最根本创新之一。
三、数据的盛宴:用七种"科学食材"喂养一个万能模型
任何AI模型的能力,都取决于它学过什么。LOGOS的训练数据覆盖了七种科学模态,总计约448.7亿个"词元"(也就是模型读取信息的最小单位)。
最基础的食材是蛋白质序列数据,来源于UniRef90数据库——这是由瑞士生物信息学研究所维护的一个大型蛋白质序列库,包含了已知蛋白质序列中约90%相似度去冗余后的代表性条目,总计28.9亿个词元。抗体数据来自Observed Antibody Space(OAS)数据库,这是一个整合了大量免疫组库测序研究结果的抗体序列库。研究团队对原始数据进行了严格筛选,去除了来源不明、含有非标准氨基酸或缺失关键注释信息的序列,并按70%序列相似度做了去冗余处理,最终保留约30亿个词元。
小分子药物数据来自PubChemQC数据库,这是一个量子化学数据库,收录了以SMILES格式表示的8600多万个分子的计算化学数据,研究团队在筛选时还结合三维构象信息做了结构一致性验证,最终贡献约46亿个词元。化学反应数据来自两个数据源:一个是收录有机化学实验验证反应记录的Open Reaction Database,另一个是专注于酶催化反应的ECReact数据库,合计约21亿个词元。
金属有机框架材料数据来自由Boyd等人构建的大规模假想MOF结构数据库。研究团队用一种叫做"金属氧化物分解"的方法,把每个MOF结构拆解成金属簇和有机连接体两部分,并用化学绘图软件RDKit验证有机连接体的化学合理性,只保留能被正确解析的条目,最终约4.7亿个词元。
蛋白质结合口袋数据和蛋白质-配体复合物数据是两个关键的"接口"数据集。前者来自对蛋白质数据库(PDB)中蛋白质结构用P2Rank工具预测的结合口袋结果,后者来自Q-BioLiP数据集——对每个复合物,研究团队用5到10埃(埃是一个极其微小的长度单位,一埃等于一亿分之一厘米)的半径范围,从配体原子出发选取周围的蛋白质残基作为口袋定义,并用多种半径阈值生成多尺度训练样本,以增强模型对口袋边界定义的鲁棒性。这两类数据合计约58亿个词元,是模型学习蛋白质-药物相互作用的核心知识来源。
四、向大语言模型"借力":一个关于初始化的精彩发现
LOGOS的训练分为两个阶段:先是在上述七种数据上做大规模的"续训"(也叫持续预训练),让模型掌握各个科学领域的基础知识;然后再用少量的标注数据做"精调"(监督微调),激活模型在具体任务上的能力。
在搭建LOGOS的过程中,研究团队做了一系列预备实验,其中一项发现令人印象深刻。他们想知道:从已有的大语言模型(比如Qwen3或Llama)的预训练权重出发,对科学训练有没有帮助?毕竟语言模型"理解"的是自然语言,而科学对象的表示方式与自然语言有很大差异。
实验结果显示了一个微妙但重要的规律。研究团队把模型的可训练参数分成三个部分:嵌入层(负责把每个词元转化成数字向量)、Transformer主干(负责理解上下文、建模长距离依赖关系)、以及语言模型头部(负责把模型的内部状态转化回词元预测)。他们设计了四种初始化方案:全部随机初始化;只继承嵌入层权重;继承嵌入层和Transformer主干;以及全部继承大语言模型权重。
结论是:全部继承大语言模型权重的方案效果最好,而只继承嵌入层的方案甚至比全部随机初始化还差一点——这说明单纯继承词元的"翻译方式"而没有继承深层的序列理解能力,并不能带来好处,甚至会有轻微干扰。真正有价值的是Transformer主干中沉淀的序列建模能力:对长程依赖关系的把握、对上下文的条件推理、对层次结构的表示构建——这些能力在自然语言和科学序列之间确实存在某种抽象层面的共通性,能为科学序列学习提供有益的归纳偏置。
另一个发现同样重要:在持续预训练阶段,如果在科学数据里混入自然语言数据,模型在药物生成任务上的性能会系统性下降,而且参数规模越小,下降越明显。这表明在固定的参数预算下,自然语言能力与科学模态能力之间存在不可回避的容量竞争——要让模型在科学任务上更专注、更高效,就应该让它专心学科学,而不是同时维持自然语言能力。这也是LOGOS选择以科学语法而非自然语言作为跨模态接口的深层原因。
五、"语法"是否真的起作用?三组消融实验给出答案
研究团队对LOGOS的统一科学语法做了细致的消融实验(所谓消融,就是把某个组件"切掉",看切掉之后效果会怎么变)。
第一组实验测试的是"口袋翻译"任务:给定一段含有口袋标记的蛋白质氨基酸序列,要求模型把口袋里每个氨基酸的单字母代码"翻译"成对应的侧链SMILES字符串。这是对语法设计中氨基酸-小分子转化序列的直接考核。结果显示,LOGOS在这个任务上达到了很高的准确率,说明模型确实在预训练过程中学到了氨基酸符号与其化学结构之间的对应关系——而这种对应关系的学习,是在纯粹的序列生成目标下自然涌现的,完全不需要任何额外的对齐模块或辅助损失函数。
第二组实验则直接回答"语法各组件的贡献有多大"。研究团队在药物-口袋设计任务上,逐步加入不同类型的预训练数据,观察性能变化。完全不加入蛋白质结合口袋和蛋白质-配体复合物数据时,模型在该任务上几乎是随机水平,说明仅仅让蛋白质和小分子数据"共存",不能让模型自动学会它们之间的关系——知识只有在被明确编码为关联关系时才能产生真正的迁移。加入口袋数据和复合物数据后,性能大幅提升;而进一步加入口袋翻译数据(那些只有蛋白质和口袋注释、完全没有配体信息的训练样本)之后,性能又迎来了最关键的一次跃升。
这个结果非常耐人寻味:口袋翻译数据完全不包含任何配体信息,却对配体生成任务贡献了最大的性能提升。背后的逻辑是:当模型学会了把氨基酸符号转化为化学结构,它对口袋残基化学性质的理解就不再停留在符号层面的模式匹配,而是建立在跨表示系统的语义等价关系上——理解"丙氨酸"不只是认识字母A,而是理解它代表着带有甲基侧链的化学结构,进而能更准确地预测什么样的配体分子能与这个口袋形成互补。
第三组实验考察的是多任务联合微调是否比单任务独立微调更好。研究团队同时对四个代表性任务(药物设计、口袋识别、逆合成预测、材料生成)做联合精调,与每个任务分别独立精调的结果相比,联合精调在所有四个任务上都取得了更好的成绩,提升幅度从4%到接近10%不等。这表明不同领域的科学知识在统一语法空间里确实存在可以共享的底层规律,联合训练产生了真实的跨域协同增益。
六、六场"考试"的成绩单:LOGOS在各类科学任务上表现如何
研究团队对LOGOS进行了六项具体任务的评测,覆盖了药物设计、材料生成、化学合成、蛋白质工程和抗体设计等多个领域。
在蛋白质口袋条件下的药物分子设计任务中,LOGOS-8B取得了-7.76的Vina对接分数(这个数字代表药物与蛋白质结合的自由能估算,越负表示结合越强),超过了所有对比方法,包括TargetDiff(-7.38)、Pocket2Mol(-6.95)以及NatureLM(-6.91,这是一个参数量为8×7B的大型通用科学模型)。更值得注意的是,LOGOS-1B的得分是-7.64,已经优于所有专门领域的对比方法,而参数量仅为NatureLM的约1/56。在药物性质方面,LOGOS-8B的QED(药物相似性评分,满分为1)达到了0.57,合成可及性得分(SAS)也处于优秀水平。从可视化案例来看,LOGOS生成的药物分子与蛋白质口袋之间形成了丰富多样的非共价相互作用,包括氢键、疏水接触、盐桥和π-π堆叠等,表明模型确实学到了物理意义上真实的结合模式,而非简单地输出合法化学结构。
蛋白质结合口袋识别任务对LOGOS来说有一个特殊意义:所有的对比方法(Fpocket、SiteHound、MetaPocket 2.0、DeepSite、P2Rank)都需要蛋白质的三维结构作为输入,而LOGOS只使用一维的氨基酸序列。即便如此,LOGOS-8B在COACH420和HOLO4K两个标准数据集上的Top-n识别率分别达到66.5%和58.5%,超过了除P2Rank之外的所有方法——而P2Rank的预测结果本身就是LOGOS训练数据的来源,可以说P2Rank构成了LOGOS在该任务上的性能天花板。这意味着,对于那些只有序列信息而没有三维结构的蛋白质(这类蛋白质在已知蛋白质中占绝大多数),LOGOS可以在完全不需要结构数据的情况下预测潜在的药物结合口袋,大大拓宽了口袋识别技术的适用范围。
逆合成预测是化学合成规划的核心任务:给定一个目标分子,反推出可以合成它的原料组合。在标准数据集USPTO-50K上,LOGOS-8B的Top-1准确率达到74.8%,超过了NatureLM-8×7B(71.9%)以及所有专门领域方法,成为新的最佳结果。在Top-3准确率上,LOGOS相对于NatureLM略有不足,这可能与两种方法在生成候选答案的多样性和精确度之间的取舍方式不同有关。
金属有机框架材料(MOF)的无条件生成任务中,LOGOS在化学有效率(Valid)、有效-新颖-唯一率(VNU)和含新型构建块的比例(NBB)三项指标上全面超越了流行的扩散模型MOFDiff和流匹配模型MOFFlow-2。其中最引人注目的是NBB指标:LOGOS-8B达到17.78%,而MOFFlow-2只有10.10%,MOFDiff甚至是0%。NBB要求生成的MOF包含在训练集中从未出现过的新型构建块,这直接考验模型能否真正"创造"新化学,而不只是重新排列已有的组件。LOGOS在这方面的能力,被研究团队归因于小分子和化学反应预训练数据通过共享的分子标记渠道,为材料生成提供了丰富的化学先验知识。
在超出预训练格式的泛化测试中,研究团队选取了蛋白质编辑(优化蛋白质序列以提升特定功能)和抗体CDR区域设计(预测抗体中负责识别抗原的关键环状区域序列)两个任务,这两类任务的具体输入输出格式在预训练数据中没有直接出现过,用来检验LOGOS是否真的学到了可迁移的科学知识,还是只会"死记硬背"预训练格式。
蛋白质编辑任务使用了绿色荧光蛋白(GFP)和腺相关病毒衣壳蛋白(AAV)两个标准数据集,分为中等难度和高难度两种设置。LOGOS在所有四种设置下的功能适应度得分都远超此前所有对比方法:在高难度GFP任务上达到0.93,在高难度AAV任务上达到0.70,而最强的对比方法GGS的得分分别只有0.34和0.33。值得一提的是,LOGOS的得分在中等难度和高难度之间几乎没有变化,显示出极强的鲁棒性,而多个对比方法在难度增加后出现了明显的性能下滑。
抗体CDR设计任务采用了结构抗体数据库SAbDab的标准数据集,与所有对比方法相比,LOGOS-8B在CDR-H1、CDR-H2、CDR-L1、CDR-L2这四个相对保守的CDR区域,在氨基酸恢复率(AAR)和自洽结构RMSD(scRMSD)两项指标上都达到了最佳水平,CDR-L1和CDR-L2的AAR甚至超过85%。在CDR-H3区域,LOGOS的氨基酸恢复率与依赖三维结构输入的逆折叠方法相比有一定差距,这是合理的——CDR-H3是抗体中序列多样性最高、由V(D)J基因重组随机决定的区域,单凭序列信息确实难以精确预测其具体组合。然而,在序列合理性(Plausibility)这一由独立抗体语言模型评估的指标上,LOGOS-8B在所有六个CDR区域都取得了最高或接近最高的得分,说明它生成的序列整体上符合自然抗体的分布规律,具有很强的生物合理性。
七、规模越大越好:从1B到8B的稳定成长
研究团队训练了三个规模的LOGOS模型,参数量分别为约10亿(1B,基于Llama3.2-1B)、30亿(3B,基于Llama3.2-3B)和80亿(8B,基于Qwen3-8B)。在几乎所有评测任务上,性能都随参数量的增加而系统性提升,而且没有出现性能饱和或过拟合的迹象。
在药物设计的Vina分数上,三个规模模型的得分分别为-7.64、-7.73和-7.76,呈稳定递进;在Top-1逆合成准确率上,从64.0%到71.5%再到74.8%,提升幅度尤为明显;在材料生成的VNU指标上,从37.96%到38.97%再到39.02%,尽管绝对提升幅度相对较小,但趋势一致。蛋白质编辑任务上,三个规模的模型性能相近,说明即使是1B规模的模型也已经在蛋白质序列建模方面积累了足够的能力。
这种稳定的规模效应意味着LOGOS在参数扩展上没有明显的瓶颈,也意味着更大规模的科学基础模型很可能会带来更强的性能。研究团队指出,这与大语言模型领域的规模定律高度吻合,暗示着AI辅助科学研究的未来可能与大语言模型的未来深度绑定——不是建立一套与大语言模型完全分离的独立技术栈,而是在共享架构、共享训练范式、共享推理基础设施的前提下,让大语言模型成为AI驱动科学发现的真正入口。
归根结底,LOGOS做的事情可以用一句话概括:它证明了"一个模型通吃所有科学"这个目标在技术上是可行的,至少在蛋白质、药物、材料、化学反应这些与药物研发和材料科学密切相关的领域是如此。方法的关键不是堆砌更多专用模块,也不是用自然语言包装科学知识,而是设计一套真正能捕捉科学对象内在结构规律的统一语法,让不同领域的科学知识在同一套符号系统里互相流通、互相增强。
当然,这项工作的局限也清晰可见。核心涵盖的领域尚不包括核酸、基因组、转录组等生命科学的重要分支,这是研究团队明确指出的下一步方向。训练规模目前只探索到80亿参数,更大规模的行为还有待验证。对于高度依赖三维结构细节的任务,纯粹的序列建模方式有其固有的信息上限,将来或许需要把显式的几何信息作为序列建模的补充引入进来。
尽管如此,对于那些关心未来如何用AI加速药物研发、材料探索和化学合成的人来说,LOGOS提供了一个令人鼓舞的概念验证:科学的本质是有结构、有规律、可被语言描述的——而当我们找到合适的语言,AI就能开始真正地"说科学"。感兴趣的读者可以通过arXiv编号2606.16905查阅完整论文,模型权重和相关资源也已开源发布。
Q&A
Q1:LOGOS和NatureLM这类用自然语言做科学AI的方法有什么根本区别?
A:LOGOS直接使用蛋白质序列、SMILES化学结构等科学原生表示方式作为统一语法,而NatureLM等方法用自然语言作为跨领域的中间接口。研究发现,在固定参数预算下,让模型同时维持自然语言能力和科学建模能力会产生容量竞争,反而不如专注于科学原生表示更高效。LOGOS-1B的药物设计性能就超过了参数量是它56倍的NatureLM,印证了这一判断。
Q2:LOGOS在药物设计中是怎么处理三维结构信息的?
A:LOGOS没有直接输入三维坐标或使用几何神经网络,而是把空间接触关系"语法化"。具体做法是,把蛋白质口袋内的氨基酸用特殊标记圈出,并把这些氨基酸的侧链展开为SMILES化学结构字符串,用多种半径阈值从配体原子出发选取周围残基生成多尺度训练样本。这样,三维的空间近邻关系就被编码进了一维的序列表示中,语言模型可以直接学习这种编码。
Q3:LOGOS对普通药物研发工作者意味着什么?
A:对实际工作者来说,LOGOS最直接的价值在于两点:一是能对仅有氨基酸序列、没有三维结构的蛋白质预测潜在药物结合口袋,大幅扩展了可被分析的蛋白质范围;二是可以在单一模型中连贯地完成从口袋识别到配体生成再到逆合成规划的多步流程,避免在多个专用工具之间频繁切换和信息损耗。模型权重已开源,有条件的研究者可以直接在自己的任务上使用或二次开发。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。