已有一个多肽,AI可以如何优化它?
已有活性或功能的parent peptide往往仍需在亲和力、选择性、稳定性、溶解性、安全性和可合成性之间继续优化。AI更适合围绕已验证序列开展受控、多目标、假设驱动的局部探索,而不是给出一个脱离实验的“最佳序列”。
已有一个多肽,AI可以如何优化它?
很多多肽项目并不是从零开始。团队可能已经从文献、噬菌体展示、mRNA display、天然肽、抗菌肽筛选、蛋白相互作用界面或内部实验中获得一条parent peptide。它可能已经表现出可重复的活性,也可能只是一个值得继续研究的hit。此时最常见的问题不是“还能生成多少新序列”,而是“怎样在保留已有证据的同时,改善真正限制项目推进的性质”。
一个parent peptide通常只满足部分要求:活性较好但血清中降解快,亲和力较高但溶解性差,细胞摄取增加但溶血也升高,稳定性有所改善却变得难以合成,或者引入非天然氨基酸后失去了原有结合。已有活性并不意味着优化已经完成;多肽优化本质上是一个多目标问题,需要在相互牵制的目标之间做有证据的选择。
AI的价值因此不是无约束地“重新生成一个更好的序列”,而是围绕经过验证的parent peptide开展受控、多目标、假设驱动的优化,提出一组具有不同权衡的候选,再由合成和实验回答哪些改变真正有效。
先定义问题,再开始优化
“优化这个多肽”不是一个足够明确的任务。项目首先需要确定当前瓶颈和可接受的变化范围:首要目标是提高活性、延长血清稳定性,还是降低聚集与溶血?哪些残基已知参与结合,不能轻易改变?末端、环化锚点或关键电荷模式是否已有实验依据?是否允许D-氨基酸、N-甲基化或其他非天然氨基酸?候选需要满足怎样的交付周期、纯度和成本?
这些边界决定了模型应该搜索什么。若parent peptide已有可靠活性,局部点突变和小型组合库往往比完全重新生成序列更容易解释,也更有利于建立清楚的构效关系。AI可以评估较大的局部组合空间,但输出仍应对应具体假设,例如“降低某个蛋白酶敏感位点”“打散连续疏水片段”或“在不改变热点残基的前提下调整表面电荷”。
活性与亲和力:缩小空间,而不是虚构精确Kd
围绕活性和亲和力的优化可以包括残基替换、活性motif保留、结合热点保护、局部序列探索,以及在有可靠结构信息时进行structure-aware mutation。序列模型、结构模型和打分方法能够帮助排除明显不合理的变体,并将实验资源集中到更有信息量的候选上。
但模型评分不能被当作准确的Kd或功能读数。亲和力受构象、实验体系、缓冲条件和动力学机制影响,生物学活性还可能包含细胞进入、降解和下游效应。更稳妥的用途是比较相对趋势、形成可检验的突变假设,并通过binding或functional assay确认。
选择性不是亲和力的附属指标
有些项目并不缺少对目标的结合,而是需要提高target与off-target之间的区分。此时一味增强疏水接触或静电吸引,可能同时提高非特异结合。优化可以在保留关键结合残基的基础上,调整局部电荷、空间互补、疏水接触和相邻序列环境,并在可能的情况下同时评估目标与相关非目标体系。
选择性高度依赖具体靶点和实验条件。AI可以帮助构建成对比较和优先级,不能仅凭一个序列分数证明选择性。候选设计应与明确的counter-screen或off-target assay配套,否则“更高分”可能只意味着更强的普遍相互作用。
蛋白酶与血清稳定性:每一种保护都有代价
提高proteolytic stability或serum stability的常见思路包括局部序列重设计、D-氨基酸替换、N-甲基化、末端保护、环化、空间屏蔽和引入非天然氨基酸。模型可以结合已知切割motif、序列环境和理化描述符,帮助识别优先实验的位点和方案。
稳定性策略具有明显的位置依赖性。D-氨基酸可能降低某些蛋白酶对局部骨架的识别,也可能改变侧链方向、二级结构或结合几何;N-甲基化可能减少骨架氢键供体并改变蛋白酶敏感性,同时也会影响构象和受体相互作用。稳定性改善还可能以亲和力、溶解性或合成复杂度为代价。因此,预测更适合用于候选排序,实际半衰期仍需在与用途相匹配的蛋白酶或血清实验中测定。
溶解性与聚集:不能只靠增加正电荷
具有活性的多肽未必具有良好的制剂和实验行为。疏水性、净电荷、电荷分布、芳香残基聚集、连续疏水表面、两亲性以及自缔合倾向,都会影响复溶、储存、非特异吸附和聚集。AI可以将这些描述符与序列变体联系起来,寻找在保留活性motif的同时降低风险的改变。
简单增加Lys或Arg并不总是最佳解。正电荷增加可能提高水相表观溶解性或膜相互作用,也可能增强非特异结合、细胞毒性和溶血,并改变纯化行为。类似地,降低疏水性可能改善溶解性,却削弱原本重要的结合界面。合理的优化应比较多种机制不同的方案,而不是把单一描述符推向极端。
通透性与细胞进入必须和安全性一起看
多肽的膜相互作用和细胞进入受电荷、疏水性、构象柔性、侧链排列、环化、N-甲基化以及骨架氢键暴露等因素共同影响。适当的构象约束或极性屏蔽有时可以改善通透性,但具体结果依赖序列、细胞类型和检测方法;环化或N-甲基化并不保证获得有效的胞内递送。
更强的膜结合也不等于更有价值的细胞进入。提高阳离子电荷或疏水性可能同时增加膜破坏、溶血、细胞毒性和非特异吸附。因此,penetration不能脱离hemolysis、cytotoxicity和靶向活性单独优化,预测结果也不能替代PAMPA、Caco-2、细胞摄取或相应功能实验。
毒性与溶血预测适合做早期风险筛选
序列预测器、已知motif分析、理化描述符和模型ensemble可以帮助识别高风险候选。例如,在抗菌肽或细胞穿透肽项目中,可以比较正电荷、疏水矩、芳香簇与已知溶血倾向之间的关系,并优先剔除多个风险指标同时升高的变体。
这些输出是candidate ranking和early risk filtering工具,不是临床安全性结论。训练数据的实验体系、浓度、细胞或红细胞来源可能不同,模型外序列和复杂修饰还会增加不确定性。prediction score不等于experimental toxicity;最终仍需要与目标用途一致的毒性、溶血和功能实验。
天然氨基酸局部突变仍然是重要起点
AI优化不一定要引入复杂修饰,也不一定要把parent peptide改得面目全非。局部point mutation和small combinatorial library的化学路线更直接、合成解释更清楚,也更容易建立逐位点的SAR。对于已有实验支持的序列,这通常是风险最低、信息密度很高的第一轮策略。
设计时可以固定已知热点和保守位点,只探索周围少数位置;也可以为每个位置限定化学性质相近或具有明确假设的替换。这样的local optimization保留了parent peptide的证据基础,使失败和成功都更容易解释,而不是从一个活性序列跳到无法追溯的全新序列。
D-氨基酸与N-甲基化需要逐位点评估
D-氨基酸可用于探索蛋白酶抗性、局部构象和侧链朝向,但L→D替换不是保证稳定性提高且活性不变的公式。手性翻转可能破坏二级结构、改变热点侧链的空间位置,也可能影响色谱和分析行为。更合理的策略是避开已知关键结合位点,从怀疑的切割区域或结构允许的位置开始,并保留未修饰对照。
N-甲基化会直接改变主链:减少一个氢键供体,影响局部顺反异构和构象偏好,并可能改变蛋白酶敏感性、通透性、受体结合和合成难度。它不是普通侧链修饰。已有结构或构效数据可以帮助选择不依赖主链NH形成关键氢键的位置,但每个方案仍需实际合成和活性确认。关于这一策略的更多背景可参阅N-甲基氨基酸在多肽药物中的重要作用。
非天然氨基酸:扩展化学空间,而不是简单增加字母表
非天然氨基酸(noncanonical amino acids,NCAAs)可以调整疏水性、电荷、空间体积、构象偏好、蛋白酶稳定性、结合相互作用和环化选择。D-氨基酸、N-甲基氨基酸、Aib、Nal、Orn和Dab代表了不同的设计目的,而不是可以任意互换的“增强模块”。
使用NCAA时还要同步核对保护building block的可获得性、偶联位阻、脱保护兼容性、纯化行为、交期和成本。开放式生成一个理论结构并不意味着相应单体或路线实际可执行。非天然氨基酸在药物开发中的作用介绍了它们的设计空间,而具体项目还需要由多肽化学约束候选范围。
环化应稳定活性构象,而不只是“把肽变成环”
线性parent peptide可以探索二硫键、头尾、内酰胺、侧链—侧链或侧链—C端环化。合理环化可能降低结合时的构象熵损失,提高蛋白酶稳定性,并在某些体系中改善通透性;前提是闭环几何能够保留或富集bioactive conformation。
环化并非普遍改善手段。锚点选择不当可能使关键侧链错位、降低亲和力或限制必要的构象变化,还会增加保护策略、环化收率和副产物分离的复杂度。设计时应比较多个锚点和连接方式,并保留线性对照。关于结构价值和路线差异可参阅环肽设计指南。
末端与连接化学也是优化空间
N端乙酰化、C端酰胺化可以改变末端电荷和外肽酶敏感性;脂化、linker或PEG-like修饰可用于探索暴露、结合或制剂性质。它们的效果依赖连接位置、长度和用途,也可能改变溶解性、非特异结合、分析方法和体内行为。
因此,末端修饰应服务于明确瓶颈,并与未修饰parent和其他序列变体共同比较,而不是作为默认的“升级步骤”。客户特定的载荷或连接基团还需要提前确认化学兼容性和质量分析方法。
多目标优化:为什么不应该只有一个AI总分
多肽优化中的目标经常相互冲突。提高疏水性可能改善某些结合或膜相互作用,却降低溶解性和纯化表现,并增加聚集与溶血;增加正电荷可能增强膜作用,也可能提高非特异结合和细胞毒性;增加N-甲基化可能改善稳定性或通透性,却改变构象、降低亲和力并增加偶联难度。
把所有性质压缩成一个“AI总分”会隐藏这些权衡。更合适的Pareto optimization保留一组没有被其他候选在所有关键维度上同时超越的方案。例如,Candidate A偏向亲和力,Candidate B偏向稳定性,Candidate C具有更好的溶解性和早期安全性特征。项目团队再根据适应场景和实验预算选择一个有差异的验证组合,而不是相信存在一个不受条件影响的万能最佳序列。
保留parent peptide的知识与谱系
已有实验支持的parent peptide包含宝贵信息。优化时应标记活性motif、保守残基、已知结合位点、关键电荷排列、环化锚点和已验证修饰,并为允许变化的位置设定边界。除非项目目标明确需要改变作用机制,否则不应让无约束生成把parent变成完全不同的序列。
small-step optimization、iterative optimization和lineage tracking能记录每个候选来自哪一轮、改变了哪些位置以及对应实验结果。每轮保留表现可靠的“survivors”,再围绕它们传播下一代变体,可以把序列变化与性质变化联系起来。这种可追溯性比一次生成大量彼此无关的候选更有利于建立SAR和做出开发决策。
AI优化不能把一个好肽变成“不可合成的好肽”
提高预测活性的改变可能同时引入连续疏水片段、困难偶联、不可采购的NCAA、多个N-甲基位点或低效环化;即使目标产物能够形成,缺失肽、氧化形式或异构体也可能使粗品纯度下降并显著增加纯化难度。优化因此必须同步考虑protected building block availability、coupling difficulty、树脂上聚集、环化路线、crude purity和expected isolated yield。
可合成性不是候选定稿后的行政检查,而是多目标排序的一部分。上一篇《AI设计的多肽,为什么还必须经过“可合成性”筛选?》进一步解释了SPPS、NCAA、环化和纯化风险如何进入候选优先级。将设计与实际合成团队连接起来,可以避免把一个有价值的parent优化成成本过高或暂时无法验证的序列。
让实验数据进入下一轮,而不是无限增加虚拟候选
真实项目更适合迭代闭环:
Parent peptide → 第一轮受控设计 → 合成与QC → 活性、稳定性及风险实验 → 识别优胜候选 → 第二轮局部优化 → 再次合成与实验 → 最终候选选择
首轮实验应覆盖不同设计假设,而不只是若干高度相似的最高分序列。实际结果能够揭示模型未包含的体系特征,例如某个热点对活性的真实贡献、某类修饰对血清稳定性的影响或某段序列的合成问题。少量高质量实验数据持续回流,通常比无限增加虚拟候选更能提高下一轮决策质量。
AI能做什么,不能替代什么
AI适合生成受控的局部变体、比较多个设计目标、识别已知风险、建议具有明确假设的修饰,并减少需要实验搜索的空间。它也可以帮助团队保持候选多样性,避免所有资源集中到同一种性质组合上。
AI不能替代binding、stability、serum、toxicity、hemolysis或permeability assay,也不能替代实际合成、纯化和HPLC、LC-MS等分析表征。预测得到的亲和力、半衰期、毒性或通透性分数都不是实验结果。模型的输出价值在于帮助决定“先做哪些实验以及为什么”,而不是提前宣布实验结论。
推荐的已有多肽优化流程
一个可执行的design-to-synthesis流程可以概括为:
Parent peptide → 定义优化目标 → 标记受保护与关键位点 → 生成受控变体 → 序列性质评估 → 必要时进行结构评估 → 可合成性筛选 → 多目标排序 → 选择多样化候选 → 合成与QC → 实验测试 → 下一轮重设计
谱利健生物可围绕已有候选开展序列优化、理化性质平衡、D-氨基酸替换、N-甲基化、NCAA设计、环化、结构评估和可合成性审查,并衔接定制多肽合成、纯化以及HPLC和LC-MS质量分析。服务逻辑是Existing Peptide → AI Optimization → Chemistry Review → Synthesis → QC → Experimental Iteration;最终方案由项目目标和实验反馈共同决定。
结语
对已有多肽进行AI优化,最重要的不是把序列改得更多,而是让每一次改变都对应明确假设,并在活性、选择性、稳定性、溶解性、安全性和合成可行性之间保留可解释的权衡。围绕parent peptide进行小步、可追踪、多轮的设计—实验循环,能够最大限度利用已有数据,也更接近实际研发决策。
一个好的优化结果通常不是一条声称所有性质都最佳的序列,而是一组可以被合成、被比较、能够回答下一步研发问题的候选。
已经有一个候选多肽?
如果您已经获得一个具有初步活性或功能的多肽,我们可以根据您的优化目标,对序列、结构约束、稳定性、溶解性、非天然氨基酸、环化和实际合成可行性进行综合评估,并进一步完成候选多肽的定制合成与质量分析。