多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

从氨基酸序列到手算参数:21肽的理化性质、质谱与合成全流程解析

从氨基酸序列到手算参数:21肽的理化性质、质谱与合成全流程解析 把 EIKQLESEISKLEQELQSLEK 这串字符丢给我的人多半是从质谱报告、测序结果或者多肽合成订单上抄下来的。第一眼确实像乱码但只要你背过20种标准氨基酸的单字母代码就会发现这21个字母全部合法——E、I、K、Q、L、S一个不多一个不少。这意味着它不是随机字符串而是一条由谷氨酸、异亮氨酸、赖氨酸、谷氨酰胺、亮氨酸、丝氨酸按特定顺序连接而成的21肽。在生物医药研发里这种小肽太常见了它可能是一个蛋白的酶解片段、一段待验证的表位肽、一个新设计的候选药物肽或者刚从合成仪上切下来的粗产物。问题在于拿到一段只有二十来个字母的序列之后绝大多数人的下一步是直接丢进网站点预测甚至直接照着做合成下单跳过了一堆本该先搞清楚的基本盘。这篇文章就拿这条21肽当完整案例走一遍我从拿到序列到给出全套结论的标准流程手算理化参数、在线预测二级结构、数据库比对、质谱肽图推演、合成与纯化可行性预判。无论你是做抗体药、疫苗设计还是多肽表征这套流程都可以直接搬到你自己手里的序列上。1. 先解码字符为什么这串字母是能读的1.1 单字母代码就是蛋白质世界的缩写词典蛋白质序列的书写有严格约定从N端到C端每个氨基酸用一个字母表示。把 EIKQLESEISKLEQELQSLEK 展开就是 H2N-Glu-Ile-Lys-Gln-Leu-Glu-Ser-Glu-Ile-Ser-Lys-Leu-Glu-Gln-Glu-Leu-Gln-Ser-Leu-Glu-Lys-COOH。这是一条完整的21肽N端是谷氨酸C端是赖氨酸中间由19个残基串起来。很多新手拿到序列的第一反应是看不懂其实问题出在阅读习惯上。单字母代码不是给人背的是用软件跑和写文献用的但你必须能快速把字母映射回氨基酸。这里有个小技巧拿到序列先拆成小块比如 EIK / QLESE / ISKLEQ / ELQSLEK每一块单独念出来就能明显感觉到哪段偏酸性、哪段带极性、哪段是疏水尾巴。这条序列拆开看会非常清楚1-3位的EIK是个碱性开头中间4-14位是极性残基密集区15-21位虽然也有E和Q但L占了三个疏水感明显上来了。顺带说一句以后遇到一串全是A、C、G、T的字符那是核酸蛋白质序列里出现E、I、K、Q、L、S这种组合才是正常的。这套缩写词典是后面所有分析的入口连这关都过不去后面的工具用起来就是雾里看花。1.2 组成普查6种氨基酸撑起一条21肽先把序列里每种残基的数点清楚这是最原始也最不能省的一步。按顺序统计结果如下单字母氨基酸全名数目占比E谷氨酸628.6%K赖氨酸314.3%L亮氨酸419.0%Q谷氨酰胺314.3%S丝氨酸314.3%I异亮氨酸29.5%这份组成表信息量很大。E占近三成是整个序列的酸性底色L和I提供了疏水内核K是唯一的碱性残基Q和S都是极性残基也是潜在的修饰位点或者说坑位。更关键的是序列里没有什么没有C和M质谱上完全不用担心氧化带来的16 Da质量偏移没有W、F、Y280 nm紫外检测基本没信号没有P骨架少了强转角残基想折成α螺旋就少了一个天然障碍。这些看似琐碎的判断直接决定后面选什么检测波长、用什么色谱条件、纯化时有没有氧化风险——全都在几分钟统计里就已经埋下伏笔。1.3 先给这条肽画像再谈后续方案我的习惯是拿到序列先做三句话画像第一句组成上酸性残基E是K的两倍pH中性环境下净电荷一定为负第二句亲水残基E、K、Q、S加起来15个和疏水残基I、L加起来6个比例约2.5比1这是一条典型亲水肽第三句没有芳香族氨基酸紫外检测走214 nm那一路。别看这三句话简单它能帮你提前避掉一大半的坑。反例我见得太多有人拿到富含L、A、V、W的疏水肽上来就用水溶解结果白雾茫茫一片最后只能加脲或者加有机溶剂救场也有人拿着没有W、F、Y的肽做280 nm紫外定量读数几乎为零还以为是仪器坏了。序列画像准确了后续的每一步实验设计才有依据。2. 硬指标的三种算法分子量、等电点与GRAVY值都要手算一遍2.1 分子量手算从残基质量表到加合峰分子量是整条肽的身份ID几乎所有后续步骤都要用到它而它完全可以手算。每条肽的理论分子量等于所有氨基酸残基质量之和再加上一分子水因为肽链形成时脱掉一分子水计算完整肽段时要补回来。常用平均残基质量如下I 和 L 都是113.16 DaE是129.11 DaQ是128.13 DaK是128.17 DaS是87.08 Da。按组成表逐个乘再加残基数量平均残基质量Da小计DaE6129.11774.66I2113.16226.32K3128.17384.51Q3128.13384.39L4113.16452.64S387.08261.24合计21—2483.762483.76 Da是残基合计加上一分子水18.01 Da得到完整肽段理论分子量约2501.77 Da。这个数值对应的常见带电离子单电荷加氢峰 [MH] 约2502.8双电荷 [M2H]2 约1251.9三电荷 [M3H]3 约834.9。如果你做ESI质谱会在这些位置附近看到一簇峰如果样品里有钠离子还会出现 [MNa] 约2524.8的加合峰别把22 Da当成杂质。手算完了再用ExPASy的ProtParam或者PeptideMass验证一遍。工具给的是单同位素质量会比平均质量低零点几个Da这是正常的不是算错了。我建议你在实验记录本上把两套数都记下来后面跟合成公司确认产品、自己解析谱图时都用得上。2.2 净电荷与pI为什么它在pH 7.4的缓冲液里带-3净电荷决定了这条肽在什么缓冲液里能溶、用什么离子交换柱去纯化。带上离子化基团的pKa来算N端氨基约8.0C端羧基约3.1赖氨酸侧链约10.5谷氨酸侧链约4.3。pH 7.4条件下N端贡献1C端贡献-1三个K各贡献1合计3六个E各贡献-1合计-6最后净电荷就是1-13-6等于-3。净电荷为负结论很直接做离子交换该选阴离子交换柱做等电聚焦该从酸性侧跑溶解时不要往体系里加酸。再说等电点pI——当pH降到谷氨酸侧链pKa附近时E的负电荷开始被中和整条肽净电荷归零。按六个E、三个K、两端基团一起算pI大概落在4.3到4.5之间。这是个非常要命的区间如果你的实验缓冲液pH恰好落在4.5附近这条肽会接近零电荷溶解度骤降、容易沉淀、在柱子上的行为也会变得很怪。我处理过不少客户寄来的沉淀样品一查缓冲液配方pH正好压在pI附近问题根本不是肽不行是缓冲液选错了。所以pI这个数一定要心里有底。2.3 GRAVY值-1.0意味着这条肽爱水不爱油GRAVY是平均亲水性系数把每个残基的疏水参数Kyte-Doolittle标度加总再除以残基数。这条序列里E、Q、K、S的系数分别为-3.5、-3.5、-3.9、-0.8I和L分别为4.5和3.8。做个简单算术2×4.5加4×3.8等于24.2六个E贡献-21.0三个Q贡献-10.5三个K贡献-11.7三个S贡献-2.4总和-21.4除以21得到GRAVY约-1.02。负值越大越亲水-1.0在常见肽里算相当爱水的了。这个值的直接后果有三条第一反相C18上保留通常比较弱这种肽很容易在前几个保留体积就冲出来纯化时别把初始乙腈比例调太高第二冻干粉末容易吸潮分装溶解要快第三它几乎不可能是一条跨膜片段别往膜蛋白方向硬套功能。跑到这一步序列的基本盘已经全在脑子里了。3. 二级结构预测这条21肽是螺旋坯子还是无序肽3.1 在线工具体验PSIPRED和SOPMA的实际输出习惯现在可以上在线工具了但我得先泼盆冷水单条短肽的二级结构预测准确率远没有大家想象的高因为短肽缺乏长程相互作用约束。常用的有PSIPRED 4.0和SOPMA把FASTA格式序列粘进去几秒钟就能得到每个残基的状态预测H代表α螺旋E代表β折叠C代表无规卷曲。以这条序列的组成为例预测结果几乎可以预判E、L、Q、K、I都是强成螺旋残基S是中性的序列里没有P这个螺旋破坏者也没有G这种强卷曲倾向残基所以输出大概率是H占绝对优势占比70%以上中间偶尔插几个C。你要做的不是盯着百分比高兴而是看它把C放在哪几个位置——通常会在S附近或段落连接处这些位置恰恰就是将来结构柔性的潜在区域。3.2 手推α-螺旋倾向带电残基的排布很有看点工具之外我建议你亲手做一次残基倾向推演这比工具输出更能培养手感。按Chou-Fasman参数这条21肽的21个残基里有18个属于螺旋倾向或中性偏螺旋没有脯氨酸这种强破坏者。把序列往螺旋轮helical wheel上画一圈你会看到很有趣的图景在α螺旋里位置i和i3、i4的残基落在螺旋的同侧这条序列的E分布在1、6、8、13、15、20位彼此正好间隔3或4个残基的模式反复出现意味着它们很可能聚在螺旋的同一侧形成一个连续的酸性面而L和I分布在另一侧形成疏水面。这种一面带电、一面疏水的两亲性螺旋结构是很多膜相互作用肽和抗菌肽的经典特征。但注意这只是基于假设它确实折成螺旋推出来的可能性。序列上看着像不代表溶液里就是这个构象两亲性螺旋必须用实验验证。3.3 预测终归是预测结构验证靠什么想拿结构信息现在最方便的是把序列丢给AlphaFold Server中文社区习惯叫AlphaFold3页面或者ESMFold、ColabFold。单链21肽跑起来非常快通常会得到一个螺旋占比很高的三维模型。但这里有个真实的坑AlphaFold对短肽的预测并不靠谱因为短肽缺少进化共变信息pLDDT分数往往不高模型提供的更多是大致形态猜想不是答案。真正想在溶液里验证二级结构推荐圆二色谱CD190到250 nm扫一圈208 nm和222 nm两个负峰一出α螺旋特征就直接摆在眼前。样品浓度做到0.2到0.5 mg/mL缓冲液尽量选低盐磷酸盐体系。条件可以梯度尝试比如加20%到50%的TFE三氟乙醇看螺旋含量怎么变化这能同时回答这条肽本身能不能折和外界条件怎么影响它折叠两个问题。做药物肽设计的朋友还可以补一核磁但那是后话不展开。4. 数据库与同源检索它像谁查不到又该怎么办4.1 拿到序列先做一次BLAST序列分析的标准动作之一是同源检索。拿UniProt BLAST或NCBI的blastp把21个字母粘进去如果怀疑某物种来源可以在taxid那里限定一下序列特别短的时候记得勾选short query选项把E-value阈值放宽一点。怎么解读结果如果一条全长蛋白里出现一段与这条21肽100%一致的片段那基本可以锁定来源如果只有60%到80%的一致性可能只是保守片段或巧合E-value大于0.1的匹配基本可以忽略。坦率讲我经手过的短肽序列里能拿到漂亮同源命中的不超过三分之一因为20mer这个长度太短随机匹配的概率很高。我自己处理这条21肽时能拿到的也都是一些低覆盖率的泛蛋白酶匹配谈不上有价值的命中。你是来获得真实的流程认知的我不编造一个漂亮的数据库命中哄你。4.2 查不到同源孤儿序列的正确打开方式如果BLAST没有显著命中别急着否定这条肽的价值。它可能来自尚未注释的基因组区域可能是新设计的合成肽也可能只是一个随机筛选出来的先导序列。正确的下一步是先限定更小的数据库再试一轮比如只搜某个物种的重叠群或表达序列标签如果仍然没有就把它当作一条全新序列处理靠完整的理化表征和功能实验建立数据档案。这里特别提醒一句短于30个残基的肽BLAST命中率天然低这是统计学问题不是你的序列有问题。不要因为查不到就否定后续实验的必要性很多有功能的表位肽和抗菌肽就是孤儿序列。4.3 让AlphaFold和ESMFold给你一个三维猜想三维层面的猜想同样值得跑一轮。把序列丢进ESMFold的公开入口几秒到几十秒就能返回一个PDB文件AlphaFold Server体验更友好附带PAE数据能告诉你哪些区域预测得自信、哪些区域只是糊上去的。用PyMOL或ChimeraX打开模型重点看两件事螺旋占比是否符合之前二级结构预测的预期带电残基在表面上的分布是否形成连续的带电斑块。这条21肽的模型大概率为高螺旋形态但pLDDT不会太好看这属于短肽的常态。你可以把模型归档留作参考但写文章、报课题的时候务必以实验数据为准能把AlphaFold单链短肽模型直接当结论用的场景非常少。5. 质谱场景理论酶切肽图与b/y离子验证5.1 用Trypsin切一遍算理论肽图这条序列要做质谱鉴定最常用的酶是Trypsin它专一切在K和R的C端一侧后面不跟P时。序列里没有R只有三个K分别在第3、11、21位所以理论酶切会得到三段片段位置序列理论分子量Da11-3EIK388.424-11QLESEISK933.0312-21LEQELQSLEK1216.3三个片段分子量之和比完整肽多了36.02 Da正好是一次酶切加一分子水、两次酶切加两分子水的量这可以作为自检。实际做LC-MS/MS时你会先看到这三个前体离子再去分别打二级碎片。如果想换一种验证角度可以再用GluC金黄色葡萄球菌V8蛋白酶切在E的C端重新酶切。这条序列E多用GluC会得到E、IKQLE、SE、ISKLE、QE、LQSLE、K这样一串更短的肽和Trypsin的产物互为印证。多酶切交叉验证是我在确认合成肽序列时最常用的手段。5.2 b/y离子系列怎么用碎片质量读出序列二级质谱的底层逻辑非常简单前体离子被碎裂后N端碎片叫b离子C端碎片叫y离子相邻两个b离子或y离子的质量差就是一个氨基酸残基的质量。理论上从头到尾数一遍碎片峰就能把序列读出来。具体到这条肽C端是K所以y1离子约147.1这是非常经典的参考峰N端是Eb1约130。从两头往中间拼再用L/I都约113.16、E129.11、Q128.13、K128.17、S87.08这几个质量数去核对连续差值序列就能一步步锁出来。这里必须提醒你两个质谱的经典陷阱。第一L和I的残基质量完全相同质谱永远分不清它们这条序列里有两个I和四个LMS/MS只能读出这里有个113.16的残基想区分亮氨酸和异亮氨酸必须靠标准品对照或者额外的二级手段第二E和Q只差0.98 Da低分辨率仪器根本分不出来必须用Orbitrap或FT-ICR这类高分辨仪器才能靠这条微小质量差做判断。我的经验是解析这类富含E/Q的肽段一定把MS1和MS2的质量精度设置到小数点后两位以内否则一个E/Q错位就会让整段序列推错。5.3 修饰位点的坑Q脱酰胺与N端环化质谱验证序列时修饰加峰会让人抓狂这条序列恰好有两个高发修饰点。Q在4、14、17位有三个谷氨酰胺在中性或偏碱条件下容易脱酰胺变成谷氨酸质量增加0.98 Da它会精确地伪装成E/Q错配高分辨仪器还能看到1 Da的卫星峰。合成肽冻干粉如果保存不当脱酰胺峰经常出现别直接判定为杂质肽先核对是不是Q变成了E。另外N端是E在酸性溶液或储存过程中可能发生环化形成焦谷氨酸质量会减少约18.01 Da。大家通常都知道N端Q环化掉氨-17.03却经常忽略N端E环化脱水-18.01。我的做法是拿到质谱报告先扫一眼有没有[M-18]和[M1]两个特征峰有的话先往环化或脱酰胺上想能省去大量无谓的排查。6. 如果它是一条合成肽下单、纯化与储存的实操清单6.1 合成可行性21mer在固相合成里属于常规款如果你打算做多肽合成先说结论21个氨基酸、分子量约2.5 kDa这在固相合成领域属于标准操作绝大多数多肽公司的常规合成范围到30到40mer都没问题价格也在常规区间。这条序列还自带几个友好属性没有Cys和Met不存在氧化和错误二硫键问题没有Trp、Tyr、Phe纯化检测不用依赖芳香族发色团全程亲水合成过程中发生疏水聚集的风险远低于那些富含L、V、I的难溶肽。相对难一点的是E含量高谷氨酸侧链在偶联过程中偶尔会拉低效率尤其是13到20位这段E、Q、L交错的部分。我的建议是采购时直接跟公司要三点合成报告HPLC谱图、质谱报告至少确认目标峰、纯度定量方式。很多公司标纯度95%指的是HPLC峰面积百分比不是绝对纯度这两个概念差了十万八千里验收时记得问清楚。6.2 纯化条件214 nm检测、C18柱、别猛加乙腈这条肽完全没有芳香族氨基酸280 nm测不到东西必须用214 nm检测——214 nm是肽键的强吸收波长几乎所有多肽都在这里读数。反相HPLC条件建议从下面这组基础配方开始试参数建议值色谱柱C184.6×250 mm检测波长214 nm流动相A0.1% TFA水溶液流动相B0.1% TFA乙腈溶液梯度5%到50% B30分钟由于这条肽GRAVY只有-1.0亲水性太强在C18上的保留会很弱可能出现不上柱或出峰太早的情况。这时候不要本能地把B相起点往上调反而应该保持低有机相起步必要时加一点离子对试剂增强保留如果C18始终留不住换成HILIC模式试试亲水肽在HILIC柱上往往表现更好。跑完主峰后必须做ESI-MS确认分子量看[MH]是否落在2502.8附近同时留意有没有36.02的缺失峰之类异常信号。6.3 溶解、分装与储存把肽养好的细节合成肽到手是冻干粉别急着整瓶加水。先离心一下让粉末沉底再开盖。溶解这条肽优先用无菌水或者10 mM PBSpH 7.4因为它在这个pH下净电荷约-3溶解性最好千万不要把缓冲液配到pH 4到5那正好压在它的pI上最容易析出。万一水溶不动可以逐滴加稀氨水或0.1 M碳酸氢铵pH 8助溶但注意碱性条件放久了会加速Q脱酰胺所以溶好之后不要在室温长时间放着。分装是必须的按单次用量分到小管能冻干就冻干保存不能冻干就-20℃冻存液体。反复冻融是最伤肽的每冻融一次脱酰胺和聚集风险就涨一截尤其是这种Q、E含量高的序列。我见过不少人把母液放4℃冰箱一放一个月再做实验活性全没了还找理由说肽纯度不够其实是储存方式出了问题。最后再分享一个我个人的习惯拿到任何未知序列先花十分钟手算一遍分子量、pI、GRAVY这三个数再上在线工具。不是工具不准而是这个过程能让你对这条肽是什么性格建立直觉——酸性还是碱性、亲水还是疏水、紫外能不能检测、合成难不难全都藏在这三个数里。这次这条21肽的性格就很明确酸性、强亲水、高螺旋倾向、质谱友好。你手里如果也有一条只有二十多个字母的序列完全可以照这套流程走一遍记得把手算值和工具输出粘到同一个Excel里留档后面写论文补材料、跟合成公司沟通、或者复查数据这份档案都会让你省下大量时间。
返回列表