






















Multiomics analysis of primary metabolism reveals the genetic basis of nitrogen partitioning modulated by ZmAVT1A-1 in maize

玉米氮素如何流向籽粒?多组学锁定关键运输因子
玉米多组学、初级代谢、氮素分配、ZmAVT1A-1、氮肥利用效率
这篇文章通过整合基因组学、转录组学、代谢组学、数量遗传学和转基因功能验证等多层次数据,探索了玉米初级代谢网络的遗传调控基础,以及氨基酸转运蛋白编码基因 ZmAVT1A-1 如何调节营养器官与籽粒之间的氮素分配,这对于培育兼具高产、优质和高氮肥利用效率的玉米品种具有重要意义。研究以24个遗传背景多样的玉米自交系为创始亲本构建的CUBIC群体为基础,对1,404个后代材料的幼苗叶片和成熟籽粒开展代谢物检测,试图以初级代谢物这一中间表型为桥梁,打通从基因变异到产量、品质和氮素利用性状之间的复杂关系。
研究共检测到144种代谢物,并选择其中经过标准品确认的86种代谢物进行重点分析。其中,叶片检测到67种,籽粒检测到68种,49种同时存在于两种组织。研究发现,重组后代的代谢变异范围显著大于亲本,说明多亲本群体中的遗传重组释放了丰富的代谢多样性。进一步结合约1,180万个SNP开展不同框架下的代谢物全基因组关联分析,共鉴定出1,373个代谢数量性状位点。多数位点的单独效应较小,说明玉米初级代谢并不是由少数主效基因控制,而是受到大量小效应位点、组织特异性调控和复杂网络关系的共同影响。
在此基础上,作者进一步整合代谢物QTL、基因表达、共表达关系、代谢物之间的相关性以及农艺性状数据,构建高置信度的代谢调控网络,并从中筛选出可能直接影响代谢物积累的候选基因。研究重点锁定了编码推定氨基酸转运蛋白的 ZmAVT1A-1。自然变异、基因敲除、过表达和同位素示踪结果共同表明,该基因不仅影响游离氨基酸含量,还参与根系氮素吸收以及营养器官向籽粒的氮素再转运。ZmAVT1A-1功能缺失会导致更多氮素滞留在下部茎秆中,籽粒获得的氮素减少;过表达则有利于氮素吸收和向籽粒迁移,并在低氮条件下延缓叶片衰老、维持光合能力。
文章最重要的认识并不是简单地找到了一个增产基因,而是揭示了代谢枢纽基因常常具有明显的多效性和权衡效应。ZmAVT1A-1过表达能够提高单株产量和籽粒蛋白积累,但在小区尺度上的产量增益并未稳定达到显著水平。这说明代谢基因对局部生理过程的改善并不一定会直接转化为大田群体产量的大幅提升。因此,作物改良不能只关注单一性状或单个候选基因,而需要在氮素吸收、源库分配、籽粒品质、群体结构和环境适应性之间进行系统权衡。

研究首先利用由24个多样化创始亲本衍生的1,404份CUBIC玉米后代,在幼苗叶片和成熟籽粒中开展基于气相色谱—质谱联用技术的非靶向和标准品辅助代谢组检测。作者对代谢物含量进行标准化、组织间比较、相关性聚类和遗传变异分析,从而识别叶片与籽粒共有或特异的代谢模块。
随后,研究基于约1,180万个SNP,分别实施单标记GWAS和单倍型GWAS,鉴定代谢数量性状位点,并估算各位点及全部位点对代谢表型变异的解释比例。作者进一步将mQTL与转录组数据、表达数量性状位点、代谢物相关网络、已知生化通路及农艺性状QTL进行整合,构建从遗传位点、候选基因、基因表达、代谢物到复杂农艺性状的多层次调控网络。
对于网络筛选出的ZmAVT1A-1,研究比较其自然单倍型,并构建基因敲除和过表达材料,在正常氮和低氮条件下开展盆栽、控制池和田间试验。研究同步测量植株生物量、叶片SPAD值、衰老进程、单株产量、籽粒蛋白浓度和不同器官氮含量。为直接观察氮素流动,作者还开展了15N-尿素脉冲追踪实验,分别测定籽粒、叶片、茎秆等组织中的总氮和15N丰度,以区分氮素吸收与源库再分配过程。
代谢组分析显示,1,404份后代材料在叶片和籽粒中的代谢变异均显著超过24个亲本。86种重点代谢物可划分为多个具有组织特异性的相关模块,其中氨基酸分别在叶片和籽粒中形成显著聚类。GWAS共鉴定1,373个mQTL,包括叶片中的286个单标记QTL和395个单倍型QTL,以及籽粒中的207个单标记QTL和485个单倍型QTL。籽粒代谢物的平均遗传解释率高于叶片,说明成熟籽粒的代谢组成具有相对更稳定的遗传控制。
多组学网络将ZmAVT1A-1定位为氨基酸积累和氮素流动的关键调控节点。15N示踪显示,敲除植株向籽粒分配的总氮和新吸收15N减少,而下部茎秆中的氮素滞留增加;过表达材料在幼苗期表现出更高的15N吸收能力,并在灌浆期将更多氮素转运至籽粒。这些结果与组织生物量变化相互印证,证明ZmAVT1A-1同时参与氮素获取和源库再分配。
在低氮环境中,敲除植株约从授粉后45天开始表现出更早的叶片衰老和较低的SPAD值,单株产量下降16.0%—21.1%;过表达植株则表现出延迟衰老和较强的持绿性,单株产量提高10.8%—20.0%。过表达还使籽粒蛋白浓度提高3.0%—5.6%,单株籽粒总蛋白产量最高增加16.6%。不过,过表达材料在小区尺度上的产量增加趋势未达到稳定显著,表明该基因对于维持基础产量十分重要,但单独提高其表达量未必能够突破群体产量上限。
构建了大规模玉米初级代谢多组学资源。 研究覆盖1,404份多亲本后代,将代谢物作为连接基因型与复杂农艺性状的中间层,提高了小效应代谢调控位点的识别能力。
实现了从网络预测到生理机制验证的完整闭环。 研究不仅利用多组学网络筛选ZmAVT1A-1,还通过敲除、过表达、田间试验和15N示踪证明其调控氮素吸收与再分配。
突出揭示了作物代谢改良中的多效性权衡。 文章没有将ZmAVT1A-1简单包装为高产基因,而是展示了品质、单株产量、器官氮分配和群体产量之间并不完全一致。
ZmAVT1A-1过表达在单株水平表现出增产和增蛋白效应,但小区尺度产量增益未稳定达到显著水平,其育种价值仍需在更多生态区、密度和氮肥制度下验证。
多组学网络能够提高候选基因筛选效率,但其中许多基因—代谢物关系仍属于统计推断,尚未通过遗传转化或生化实验逐一验证。
研究主要围绕一个核心候选基因展开,尚未系统解析ZmAVT1A-1与其他氮转运蛋白、氨基酸代谢酶和源库信号通路之间的互作关系。
Graph-based pan-genome reveals structural variations associated with agronomic traits in mung bean

绿豆泛基因组解锁结构变异与育种靶点
绿豆泛基因组、结构变异、全基因组关联、黄酮含量、抗豆象育种
这篇文章通过构建由11份全球代表性绿豆材料组成的图结构泛基因组,并整合580份种质资源的重测序数据和五个环境中的农艺性状调查,探索了传统单一线性参考基因组难以捕获的结构变异及其对绿豆驯化、品质和抗虫性状的影响,这对于利用分子标记、基因组选择和基因编辑加速绿豆遗传改良具有重要意义。绿豆具有生育期短、固氮能力强、营养价值高和耐旱适应性好等优势,但其基因组研究和现代育种技术明显落后于水稻、玉米和大豆。以单一参考基因组为基础的SNP分析容易遗漏大片段插入、缺失、倒位和拷贝数变化,从而造成部分遗传力和关键功能变异无法被发现。
研究选择11份遗传背景多样的野生、地方和改良绿豆材料,完成染色体水平的从头组装,并将这些基因组整合为图结构泛基因组。该资源共包含75,268个基因家族,其中50.86%为核心基因家族,35.19%为非必需基因家族,13.95%为材料特有基因家族,显示绿豆种内存在大量在单一参考基因组中缺失的基因内容。研究进一步鉴定出66,862个非冗余结构变异,为系统分析绿豆结构变异的分布、频率及功能影响提供了基础。
研究同时对580份种质资源进行全基因组重测序,材料包括426份地方品种、97份改良品种和57份野生材料。群体遗传分析揭示了绿豆不同地理群体间的分化、迁移和驯化关系。作者将SNP和结构变异分别用于跨五个环境的全基因组关联分析,为20项农艺性状鉴定候选位点。结果表明,SNP与结构变异具有互补性:SNP由于密度较高,对百粒重等性状具有较强检出能力;结构变异则更容易直接改变启动子、基因结构和邻近基因表达,因此能够发现传统SNP分析遗漏的调控变异。
文章对两个代表性位点进行了深入验证。其一,VrTIFY6B 启动子区域的68 bp插入与编码区SNP共同调节种皮黄酮含量,不同单倍型表现出明显的表达和代谢差异。其二,VrPGIP1 启动子区域136 bp缺失可增强基因表达,提高其对真菌多聚半乳糖醛酸酶的抑制作用,并增强对豆象的抵抗能力。人工种子和昆虫取食实验进一步证明,VrPGIP1蛋白含量上升能够显著抑制豆象发育。
总体而言,这项研究把建立高质量基因组资源、描绘群体进化历史、定位农艺性状位点和验证可利用功能变异串联起来,为绿豆育种提供了可直接开发的分子标记。然而,研究也表明并非所有性状都适合仅依赖结构变异解析,未来育种应综合利用SNP、结构变异、基因表达和环境互作信息。

研究首先选取11份具有代表性的野生、地方和改良绿豆种质,结合长读长测序、短读长校正和Hi-C染色体互作数据完成染色体水平的从头组装。作者对各基因组进行统一的重复序列和蛋白编码基因注释,比较基因家族的存在与缺失,并将11套基因组与线性参考整合为图结构泛基因组,以识别插入、缺失、倒位和其他复杂结构变异。
随后,研究对580份全球绿豆资源进行全基因组重测序,鉴定SNP、短插入缺失和结构变异,并通过系统发育树、主成分分析、群体结构分析、连锁不平衡和遗传多样性指标解析种群分化与驯化历史。研究在五个环境中调查开花期、株高、百粒重、种皮黄酮、抗豆象等20项农艺和品质性状,分别开展SNP-GWAS和SV-GWAS,并结合候选区域内的基因注释、单倍型、表达差异和选择信号筛选功能基因。
针对VrTIFY6B,作者比较不同启动子和编码区单倍型的表达与黄酮含量,并通过农杆菌介导的毛状根体系和异源植物表达实验验证其功能。针对VrPGIP1,研究开展启动子变异与表达分析、酶抑制实验以及添加不同浓度重组蛋白的人工种子豆象侵染试验,以评估该基因对害虫发育和成虫羽化的影响。
图结构泛基因组鉴定出75,268个基因家族和66,862个非冗余结构变异,说明单一参考基因组只能覆盖绿豆种内部分遗传内容。580份材料中共检测到约622万个SNP和71万个短插入缺失,其中大量变异位于编码区并可能引起氨基酸替换、移码或提前终止。群体分析显示,野生、地方和改良材料之间具有清晰的遗传分化,不同染色体区域在驯化和环境适应过程中受到的选择强度存在明显差异。
跨五个环境的联合GWAS为20项性状定位了候选区域。结构变异经常与附近基因表达下降相关,可能通过破坏转录因子结合位点、改变染色质可及性或引起移码和无义介导降解发挥作用。与此同时,SNP与SV对不同性状的解释能力并不相同,联合分析能够比单一变异类型覆盖更多遗传信号。
在种皮黄酮含量位点中,VrTIFY6B启动子68 bp插入及其编码区SNP形成的单倍型与黄酮含量显著相关。转基因毛状根和异源表达结果支持VrTIFY6B参与黄酮积累调控。在抗豆象位点中,VrPGIP1启动子136 bp缺失与更高的基因表达和抗虫性相关。人工种子实验显示,随着VrPGIP1蛋白添加量增加,豆象羽化和种子损伤受到明显抑制,证明该结构变异可作为抗豆象育种的候选功能标记。
建立了高质量图结构泛基因组。 相比依赖单一参考序列的传统分析,该资源能够表示不同材料中特有的基因和复杂结构变异。
将SNP与结构变异联合用于农艺性状解析。 研究展示了两类变异在性状定位中的互补作用,有助于解释传统GWAS中的缺失遗传力。
提供了可直接用于育种的功能变异。 VrTIFY6B启动子插入和VrPGIP1启动子缺失分别对应黄酮品质和抗豆象性状,具有较强的标记开发潜力。
11份从头组装材料仍不足以完全代表全球绿豆基因组多样性,且580份种质中约94%来源于亚洲,其他地区种质代表性相对有限。
由于绿豆稳定遗传转化体系仍不成熟,部分候选基因主要通过毛状根、瞬时表达或异源植物系统验证,尚缺少绿豆稳定转基因和精准编辑证据。
许多结构变异与基因表达之间仍属于关联关系,其具体如何改变转录因子结合、染色质状态或RNA稳定性,需要进一步开展分子机制实验。
Improved heritability partitioning and enrichment analyses using summary statistics with graphREML

用图模型重估遗传力:graphREML提升富集检出率
遗传力分解、graphREML、GWAS汇总统计、连锁不平衡、功能富集分析
这篇文章通过将GWAS汇总统计量与稀疏连锁不平衡图模型相结合,开发了基于最大似然估计的遗传力分解方法graphREML,探索了如何在不获得个体水平基因型数据的情况下,提高功能注释遗传力富集分析的精度和统计功效,这对于识别复杂疾病相关调控元件、关键细胞类型和功能基因集具有重要意义。现有应用最广泛的方法是分层连锁不平衡评分回归,即S-LDSC。该方法计算速度快,能够处理重叠注释和公开GWAS汇总数据,但它主要依赖矩估计和压缩后的LD评分,无法充分利用完整连锁不平衡结构,因此在疾病样本量有限或真实富集效应较弱时容易出现统计功效不足。
graphREML的核心创新,是利用从全基因组谱系关系推导的LD图模型,以极为稀疏的精度矩阵表示SNP之间的连锁不平衡关系。稀疏矩阵使原本计算成本极高的GWAS Z分数似然函数可以被有效求解,从而兼顾基于似然方法的高效率和汇总统计方法的可获得性。该方法还允许通过非负链接函数描述SNP功能注释与单位SNP遗传力之间的关系,避免S-LDSC线性模型可能产生负遗传力估计的问题。
作者通过广泛模拟比较graphREML与S-LDSC,系统改变GWAS样本量、遗传结构稀疏程度、等位基因频率依赖性、链接函数设定、GWAS与LD参考样本匹配程度及缺失SNP比例。结果显示,两种方法总体上均无明显偏倚,但graphREML的估计方差更小,平均相对效率约为2.47,相当于在某些场景中将有效样本量提高约一倍。即使在稀疏遗传结构、模型设定偏差或LD参考样本不完全匹配时,graphREML仍保持较高效率。
在真实性状分析中,graphREML与S-LDSC给出的平均富集倍数高度一致,说明二者并非在效应方向上产生系统冲突。区别主要体现在标准误和显著性检出能力:graphREML在分析的性状—注释组合中检出81个显著结果,而S-LDSC仅检出32个,前者约为后者的2.5倍。例如,在神经质性状分析中,graphREML能够识别DNase高敏感区域和启动子的显著富集,而S-LDSC由于标准误较大未能检出。
研究还提出快速条件富集检验graphREML-ST,只需拟合一次基础模型并保存每个变异的少量导数统计量,即可快速检验大量候选注释。总体上,graphREML不是简单替代S-LDSC,而是在需要高精度、低标准误和更强弱信号检出能力的场景中提供了更有效的选择。

graphREML以GWAS边际效应Z分数为输入,利用LD图模型的稀疏精度矩阵建立汇总统计量的完整似然函数。作者采用二阶优化、近似Hessian矩阵和信赖域算法估计不同功能注释对应的遗传力参数,并通过非负逆链接函数约束单位SNP遗传力。方法同时支持边际富集与在基础功能注释模型条件下的条件富集。
标准误采用近似区块刀切法估计。模型收敛后,作者利用删除单个基因组区块时的梯度和Hessian矩阵进行一次Newton–Raphson更新,从而避免反复完整拟合模型。假设检验使用Wald检验和Delta方法。针对大量候选注释,研究还设计了快速评分检验graphREML-ST。
模拟数据基于1000 Genomes欧洲样本的LD图模型生成,并引入baselineLD中的真实注释及随机注释。模拟场景涵盖不同样本量、稀疏遗传结构、MAF依赖、链接函数错误设定、GWAS与LD参考不匹配及SNP缺失。真实数据分析则覆盖多种定量性状、疾病性状和基于家族史推断的表型,并与S-LDSC在估计偏倚、方差、显著性数量和校准程度方面进行比较。
模拟结果显示,在标准无穷小遗传模型下,graphREML与S-LDSC均能获得近似无偏的遗传力和富集估计,但graphREML的平均相对效率达到2.47。随着样本量增加,两种方法方差均下降,但graphREML在各样本规模下均更精确。在稀疏遗传结构下,graphREML平均相对效率约为2.73;在链接函数错误设定下仍达到约2.54。
刀切标准误在多数模拟场景中具有良好校准,Ⅰ类错误总体得到控制。不过,在遗传结构极度稀疏且零效应注释很小时,可能出现一定程度的假阳性膨胀,而且主要表现为错误的遗传力耗竭信号。该结果构成了使用graphREML时需要注意的边界条件。
真实数据中,两种方法的平均富集估计高度一致,但graphREML标准误通常更小。例如,心血管疾病中受抑制染色质注释的富集估计分别约为0.58和0.59,但S-LDSC标准误超过graphREML的三倍。全部性状—注释组合中,graphREML检出81个显著结果,S-LDSC检出32个。即使汇总统计中缺失约89%的SNP,只保留HapMap3变异,通过代理标记建模后得到的富集估计仍与完整SNP分析高度一致。
同时兼顾汇总统计的可获得性与似然方法的高效率。 graphREML不需要个体水平数据,却能够利用比LD评分更完整的连锁不平衡信息。
显著提高弱富集信号的发现能力。 在真实数据中检出的显著性状—注释关系约为S-LDSC的2.5倍。
提供灵活的遗传力函数建模。 非负链接函数可避免不合理的负单位SNP遗传力,并支持连续和重叠功能注释。
graphREML本身不能自动消除群体分层和亲缘关系混杂,需要在GWAS阶段充分校正,或输入S-LDSC截距等额外信息。
在极度稀疏遗传结构和很小的零效应注释中,Ⅰ类错误可能膨胀,尤其可能产生错误的遗传力耗竭结论。
方法性能依赖LD图模型及参考群体质量,在祖源差异较大或缺少高质量LDGM资源的人群中,适用性仍需进一步检验。
Pervasive interactions between exposures and polygenic risk can inform more effective clinical and behavioral interventions

基因风险并非命定:环境暴露可放大疾病效应
多基因风险评分、基因环境互作、疾病预测、暴露分层、精准干预
这篇文章通过分析英国生物样本库中408,801名参与者的多基因风险、疾病结局及75类生活方式、社会经济、生化和生理情境,探索了不同暴露组合如何改变多基因风险评分与疾病发生之间的关系,这对于校准多基因风险评分、识别高收益干预人群和推进更加公平的精准医学具有重要意义。传统PGS通常假设遗传风险在不同社会和环境背景下具有相近效应,但疾病患病率、营养状况、吸烟、运动、社会经济条件和代谢指标都可能改变遗传变异的实际表现。若忽略这些情境差异,同一个PGS阈值可能在低风险和高风险人群中对应完全不同的绝对疾病风险。
研究围绕冠心病、2型糖尿病、BMI定义肥胖、腰臀比定义肥胖、炎症性肠病、慢性肾病和哮喘七类疾病构建PGS,并考察75种情境的两两组合。每种情境被划分为低风险和高风险,由此形成双低、单高和双高四种组合。作者共拟合24,198个PGS×情境模型,其中746个模型同时满足两项显著性标准,占3.1%,最高约为随机预期数量的四倍。加入交互项后,部分模型的疾病预测拟合度得到改善,例如冠心病模型的R²由0.80提高至0.83。
研究发现,PGS×情境互作的主要机制并不是在不同环境中出现完全不同的遗传变异,而是同一批遗传效应在不利情境中被系统性放大。例如,吸烟、较低的ω-6多不饱和脂肪酸水平、较慢步速、社会剥夺和不良代谢状态均可能增强高PGS个体的绝对风险。基于不同暴露组开展的GWAS及mash模型显示,高风险与低风险情境中的SNP效应方向通常高度相关,但高风险情境中的效应幅度更大。这种去稳态化或遗传效应放大,使不利环境中的高遗传风险人群承受额外疾病负担。
为了将统计互作转化为临床可解释指标,作者提出获益所需比例PNB。PNB用于估计在不同PGS阈值下,需要有多少人改变某种可调节暴露,才能使其中一人获得理论上的疾病风险降低。例如,在不考虑遗传风险时,冠心病高风险情境中约每21人改善胆固醇和吸烟状态,可能有1人获益;若仅针对PGS最高20%的人群,PNB可下降至约11。对于2型糖尿病,理论上高PGS人群中约五分之一可能从加强运动和降低血糖相关暴露中获益。
文章强调,这些结果不能直接证明改变某项暴露必然导致相应幅度的疾病风险下降,因为研究主要依据观察性数据,情境变量也可能是疾病结果、遗传背景和社会因素共同作用的标志。但研究有力说明,PGS不应脱离现实环境单独解释。未来精准干预需要联合遗传风险和可调节暴露,同时增加对不利社会环境和非欧洲祖源群体的代表性采样。

研究选取UK Biobank中408,801名自报白人英国参与者,为七类常见疾病构建PGS,并依据自报信息、ICD-10诊断和首次住院日期定义既往病例和十年内新发病例。75项情境涵盖膳食、运动、吸烟和饮酒行为、社会经济指标、早期生活因素、血液代谢物、生理指标及性别等。
作者将每个连续情境按均值划分为高、低风险组,分类变量则依据问卷答案分组。每两个情境组成四种联合暴露状态,并绘制疾病风险随PGS百分位变化的曲线。研究利用责任阈值模型和多项式拟合比较无交互、加性和含PGS×情境交互项的模型,通过两类标准筛选显著互作,同时进行70%训练、30%测试的交叉验证。
为分析机制,作者在高风险和低风险情境中分别估计SNP效应,利用mash混合协方差模型判断效应方向和幅度是否一致,并以BOLT-REML比较遗传方差。研究还通过模拟考察异方差、基因—环境相关及不同遗传力条件下的Ⅰ类错误和统计功效。最后,作者根据高、低风险情境下风险—PGS曲线的面积差计算PNB及其对应的精确度、敏感度和特异度。
24,198个模型中有746个检测到显著PGS×情境互作,占3.1%,部分疾病中的显著数量达到随机预期的四倍。冠心病的新发和既往病例显示较高一致性,吸烟、性别、ω-6脂肪酸、啤酒饮用频率和步速是出现多重互作的重要情境。加入交互项后,模型对PGS极端人群风险曲线的拟合明显改善。
分层GWAS和mash分析显示,高低风险情境中的遗传效应通常方向一致,但在不利情境中的幅度更大。例如,既往吸烟且ω-6脂肪酸较低人群的冠心病遗传效应净放大约60.62%。遗传效应放大程度与交互作用造成的额外疾病方差显著正相关,支持不利环境放大既有遗传效应的解释。
PNB分析表明,将遗传风险与暴露联合用于人群筛选,可以提高理论干预效率。冠心病总体高风险情境的PNB约为21,而在PGS最高20%人群中约为11。对于肥胖,减少啤酒摄入并提高步速在总体人群中的理论获益比例约为5%,在PGS较高人群中可升至约11%。这些结果支持对“高遗传风险+高环境风险”人群实施更精准的行为或临床干预。
系统评估双重情境与PGS的互作。 研究从单一环境因素扩展到75类情境的两两组合,更接近真实生活中的多重暴露状态。
揭示遗传效应放大这一主要机制。 不利情境通常不是改变遗传效应方向,而是放大同一批风险变异的效应幅度。
提出具有临床解释力的PNB指标。 该指标把PGS×环境互作转化为不同遗传风险阈值下的潜在干预效率。
研究主要基于自报白人英国参与者,结论能否推广到其他祖源、国家和社会经济体系仍不明确。
研究属于观察性关联分析,高低风险曲线之间的差异不能证明改变暴露会产生同等幅度的因果获益。
将连续暴露按均值二分会损失剂量—反应信息,并可能使临界值附近的个体被人为分入不同组别。
PNB属于理论估计,尚未经过随机对照试验或前瞻性干预研究验证,不能直接作为现阶段临床治疗决策依据。
Pioneer transcription factors direct tissue-specific cohesin chromatin entry and three-dimensional genome organization

谁为黏连蛋白指路?先锋因子重塑三维基因组
先锋转录因子、NIPBL、黏连蛋白、三维基因组、FOXA1突变
这篇文章通过跨细胞类型染色质结合图谱、蛋白互作实验、基因敲低、三维基因组测序和癌症突变功能分析,探索了黏连蛋白复合体在染色质上的进入位置如何被选择,以及这种选择如何形成组织特异性的三维基因组结构,这对于理解基因表达空间调控和癌症相关染色质重构具有重要意义。黏连蛋白通过挤出DNA环组织拓扑关联结构域,但过去研究主要关注CTCF如何阻挡黏连蛋白并形成环锚点,对于NIPBL将黏连蛋白装载到哪些位置、这些位置是否具有组织特异性,认识仍然有限。
作者比较11种不同来源细胞中CTCF、黏连蛋白亚基RAD21和装载因子NIPBL的ChIP-seq图谱。CTCF和RAD21在不同细胞之间的平均结合位点重叠率分别约为48.3%和35.6%,而NIPBL只有约5.7%,表明NIPBL装载位点比黏连蛋白最终停留位置更具有细胞和组织特异性。NIPBL敲低导致RAD21在全基因组范围内大量丢失,而RAD21敲低基本不影响NIPBL占位,说明NIPBL预先结合染色质并负责装载黏连蛋白,但不会随黏连蛋白一起移动到最终CTCF锚点。
NIPBL峰的基序富集分析显示,其结合区域主要富集Forkhead、ETS和bZIP等先锋转录因子家族的识别序列,而CTCF基序并不突出。其中FOXA1是最显著的候选因子。FOXA1与NIPBL在肝细胞和乳腺癌细胞中表现出细胞类型特异性的共定位,内源和外源共免疫沉淀均支持二者存在物理互作。因此,先锋因子不仅通过打开核小体占据区域启动转录,也可能作为导航系统,将NIPBL和黏连蛋白引导至特定基因组位置。
在前列腺癌细胞模型中,FOXA1主要将NIPBL招募至TAD内部,从而支持由内部装载点向两侧展开的近似对称环挤出;ETS家族因子则更多将NIPBL引导至TAD边界附近,对应偏向单侧延伸的不对称模式。FOXA1耗竭选择性削弱TAD内部NIPBL结合和内部染色质环,而NIPBL耗竭同时破坏TAD内部互作和边界—边界互作,说明FOXA1负责的是特定装载路径,NIPBL则是整个黏连蛋白装载过程的核心执行因子。
研究进一步分析前列腺癌复发突变FOXA1 R219S。该突变改变FOXA1的序列识别偏好,使FOXA1–NIPBL复合体由TAD内部重新分布至边界附近,增强结构域绝缘并形成更加封闭的染色质环境。这种三维结构变化伴随癌症相关转录程序和更具侵袭性的分子表型。文章由此揭示,组织特异性三维基因组并不只是由普遍存在的CTCF边界决定,还取决于不同先锋转录因子把黏连蛋白从哪里放入染色质;癌细胞则可以通过先锋因子突变劫持这一装载机制。

研究整合11种细胞系的NIPBL、RAD21和CTCF ChIP-seq数据,通过两两峰重叠、信号强度比较和基序富集分析评估三类蛋白的细胞类型特异性。作者在22Rv1前列腺癌细胞中分别敲低NIPBL、RAD21和FOXA1,并重新开展ChIP-seq,以检验装载因子、黏连蛋白和先锋因子之间的依赖关系。
为确定蛋白互作,研究使用内源和外源共免疫沉淀及免疫印迹检测FOXA1与NIPBL。随后结合高分辨率染色质互作测序,对TAD内部、TAD边界及不同装载位点周围的染色质接触变化进行比较,并依据装载点到环锚点的方向性推断近似对称和不对称环挤出模式。
针对前列腺癌FOXA1^R219S突变,作者比较野生型和突变型FOXA1的ChIP-seq、NIPBL重定位、基序偏好、染色质互作和转录变化,区分野生型特异、突变型特异及共有结合位点,进而分析该突变如何改变TAD内部互作、边界绝缘和癌症相关表型。
跨细胞比较显示,CTCF和RAD21结合较为保守,而NIPBL结合高度组织特异。NIPBL敲低导致RAD21在染色质上的全局性下降,RAD21敲低则不改变NIPBL整体占位,支持“NIPBL预定位—黏连蛋白装载—RAD21移动至CTCF边界”的顺序模型。
NIPBL结合区域富集FOXA、ETS和bZIP家族基序,其中FOXA1与NIPBL表现出广泛且细胞类型特异的共定位,并可发生物理互作。FOXA1主要对应TAD内部NIPBL位点,ETS因子则偏向TAD边界。FOXA1耗竭后,TAD内部NIPBL峰和内部环显著减少,但部分边界互作仍被保留;NIPBL耗竭则同时降低内部和边界互作。
FOXA1^R219S减少了部分野生型内部位点的结合,同时产生新的边界邻近结合位点,并将NIPBL共同重定向至这些区域。由此形成更强的TAD绝缘和重构后的染色质环网络,说明癌症突变能够通过改变黏连蛋白进入点而重塑三维基因组。
将研究重点从黏连蛋白在哪里停止推进到黏连蛋白从哪里进入。 文章明确区分CTCF锚点与NIPBL装载位点,补充了环挤出模型中的关键缺口。
提出先锋转录因子决定组织特异性黏连蛋白装载。 FOXA1和ETS因子分别对应TAD内部和边界附近的装载模式。
建立癌症突变与三维基因组重构的直接联系。 FOXA1 R219S通过重定向NIPBL改变TAD绝缘,而非仅仅改变局部转录因子结合。
环挤出的对称性和方向主要根据群体细胞染色质接触图谱推断,尚缺少活细胞或单分子水平对黏连蛋白运动轨迹的直接观察。
机制验证集中于FOXA1和前列腺癌模型,其他Forkhead、ETS及bZIP先锋因子是否采用相同机制仍需逐一验证。
细胞系中的三维基因组重构可能受到癌细胞既有基因组异常影响,FOXA1 R219S在原发肿瘤不同阶段和患者预后中的作用仍需更大规模临床样本研究。
We thank the blogger (orange_milk_sugar, Wenyan Chen) for providing the reference template and supporting the dissemination of this literature update.
感谢小可爱们多年来的陪伴, 我与你们一起成长~

此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。