大规模DNA存储中基于引物库的多模式数据组织和文件检索

张淑芳 ,  李予辉 ,  张睿娴 ,  李炳志 ,  王晴

Engineering ›› 2025, Vol. 48 ›› Issue (5) : 151 -162.

PDF (6713KB)
Engineering ›› 2025, Vol. 48 ›› Issue (5) : 151 -162. DOI: 10.1016/j.eng.2023.10.021
研究论文

大规模DNA存储中基于引物库的多模式数据组织和文件检索

作者信息 +

Multi-Mode Data Organization and File Retrieval Based on a Primer Library in Large-Scale Digital DNA Storage

Author information +
文章历史 +
PDF (6873K)

摘要

目前,基于聚合酶链反应(PCR)扩增的文件检索方法是DNA文件检索最常用且有效的方法。正交引物的数量限制了可以被准确访问的文件数量,且会影响单个寡核苷酸池中的文件存储密度。本文针对大容量DNA数据存储,提出了一种单个寡核苷酸池中基于PCR文件检索的多模式DNA序列设计方法。首先,通过分析每个预测引物长度下正交引物的最大数量,发现引物长度和最大可用引物数量之间并不呈线性增加的关系,正交引物的最大数量级约为104;然后,本文分析了具有不同种类引物结合位点的DNA序列可进行文件映射的最大地址空间容量。在引物库的容量为ℝ(其中ℝ为偶数)的情况下,利用本文所提出的单引物DNA序列设计方案可映射的地址空间数是以往方案的4倍,且利用两级引物DNA序列设计方案可以达到[R2 · (R2-1)]2倍。最后,根据寡核苷酸池中待存储文件的数量要求,我们设计了一种多模式的DNA序列生成方法,以满足在存储有大规模文件数量的寡核苷酸池中进行目标文件随机检索的需求。本文还验证了利用所提正交引物库设计器进行引物生成的性能,产生的正交引物之间所形成的最稳定异源二聚体的平均吉布斯自由能为-1 kcal∙(mol∙L-1)-1(1 kcal = 4.184 kJ)。同时,通过选择性PCR扩增对具有两级引物结合位点的DNA序列进行随机访问,当不同位置的引物结合位点序列彼此互异时,支持按照最低103倍的reads数精确读取出目标序列。本文提供了一套用于正交引物库生成以及文件与引物间多模式映射方案的流程,所提方案有助于实现在大规模DNA核苷酸池中对文件的精确随机访问。

Abstract

At present, the polymerase chain reaction (PCR) amplification-based file retrieval method is the most commonly used and effective means of DNA file retrieval. The number of orthogonal primers limits the number of files that can be accurately accessed, which in turn affects the density in a single oligo pool of digital DNA storage. In this paper, a multi-mode DNA sequence design method based on PCR file retrieval in a single oligonucleotide pool is proposed for high-capacity DNA data storage. Firstly, by analyzing the maximum number of orthogonal primers at each predicted primer length, it was found that the relationship between primer length and the maximum available primer number does not increase linearly, and the maximum number of orthogonal primers is on the order of 104. Next, this paper analyzes the maximum address space capacity of DNA sequences with different types of primer binding sites for file mapping. In the case where the capacity of the primer library is R (where R is even), the number of address spaces that can be mapped by the single-primer DNA sequence design scheme proposed in this paper is four times that of the previous one, and the two-level primer DNA sequence design scheme can reach 2·2-12 times. Finally, a multi-mode DNA sequence generation method is designed based on the number of files to be stored in the oligonucleotide pool, in order to meet the requirements of the random retrieval of target files in an oligonucleotide pool with large-scale file numbers. The performance of the primers generated by the orthogonal primer library generator proposed in this paper is verified, and the average Gibbs free energy of the most stable heterodimer formed between the orthogonal primers produced is −1 kcal∙(mol∙L−1)−1 (1 kcal = 4.184 kJ). At the same time, by selectively PCR-amplifying the DNA sequences of the two-level primer binding sites for random access, the target sequence can be accurately read with a minimum of 103 reads, when the primer binding site sequences at different positions are mutually different. This paper provides a pipeline for orthogonal primer library generation and multi-mode mapping schemes between files and primers, which can help achieve precise random access to files in large-scale DNA oligo pools.

关键词

DNA存储 / 文件检索 / 正交引物 / PCR扩增 / DNA序列设计

Key words

DNA storage / File retrieval / Orthogonal primer / PCR-amplifying / DNA sequence design

引用本文

引用格式 ▾
张淑芳,李予辉,张睿娴,李炳志,王晴. 大规模DNA存储中基于引物库的多模式数据组织和文件检索[J]. 工程(英文), 2025, 48(5): 151-162 DOI:10.1016/j.eng.2023.10.021

登录浏览全文

4963

注册一个新账户 忘记密码

1 引言

1964年,Wiener提出了DNA存储的概念[1],自21世纪初以来,科学家对将数据存储于DNA中进行了各种尝试[26],验证了DNA数据存储的可行性。与传统硅基存储介质相比,DNA数据存储具有低维护成本、高存储密度、长存储时间等优势,有望成为新一代存储介质,用来保存海量归档数据。

在对DNA池存储的文件数据进行访问和解码重构时,通常需要对DNA池中所有的数据进行扩增和解码。针对海量数据的DNA存储,上述读取方式会带来计算和测序资源的极大浪费。

近年来研究人员提出了文件随机访问方法[711],即根据实际应用需求选择性地从DNA池中提取特定的数据进行检索、测序和解码,从而有效降低数据读取的成本,提高数据读取的便捷性。在这些方法中,基于聚合酶链反应(polymerase chain reaction, PCR)扩增的文件检索方法成本较低、操作简单,其利用大约20个碱基的引物进行PCR扩增来实现特异性文件的提取。

2015年,Tabatabaei Yazdi等[12]提出了一种基于PCR扩增的文件检索方法,该团队在DNA序列中设计了特定的地址串来支持文件检索;2018年,Organick等[13]提出了一种端到端的DNA文件存储方案,考虑了引物设计中的生物学约束,并且将不同的文件映射不同的引物;2019年,Tomek团队[14]利用引物与引物结合位点在特定条件下的可控杂交特点,通过控制引物浓度和反应温度实现文件预览;Song等[15]研究了大规模DNA存储系统中的多维数据组织和随机访问,有效地提高了DNA存储容量的上限。

除了基于PCR扩增的文件检索方法,其他文件检索方法也相继出现。2019年,Newman等[16]利用微流控实现对DNA分子中的文件检索,通过电场的作用控制微液滴精确移动到目标DNA分子所在的槽,从而提取出目标文件的DNA分子;2021年,华盛顿大学和微软公司[17]利用生物素标记探针核苷酸序列以及磁珠亲和纯化技术实现了DNA文件的相似性检索;2021年,麻省理工学院和哈佛大学团队[18]利用二氧化硅微球固化存储实际文件信息的质粒,并在微球表面固定多个寡核苷酸探针作为元数据,通过荧光激活细胞分选仪访问目标文件。近年来,研究人员在DNA存储的各个方面进行了研究[1926]。与PCR扩增检索方法相比,这些检索方法成本高且操作复杂,不利于大规模的推广和应用。

为了从存有海量数据的DNA池中准确提取出所需要的文件,基于PCR的文件检索方法需要利用引物的唯一性作为筛选条件,即每个引物对应一个特定的文件。由于引物设计需要满足严格的生化反应约束条件,可用引物的数量不会随着引物长度的增长而线性增加;相反,它有一个相应的容量上限。对于带有文件检索功能的DNA存储,该容量上限将会严重影响存储容量,因此有必要对引物设计准则下的引物长度和正交引物数量进行综合分析,预测不同引物长度对应的正交引物库容量的上限值,并根据该容量上限值合理设计出与存储文件相对应的模板序列,从而有效提高DNA存储的文件检索效率。

基于上述分析,本文考虑了DNA存储中引物设计的约束条件,利用拟蒙特卡洛模拟算法仿真不同的随机引物生成次数下产生的可用引物数量,并预测出可用引物的最大容量[图1(a)]。此外,本文对具有多级引物结合位点的DNA序列结构的最大地址空间进行了理论分析,并且比较了三种结构不同的DNA序列的地址空间与引物库容量之间的关系[图1(b)]。在此基础上,本文提出了一种用于单个寡核苷酸池中基于PCR文件检索的多模式DNA序列设计方法[图1(c)]。

本文首先基于引物设计准则设计正交引物库;然后进行单引物和多引物结合位点的DNA序列设计,以便根据实际需求选择相应的DNA序列设计方法;最后,本文对不同的正交性约束条件下生成引物的错配情况进行了仿真实验。实验结果表明,相比于仅考虑引物自身的约束条件,在同时考虑引物自身和引物之间的正交性约束条件下,引物间错配的概率会显著降低;另外,我们还通过实际的PCR扩增证明了本文提出的多引物结合位点的DNA序列设计方法的可行性。

通过分析引物长度与正交引物库最大容量之间的关系,本文发现在基于引物的选择性PCR扩增中,由于正交引物库容量较低,单个寡核苷酸池的存储容量很容易达到瓶颈。因此,本文提出了一种多模式DNA序列设计方案,以满足不同应用场景下的存储需求。通过本文提出的方案,单个寡核苷酸池的文件存储容量上限得到了极大的提升。

2 材料和方法

2.1 DNA存储中的引物设计准则

PCR中的引物设计准则包括引物长度约束、熔化温度(melting temperature, Tm)约束、退火温度约束、鸟嘌呤-胞嘧啶(guanine-cytosine, GC)含量约束、GC分布约束、二级结构约束、碱基重复约束、游程约束和3'端稳定性约束。引物的长度应在15~30个核苷酸(nucleotides, nt)之间;这是因为引物长度过短会导致PCR反应的特异性降低,而引物过长将导致同源二聚体和异源二聚体的概率显著增加,同时导致Tm值过高,这反而会影响DNA聚合酶的正常功能。

引物的Tm值应在52~58 ℃之间。Tm值过低或过高都会对PCR反应产生负面影响。Tm值较低会降低引物与模板序列结合的特异性,导致产生杂带;Tm值过高则可能导致DNA聚合酶无法正常工作,或导致引物与模板之间结合困难或扩增失败。因此,在引物设计时需要考虑Tm的影响。

除上述准则外,还应考虑以下约束:

(1)GC含量应在40%~60%之间。

(2)引物3'端最后五个碱基中,鸟嘌呤或胞嘧啶的数目不应超过3个。

(3)不应出现二级结构,包括发夹结构、同源二聚体和异源二聚体。

(4)碱基重复约束是指双碱基组的重复出现(如ATATATAT),引物序列中双碱基组的最大允许重复数为4。

(5)引物中应避免连续出现4个以上的相同碱基,3'端的吉布斯自由能应该尽量高。

这些引物设计准则对于提高PCR扩增反应的特异性至关重要。值得注意的是,这些约束中很多都限制了引物的3'端,这是因为3'端是DNA聚合酶进行DNA分子延伸的起始点,故对该部分的特异性提出了更高要求。

在基于PCR扩增进行DNA存储文件检索时,不仅要考虑传统生物学的引物设计准则,更需要考虑引物间的正交性约束条件。由于DNA存储中进行PCR反应的模板序列数量级一般至少为10 000条以上且无上限,并且随着DNA合成成本的降低,更大规模的序列合成成为可能,在同一个寡核苷酸池中存放的文件数量将显著增加。因此在文件和引物一一对应的设计模式中,如果引物之间没有正交性约束,在PCR反应的过程中会导致引物与错误的结合位点匹配进而扩增出非目标序列,影响后续解码工作。

2.2 改进的正交引物设计方法

为了更加高效地生成正交引物库,本文设计了如图2所示的正交引物库生成系统,包括随机引物产生器、自检测器、互检测器和定向突变四个模块。随机引物产生器用于生成随机的寡核苷酸序列,其产生的序列输入进自检测器中进行引物自身约束条件的检测。在正交引物库设计系统中,如果寡核苷酸序列不满足某约束条件,则会将该序列输入到定向突变模块中;定向突变模块会针对局部序列中不满足约束条件的碱基进行定向突变,使其在突变后满足相应约束条件。引物序列经过定向突变后重新输入自检测器中,如果该序列可通过自检测器,则进入互检测器中进行引物间的约束条件检测。

通过正交引物库设计系统,可以自动地根据需要生成满足全部DNA存储引物约束条件的正交引物,从而根据实际存储需要生成适当的引物。然而考虑到DNA存储的引物约束条件以及引物长度与正交引物数量间的关系,可以看出随着正交引物数量的增加,检查引物之间约束条件的复杂性也随之增加,这严重降低了引物库生成的效率。另一方面,引物之间的汉明距离约束和非同源二聚体约束的约束强度会随着正交引物库容量的增加而增强,这会严重限制DNA存储中的文件检索能力。现有的DNA序列设计方法无法支撑大容量DNA池中的文件检索。

2.3 多模式文件DNA序列设计

通过上述分析可知,当DNA池中存储的文件数量较少时,可以利用传统的文件-引物映射方法通过一轮PCR扩增提取出目标文件。然而一旦单个DNA池中存储的文件数量过多时,正交引物库的容量就需要增加,其设计难度将会显著提高;另外,进行文件检索时所需要用到的引物种类数也会过多,导致检索成本提高。此时利用多引物结合位点的DNA模板序列便可以突破正交引物库容量上限的瓶颈,并且可以通过增加上下游引物结合位点级数的策略呈指数级扩大可用地址空间。本文所提出的多模式DNA序列设计方法,流程如图3所示。

对于给定的待存储文件集,首先确定引物序列的长度以及是否优先选用单引物-文件映射关系设计DNA序列。如是,则算法进入最小引物结合位点级数(binding site level least, BSLL)设计策略,反之进入最小引物库(primer library least, PLL)设计策略。对于BSLL设计策略,引物库设计器将会尽可能多地设计出正交引物以满足存储需求。如果设计出的正交引物库的容量足够,则直接按照单引物-文件映射关系输出最终的模板序列。反之则需要根据公式(1)计算DNA模板序列所需要的最小引物结合位点级数使其满足待存储文件集的存储需求。

nmin=lg Nf2·lg sizePN2

式中,N为寡核苷酸序列中的碱基数;Nf为待存储的文件数;n为模板序列中引物结合位点的级数;PN为正交引物库;nmin为所需要的最小引物结合位点级数;·为向上取整函数。

对于PLL设计策略,首先需要输入引物结合位点的级数n。引物库生成器需要设计的最小正交引物数量sizePN可以使用式(2)计算:

sizePN=2·Nf2n

2·Nf2n值为奇数时,sizePN=2·Nf2n+1。然后利用正交引物库生成器循环生成可用引物,当生成的正交引物库中的可行引物数量达到sizePN时结束生成步骤,并且按照引物结合位点级数n生成待存储文件集的全部模板序列。

2.4 选择性PCR

在PCR扩增过程中,将20个模板序列以相同浓度加入反应体系中作为初始底物,用于后续的PCR扩增。本文进行了6组实验,退火温度为53 °C,每50 μL底物中加入2 μL引物,PCR循环35次。测序结果通过第二代Illumina测序技术获得并分析。6组PCR反应中加入的引物组合见表1。在实验1~3中,两轮PCR扩增中加入的两个正向引物和两个反向引物不同。在实验4~6中,两轮PCR扩增中加入的两个正向引物或两个反向引物可以相同。

3 结果与讨论

3.1 引物长度与正交引物数量关系的分析

引物与文件间的一一映射是实现DNA存储文件检索的基础,引物的功能类似于硅基存储介质中的地址线,通过它可以对存储芯片上的特定存储空间进行随机访问。在基于PCR的DNA存储文件检索中,引物是通过生化反应来区分文件的唯一标识。对于一个碱基数量为N的寡核苷酸序列,其组成的全部寡核苷酸序列集合记为CN={s1, s2,,sk,,s4N},其中sk表示第k条寡核苷酸序列。由于寡核苷酸序列的每个位置都有4种可能的碱基,因此集合CN的大小为4N。通过遍历集合CN中的全部序列,筛选出所有满足DNA存储引物条件的寡核苷酸序列并将其加入到正交引物库集合PN={sp1, sp2,,spn} (n<N,PNCN),其中正交引物库集合PN的大小为n。遍历CN所需要的时间复杂度将会达到𝒪(4N),当引物长度为30 nt时,CN的大小为260,由于引物序列每增加一个碱基,其搜索空间将扩大4倍,所以依次进行序列遍历和筛选是不切实际的。

为了探究引物长度N与正交引物库PN大小间的关联性,本文利用数理统计方法拟合出生成的随机引物数量i与正交引物库大小size(Pi,N)之间的函数关系,然后预测正交引物库的大小size(Pi,N)。分析系统的主要模块包括随机引物产生器、引物自检测器和引物互检测器[图4(a)]。引物产生器中的拟蒙特卡洛引物生成模块是利用N维Hammersley点集产生的随机引物序列,其中N为引物长度。引物产生器用来产生随机寡核苷酸序列作为引物自检测器的输入;引物自检测器进行全序列的GC含量检测、3'末端的GC聚集检测、连续的双碱基组重复检测,同时进行游程约束检测、同源二聚体检测和Tm值检测[图4(b)],满足全部约束条件的引物会从自检测器输出到引物互检测器;引物互检测器用来检测当前引物与正交引物库中全部引物之间的汉明距离约束和非同源二聚体约束[图4(c)]。如果当前引物满足全部的约束条件,则将其作为可行引物存储到正交引物库中。此分析系统的目标是寻找随机生成的引物数量i与正交引物库大小size(Pi,N)之间的函数关系。

对于引物产生器,本文利用拟蒙特卡洛模拟算法来求解复杂的系统变量,并在不遍历集合CN的情况下预测size(PN)的大小。图4(d-i)展示了对于集合CN(蓝色椭圆部分),考虑全部引物设计约束条件时,可以筛选出其子集PN(绿色形状),由于引物约束条件的复杂性,子集PN将会在CN中按照一定的方式分布,为了求解size(PN),需要对CN进行抽样次数为mm=i)的随机抽样,此外,必须判断抽样序列sk1k4N)是否满足引物约束条件,并筛选出满足这些条件的序列集合Pi,N,可知Pi,NPNCN,通过改变生成的随机引物数量i,可以得到一组Pi,N,通过回归分析寻找抽样正交引物库的大小size(Pi,N)与生成的随机引物数量i的函数关系,再将已知量size(CN)代入函数中即可得到size(PN)的估计值。

使用拟蒙特卡洛模拟算法的关键在于抽样必须满足均匀分布,均匀度越高近似效果越好。拟蒙特卡洛模拟算法使用一组低偏差且分布均匀的点集代替均匀分布的伪随机序列进行抽样,图4(d-ii)是利用独立同分布的均匀分布进行二维(2D)随机抽样得到的样本点分布示意图,图4(d-iii)是利用Hammersley点集进行二维随机抽样得到的样本点分布示意图,可见后者的均匀度优于前者,因此使用Hammersley点集对size(PN)的值进行估计是更为可靠的。

d维Hammersley点集的生成方法如下:

对于任意非负整数l,都可以通过一个素数p展开为:

l=a0+a1p+a2p2++arpr

式中,ai是在区间[0, p-1]的一个整数。定义关于l的函数Φp如下:

Φpl=a0p+a1p2+a2p3++arpr+1

假设d是采样空间的维度,通过给出任意的素数序列p1,p2,p3,,pd-1,可以得到一组函数序列Φp1,Φp2,Φp3,,

Φpd-1,由此可以得到d维Hammersley点集:

ln,Φp1l, Φp2l,,Φpd-1l for l=0, 1, 2,, n-1

此处p1<p2<p3<<pd-1

以20个碱基的寡核苷酸序列为例,通过改变随机生成的引物数量i,得到引物库的大小size(PN) [图4(e)]。每一个真实数据点都是取10次size(PN)的平均值。考虑size(C20)的大小等于240,通过将其代入回归方程可以估算出正交引物库集合的大小size(P20)约为12 396。从上述分析可以看出,在文件和引物一一对应的存储框架下,在同一个DNA池中能够精确存储的最大文件数量非常有限。

采用相同的方法对CN15N30)进行采样得到一组PN15N30),并且拟合得到随机生成的引物数量i与平均正交引物库大小sizePi,N15N30)之间的函数关系。图4(f)中每条预测曲线的末端表示当随机生成的引物数量i = size(CN)时预测得到的size(PN)

图4(g)表示引物长度N与预测出的正交引物库大小size(PN)之间的关系。可以看出,正交引物库的大小满足DNA存储系统的引物约束条件,并且不会随着引物长度的增加而单调增长,实验结果表明引物长度在25 nt时,size(P25)最大,上限约为104数量级。

对于一个20 nt长度的核苷酸序列,有420种可能的排布。然而,在引物设计时必须考虑基本约束条件。加入正交性约束后,满足所有约束条件的引物数量大幅减少,导致只有少量引物可以用于精确文件检索。

当同一个DNA寡核苷酸池中存储的文件数量远超104时,文件与引物之间的一一对应设计方案将无法满足精确文件检索的需求,因为在经典的一一对应关系中,一个文件由唯一的引物标识。如果在同一个DNA寡核苷酸池中存储的文件数量超过了正交引物库的容量,就无法找到与其他文件所选定的引物相正交的引物来匹配额外的文件。引物间的正交性是确保PCR扩增特异性的重要因素。如果两个文件具有弱正交的引物序列,那么基于PCR扩增随机访问任一文件将导致产物包含非目标序列。随着存储文件数量的增加,这种现象会加剧,最终需要进行大量的序列筛选等后处理工作,甚至会因无关序列过多而导致目标文件解析失败。

3.2 多级引物结合位点的DNA序列随机访问分析

3.2.1 多引物结合位点DNA结构设计及其随机访问方法

为了提高大规模DNA文件存储系统的文件检索能力、扩充地址空间并降低正交引物库的设计难度,本文设计了具有不同级别引物结合位点的DNA序列结构。此结构如图5(a)所示,其中Ln-FP BS(level-n forward primer binding site)为第n层的正向引物结合位点,Ln-RP BS(level-n reversed primer binding site)为第n层的反向引物结合位点。正向和反向引物结合位点的级数决定了文件检索所需的PCR轮数,例如,在图5(a-ii)的两级正向和反向引物结合位点的DNA序列结构中,最外侧引物结合位点为第一轮PCR中加入引物的互补序列;内侧引物结合位点是在第二轮PCR中加入引物的互补序列;DNA序列的中间部分为有效载荷序列。图5(a-iii)给出了通过两级正向和反向引物进行PCR扩增以实现目标序列随机检索的过程示意图。

图5(a-iii)中选用正向引物库{FP1, FP2}和反向引物库{RP1, RP2}以提取绿色的目标序列。在第一轮PCR中使用的引物对是FP1和RP1,得到的产物仍然包括全部的四种序列;但是利用引物对FP2和RP2进行第二轮PCR扩增时,由于非目标序列会缺失反向引物结合位点、缺失正向引物结合位点或者缺失全部的正向和反向引物结合位点而无法扩增,因此在经过了两轮选择性PCR扩增之后,目标序列会被正确地扩增出来。

3.2.2 多引物结合位点DNA序列结构的最大理论地址容量分析

对于一个具有u级正向引物结合位点、v级反向引物结合位点的DNA序列结构,给定正交引物库PN,将引物库划分为正向引物库和反向引物库PN1PN2,使得PN1PN2=PN,PN1PN2=,此时能够满足通过max (u,v)次选择性PCR扩增筛选出目标片段的最大地址空间大小S可用式(6)得到:

S=m=0u-1sizePN1-m·j=0v-1sizePN2-j

其中不同级别的引物结合位点所采用的引物是互异的。由于通过PCR扩增进行文件随机访问的轮数取决于uv的最大值,通过式(6)可知在PN1PN2一定的情况下,当u=vS取最大值:

S=m=0u-1sizePN1-m·j=0u-1sizePN2-j
Sm=0u-1sizePN1-m+j=0u-1sizePN2-j24

考虑到size(PN1)+size(PN2)=size(PN),因此有:

Sm=0u-1sizePN2-m2

故多引物结合位点DNA序列结构的最大理论地址容量为:

Smax=m=0u-1sizePN2-m2

图5(b)展现了四种不同的文件与引物之间的映射关系,及其最大地址空间与给定正交引物库大小之间的关系。文件与引物一一映射策略下的正交引物库大小size(PN)与可用于文件随机访问的最大地址空间Smax之间的函数关系如图5(b-i)所示。图5(b-ii)展示了使用“一对引物,一个文件”映射的DNA文件存储策略,而图5(b-iii)和(b-iv)则分别展示了“两对引物,一个文件”和“三对引物,一个文件”的映射。从图5(c)可以看出,在正交引物库容量相同的情况下,相比于传统的文件-引物一一对应存储策略,使用多引物对-文件的存储策略得到的最大地址空间数呈现指数级增长。因此采用多引物结合位点的DNA序列结构设计方案可以解决现有方法随机访问地址空间不足的问题,同时极大地降低引物库设计难度和引物的合成成本。

3.3 正交引物设计器生成的引物性能分析

为了验证本文所提出的正交引物库设计方法的有效性,我们进行了仿真实验,首先在不考虑引物之间正交性约束条件的前提下随机产生50条满足引物自身约束条件的引物序列;然后利用改进的正交引物库设计方法产生50条正交引物序列,并且针对两种情况下生成的50条引物序列分别从最大互补碱基数分布情况、最大连续互补碱基数分布情况、最稳定的异源二聚体吉布斯自由能三个维度进行分析。

图6(a)所示,仅考虑引物自身约束条件下,吉布斯自由能(ΔG)的变化范围为-9000~0 cal∙mol-1 (1 cal = 4.184 J),平均值在-4000~2000 cal∙mol-1之间波动,其中吉布斯自由能的绝对值越低,代表该异源二聚体的稳定性越高。在考虑引物之间的正交性约束条件下,ΔG范围缩小为-4000~-1000 cal∙mol-1,平均值在-2000~0 cal∙mol-1之间波动。计算得到两种情况下的总平均值分别是-3130 cal∙mol-1和-1000 cal∙mol-1。在图6(b)中,考虑引物之间正交性约束条件下,引物完全匹配与引物错配情况中,所生成的最稳定异源二聚体的吉布斯自由能的平均比值为21.52,不考虑引物之间正交性约束条件下的平均比值为5.96。该比值量化了引物正确匹配情况下与错配时结合稳定程度的差异。

图6(c)所示,在仅考虑引物自身约束条件的情况下,引物序列之间最大互补碱基数的分布范围为4~12 bp(base pairs),平均值在6~8 bp之间稳定波动;而在考虑了引物之间的正交性约束条件的情况下,最大互补碱基数的分布范围缩小为1~5 bp,平均值在3~5 bp之间波动,进一步计算得到这两种容量为50的引物库引物间的总平均最大互补碱基数分别是7.3 bp和3.8 bp。如图6(d)所示,在仅考虑引物自身约束条件的情况下,引物序列之间最大连续互补碱基数的分布范围为2~7 bp,平均值在3~4 bp之间波动;在考虑了引物之间的正交性约束条件下,该范围缩小为0~4 bp,平均值在1~3 bp之间波动。计算得到两种情况下的总平均值分别是3.8 bp和2.3 bp。

上述实验表明,在考虑了引物间正交性约束条件之后,PCR扩增中由于引物之间发生错配而导致效率低下甚至扩增失败的概率显著下降。

3.4 多模式DNA序列设计实验分析

为了更好地说明文件总数与文件检索所需最少正交引物数量之间的关系,本文计算了四种不同的DNA序列结构下的公式(1)和(2)的结果,如图5(b)所示。引物库最大容量限制选择20 nt长度的引物。图7(a)和(b)中四种不同的文件与引物映射方式的曲线变化趋势显示,单一引物-文件映射方式在文件数量达到104数量级时会达到正交引物库最大容量上限;随着待存储文件数量的进一步增加,采用“一对引物,一个文件”“两对引物,一个文件”“三对引物,一个文件”的映射方式都可以突破正交引物库的最大容量限制。此时,对于特定DNA序列的n级引物结合位点,在相同待存储文件数量的前提下,后者所需要的最少正交引物数量仅为前者的约1Nf2n(n+1)。以存储5000个文件为例,如图7(c)所示,利用本文所提出的多模式DNA序列设计方法,在BSLL策略下,需要的最少正交引物数量为5000个;在PLL策略下,根据选择的输出DNA序列引物结合位点级数的不同,所需要的最少正交引物数量分别为142个、18个和10个。

为了验证具有多级引物结合位点的DNA序列在进行随机文件检索时的可行性,本文设计了一系列实验进行分析。不失一般性地,由于PCR扩增的高度特异性与灵敏性,两轮PCR扩增与更多轮数的PCR扩增在原理上是相同的。因此,为了验证本文所提出的具有多引物结合位点的DNA文件序列结构在PCR扩增文件检索中的有效性,本文实验中设计了20种具有两级正向和反向引物结合位点的DNA文件序列。本实验选用的正交引物库为P20={p1,p2,p3,p4,p5,p6},将其划分成正交正向引物库P20,FP={FP1=p1,FP2=p2,FP3=p3}和正交反向引物库P20,RP=RP1=p4,RP2=p5,RP3=p6,DNA文件序列结构如图7(d)所示,其中L1-FP BS和L1-RP BS分别为第一级正向和反向引物的结合位点,其作用是实现第一轮选择性PCR扩增;L2-FP BS和L2-RP BS分别是第二级正向和反向引物的结合位点,其作用是以第一轮PCR反应的产物为底物进行第二次选择性PCR扩增。20条序列所选择的两级正向和反向引物结合位点序列如表2所示。

我们对实验1~3的两轮PCR扩增产物进行测序,并对每条序列的reads数进行统计后,得到图7(e)中组号为1~3的热力图。实验结果表明,每组中仅有一条DNA序列的reads数占比大于98%,而其他序列的reads数占比均显著低于目标DNA序列(表1中的目标序列)。这表明,如果将目标DNA序列的两级正向引物结合位点和两级反向引物结合位点进行互异设计,利用本文所提DNA序列设计方案,能够精确无误地提取出目标DNA序列。

实验4~6的热力图[图7(e),组号为4~6]与实验1~3具有相同的测序覆盖率,三个结果中均有多条reads数占比显著提高的序列。造成这种差异的原因在于,相比于实验1~3的设计,实验4~6设计的DNA序列中,不同级别的正向引物结合位点或反向引物结合位点存在选用序列相同的情况,如在实验4中,第一轮PCR扩增和第二轮PCR扩增所添加的引物都是FP1。

通过上述实验可以得出以下规律:如果在同一个DNA池中存在两个或两个以上的文件,且在组成它们的DNA序列中,不同级别的正向或反向引物结合位点序列是不完全互异的,则必然会导致在经过多轮选择性PCR扩增后无法唯一地扩增目标序列。这也是本文在对具有多级引物结合位点的DNA文件序列理论最大地址容量分析时,规定不同级别的引物结合位点所采用的序列必须互异的原因。

3.5 讨论

本文提出的多模式文件DNA序列设计方案可以满足在正交引物库容量有限的情况下准确检索大量文件的需求。然而,由于额外引物结合位点的增加会导致存储密度下降,因此在最大地址空间和存储密度之间找到平衡至关重要。图7(f)展示了单个模板序列长度为190 nt时,使用四种不同文件DNA序列结构的最大可用地址空间与存储密度之间的关系。这里,存储密度定义为有效载荷部分在总模板序列中的占比。

显然,当引物长度或引物结合位点的级数增加时,存储密度会降低。然而,随着引物结合位点级数的逐步增加,最大地址空间可以呈指数级增长。对于“一对引物,一个文件”的数据组织结构,存储密度分布在0.68(引物长度为30 nt)到0.84(引物长度为15 nt)之间。当采用“一对引物,一个文件”的组织方法时,可以在保持存储密度不变的情况下显著增加最大地址空间。然而,由于缺乏通用反向引物结合位点,不同文件可能对应不同的反向引物,这可能导致PCR扩增复杂性增加。

如果前两种组织方案仍无法满足文件存储需求,则必须增加额外的引物结合位点,这不可避免地会导致存储密度下降。然而,如图7(f)所示,随着引物结合位点级数的增加,最大地址空间的扩展呈指数型增长。尽管在使用“三对引物,一个文件”的组织方法(引物长度为30 nt)时,存储密度仅约为0.05,但可通过选择20 nt的引物长度将存储密度提高至0.37,且实现相同的地址空间容量。从DNA合成技术的角度来看,随着合成生物学技术的发展,如果未来单个模板序列合成长度达到几百个核苷酸甚至更长,那么采用本文提出组织方案的存储密度也会增加。由于引物的长度存在固有限制,因此模板序列越长,引物占比就越低,存储密度会越高。

本文的分析揭示了适当的引物长度和引物结合位点级数是平衡存储密度与文件精确检索能力的关键。文中还给出了两者间的定量变化关系,有助于在不同应用场景中选择合适的序列设计模式。

与学者们此前的研究相比,本文提供了一种针对大规模文件DNA存储的随机访问解决方案。Tabatabaei Yazdi等[12]和Organick等[13]都提出了使用PCR扩增来检索目标文件的方法。然而,在大规模文件存储的背景下,PCR扩增对引物的高需求给目标文件精确检索带来了困难。近年来,许多学者探索了不同的方法,如微流控技术、DNA微盘、二氧化硅微球等解决方案。人们尝试寻找其他方法来克服使用引物作为文件标识符所带来的容量限制。然而,这些尝试仍处于探索阶段,相关技术和设备未像PCR技术那样普及。因此,本文仍然采用最广泛使用且成熟的PCR扩增方法,并针对其瓶颈问题提出了一种多模式DNA序列设计架构,这不仅能够满足大规模文件存储下的文件检索需求,还能保持低成本。

本文提出的文件与引物之间的映射关系模型不仅支持精确的单文件检索,还隐含了另一种潜在功能,即支持多模式文件访问。如果多个文件使用相同的引物序列来结合给定的引物结合位点——例如,在“一对引物,一个文件”的架构中,假设引物组合(FP1, RP1)用于文件A,(FP1, RP2)用于文件B,而(FP1, RP3)用于文件C——那么,如果添加相同的正向引物FP1,并且同时加入多个反向引物(如RP1、RP2和RP3)进行PCR扩增反应,则可以一次性检索具有特定属性的目标文件集合。这可能成为未来的研究方向。

4 结论

本文提出了用于单个寡核苷酸池中基于PCR文件检索的多模式DNA序列设计方法。首先,本文分析了引物长度与正交引物库容量之间的关系,得出引物长度和最大可用引物数量并不呈线性关系的结论,并且拟合出在单引物文件映射关系下,同一个寡核苷酸池中能够支持精确检索的文件容量上限;其次,本文分析了具有多级引物结合位点的DNA序列支持的最大理论地址空间,并且与单引物-文件映射方式下的地址空间进行了比较;再次,本文提出了一种多模式DNA序列设计方法,以满足在存储有不同数量文件的单个寡核苷酸池的随机访问需求;最后,本文通过仿真实验分析了基于引物判别器的正交引物库设计方法所产生引物的性能,并且通过选择性PCR扩增实验验证了两级引物结合位点情况下对目标文件精确检索的可行性。利用本文所提方案,研究者能够在引物库设计难度和PCR反应轮数之间的博弈中找到平衡,从而在引物库设计难度较低和PCR反应轮数较少的情况下实现大规模DNA池中文件检索。

本文提出的设计方案具有高度灵活性,以便在实际场景中根据需要选择合适的设计模式。如果引物数量较少且不再设计和合成更多引物序列,使用本文提出的PLL方案可以提供足够的地址空间以实现精确的文件检索;如果同一个DNA寡核苷酸池中待存储的文件数量非常大,且研究人员倾向于设计和合成大量正交引物,则也可以通过本文方案大幅扩展最大地址空间。

总之,本文突破了传统方法中文件数量与引物数量之间需要有强相关性以实现精确文件检索的限制。通过本文提出的BSLL和PLL序列设计方法,可以实现两者关系的解耦,为DNA存储的文件检索设计提供了高度灵活性。

未来随着大规模DNA分子合成成本的降低和合成长度的增加,我们或许能够合成并存储具有海量信息和数量的文件。此外,通过生化实验,多级引物的实际应用将在更多应用场景上得到验证。

参考文献

[1]

Machines smarter than men? Interview with Dr. Norbert Wiener, noted scientist. US News World Rep 1964 Feb:84‒6.

[2]

Pinho AJ, Pratas D, Ferreira PJSG. Bacteria DNA sequence compression using a mixture of finite-context models. In: Proceedings of 2011 IEEE Statistical Signal Processing Workshop; 2011 Jun 28‒30; Nice, France. Piscataway: IEEE; 2011. p. 125‒8. . 10.1109/ssp.2011.5967637

[3]

Goldman N, Bertone P, Chen S, Dessimoz C, LeProust EM, Sipos B, et al. Towards practical, high capacity, low-maintenance information storage in synthesized DNA. Nature 2013;494(7435):77‒80. . 10.1038/nature11875

[4]

Yim AKY, Yu ACS, Li JW, Wong AIC, Loo JFC, Chan KM, et al. The essential component in DNA-based information storage system: robust error-tolerating module. Front Bioeng Biotechnol 2014;2(2):49‒51. . 10.3389/fbioe.2014.00049

[5]

Savitri PAI, Adiwijaya, Murdiansyah DT, Astuti W. Digital medical image compression algorithm using adaptive Huffman coding and graph based quantization based on IWT-SVD. In: Proceedings of 2016 4th International Conference on Information and Communication Technology; 2016 May 25‒27; Bandung, Indonesia. Piscataway: IEEE; 2016. p. 264‒9. . 10.1109/icoict.2016.7571902

[6]

Shipman SL, Nivala J, Macklis JD, Church GM. Molecular recordings by directed CRISPR spacer acquisition. Science 2016;353(6298):aaf1175. . 10.1126/science.aaf1175

[7]

Shipman SL, Nivala J, Macklis JD, Church GM. CRISPR-Cas encoding of a digital movie into the genomes of a population of living bacteria. Nature 2017;547(7663):345‒9. . 10.1038/nature23017

[8]

Farzadfard F, Lu TK. Genomically encoded analog memory with precise in vivo DNA writing in living cell populations. Science 2014;346(6211):1256272. . 10.1126/science.1256272

[9]

Roquet N, Soleimany AP, Ferris AC, Aaronson S, Lu TK. Synthetic recombinase-based state machines in living cells. Science 2016;353(6297):aad8559. . 10.1126/science.aad8559

[10]

Chen W, Han M, Zhou J, Ge Q, Wang P, Zhang X, et al. An artificial chromosome for data storage. Natl Sci Rev 2021;8(5):nwab028. . 10.1093/nsr/nwab028

[11]

Song L, Geng F, Gong ZY, Chen X, Tang J, Gong C, et al. Robust data storage in DNA by de Bruijn graph-based de novo strand assembly. Nat Commun 2022;13(1):5361. . 10.1038/s41467-022-33046-w

[12]

Tabatabaei Yazdi SMH, Yuan Y, Ma J, Zhao H, Milenkovic O. A rewritable, random-access DNA-based storage system. Sci Rep 2015;5(1):14138. . 10.1038/srep14138

[13]

Organick L, Ang SD, Chen YJ, Lopez R, Yekhanin S, Makarychev K, et al. Random access in large-scale DNA data storage. Nat Biotechnol 2018;36(3):242‒8. . 10.1038/nbt.4079

[14]

Tomek KJ, Volkel K, Simpson A, Hass AG, Indermaur EW, Tuck JM, et al. Driving the scalability of DNA-based information storage systems. ACS Synth Biol 2019;8(6):1241‒8. . 10.1021/acssynbio.9b00100

[15]

Song X, Shah S, Reif J. Multidimensional data organization and random access in large-scale DNA storage systems. Theor Comput Sci 2021;894:190‒202. . 10.1016/j.tcs.2021.09.021

[16]

Newman S, Stephenson AP, Willsey M, Nguyen BH, Takahashi CN, Strauss K, et al. High density DNA data storage library via dehydration with digital microfluidic retrieval. Nat Commun 2019;10(1):1706. . 10.1038/s41467-019-09517-y

[17]

Bee C, Chen YJ, Queen M, Ward D, Liu X, Organick L, et al. Molecular-level similarity search brings computing to DNA data storage. Nat Commun 2021;12(1):4764. . 10.1038/s41467-021-24991-z

[18]

Banal JL, Shepherd TR, Berleant J, Huang H, Reyes M, Ackerman CM, et al. Random access DNA memory using Boolean search in an archival file storage system. Nat Mater 2021;20(9):1272‒80. . 10.1038/s41563-021-01021-3

[19]

Piantanida L, Hughes WL. A PCR-free approach to random access in DNA. Nat Mater 2021;20(9):1173‒4. . 10.1038/s41563-021-01089-x

[20]

Löchel HF, Welzel M, Hattab G, Hauschild AC, Heider D. Fractal construction of constrained code words for DNA storage systems. Nucleic Acids Res 2022;50(5):e30. . 10.1093/nar/gkab1209

[21]

Cao B, Li X, Zhang X, Wang B, Zhang Q, Wei X. Designing uncorrelated address constrain for DNA storage by DMVO algorithm. IEEE/ACM Trans Comput Biol Bioinf 2022;19(2):866‒77. . 10.1109/tcbb.2020.3011582

[22]

Yin Q, Zheng Y, Wang B, Zhang Q. Design of constraint coding sets for archive DNA storage. IEEE/ACM Trans Comput Biol Bioinf 2022;19(6):3384‒94. . 10.1109/tcbb.2021.3127271

[23]

Nguyen BH, Takahashi CN, Gupta G, Smith JA, Rouse R, Berndt P, et al. Scaling DNA data storage with nanoscale electrode wells. Sci Adv 2021;7(48): eabi6714. . 10.1126/sciadv.abi6714

[24]

Takahashi CN, Nguyen BH, Strauss K, Ceze L. Demonstration of end-to-end automation of DNA data storage. Sci Rep 2019;9(1):4998. . 10.1038/s41598-019-41228-8

[25]

Organick L, Nguyen BH, McAmis R, Chen WD, Kohll AX, Ang SD, et al. An empirical comparison of preservation methods for synthetic DNA data storage. Small Methods 2021;5(5):2001094. . 10.1002/smtd.202001094

[26]

Antkowiak PL, Koch J, Rzepka P, Nguyen B, Strauss K, Stark WJ, et al. Anhydrous calcium phosphate crystals stabilize DNA for dry storage. Chem Commun 2022;58(19):3174‒7. . 10.1039/d2cc00414c

AI Summary AI Mindmap
PDF (6713KB)

6830

访问

0

被引

详细

导航
相关文章

AI思维导图

/