Sentieon
Sentieon 中文手册
Sentieon 中文手册(上册)
Sentieon 中文手册(下册)
Sentieon 软件应用教程
Sentieon | 联合Dell、AMD开发基因组大数据分析加速方案
Sentieon | 应用教程: 利用Sentieon Python API引擎为自研算法加速
Sentieon | 应用教程: 关于读段组的建议
Sentieon | 应用教程: 使用DNAscope对HiFi长读长数据进行胚系变异检测分析
Sentieon | 应用教程: TNscope® 使用机器学习模型进行有匹配正常样本的体细胞变异发现
Sentieon | 应用教程: CCDG使用Sentieon®的功能等效流程
Sentieon | 应用教程: 利用共识功能去除PCR重复
Sentieon | 应用教程: 适用于PacBio HiFi和Oxford Nanopore长读长测序数据的结构变异检测
Sentieon | 应用教程: 使用 Sentieon进行大型基因组重测序分析
Sentieon | 应用教程: 体细胞SNP/Indel变异检测
Sentieon | 应用教程: DNAscope使用机器学习模型进行胚系变异调用
Sentieon | 应用教程: 唯一分子标识符(UMI)
Sentieon | 应用教程: Sentieon分布模式
Sentieon | 应用教程:使用CNVscope进行CNV检测分析
Sentieon发布核心家系(trio)基因分析最佳实践方案
Sentieon推出Segdup-caller:针对片段重复区域的专用精准变异检测工具
Sentieon-cli | DNAscope WES 流程单条命令版本详解
Sentieon | DNAscope 核心家系(trio) WES 分析全流程详解
Sentieon | DNAscope Hybrid长短读长混合分析流程详解及评测
Sentieon | DNAscope LongRead:面向ONT WGS的快速、高精度、低成本变异检测流程
Sentieon软件版本更新
Sentieon | 发布V202503.01版本
Sentieon | 发布V202503.02版本
Sentieon | 发布V202503.03版本
Sentieon软件快速入门指南
Sentieon 软件模块总述
Sentieon 特色流程 - DNAscope
Sentieon | DNAscope Illumina 流程
sentieon | DNAscope Complete Genomics 流程
Sentieon | DNAscope LongRead PacBio 流程
Sentieon | DNAscope Ultima Genomics 流程
Sentieon | DNAscope Element Bio 流程
Sentieon | DNAscope LongRead Nanopore 流程
Sentieon混合分析流程 - DNAscope Hybrid
Sentieon推出混合型短读长和长读长变异检测DNAscope Hybrid流程(上)
Sentieon推出混合型短读长和长读长变异检测DNAscope Hybrid流程(下)
毅硕Sentieon | 泛基因组分析流程详解
Sentieon | 基于Illumina WGS数据的高精度、低成本的泛基因组分析方案
Sentieon | 基于Ultima WGS数据的高精度、低成本的泛基因组分析测评
Sentieon | 泛基因组分析流程详解—CHM13 (T2T) 更新版
Sentieon | DNAscope Pangenome:赋能人类高精度生殖筛查
Sentieon|植物泛基因组分析加速详解
毅硕Sentieon | RNA-seq 变异检测全流程详解
毅硕Sentieon | 物种全基因组(WGS)分析流程
毅硕Sentieon | 植物全基因组(WGS)分析流程
毅硕Sentieon | 小麦(Triticum aestivum)全基因组WGS分析流程
毅硕Sentieon | 水稻(Oryza sativa)全基因组WGS分析流程
毅硕Sentieon | 拟南芥(Arabidopsis thaliana)全基因组WGS分析流程
毅硕Sentieon | 马铃薯(Solanum tuberosum)全基因组WGS分析流程
毅硕Sentieon | 巨桉(Eucalyptus grandis)全基因组WGS分析流程
毅硕Sentieon | 向日葵(Helianthus annuus)全基因组WGS分析流程
毅硕Sentieon | 野草莓(Fragaria vesca)全基因组WGS分析流程
毅硕Sentieon | 银杏(Ginkgo biloba)全基因组WGS分析流程
毅硕Sentieon | 大豆(Glycine max)全基因组WGS分析流程
毅硕Sentieon | 陆地棉(Gossypium hirsutum)全基因组WGS分析流程
毅硕Sentieon | 胡桃(Juglans regia)全基因组WGS分析流程
毅硕Sentieon | 苹果(Malus domestica)全基因组WGS分析流程
毅硕Sentieon | 香蕉(musa acuminata)全基因组WGS分析流程
毅硕Sentieon | 罂粟(Papaver somniferum)全基因组WGS分析流程
毅硕Sentieon | 开心果(Pistacia vera)全基因组WGS分析流程
毅硕Sentieon | 毛果杨(Populus trichocarpa)全基因组WGS分析流程
毅硕Sentieon | 夏栎(Quercus robur)全基因组WGS分析流程
毅硕Sentieon | 蓖麻(Ricinus communis)全基因组WGS分析流程
毅硕Sentieon | 动物全基因组(WGS)分析流程
毅硕Sentieon | 猪(sus scrofa)全基因组WGS分析流程
毅硕Sentieon | 鸡(Gallus gallus)全基因组WGS分析流程
毅硕Sentieon | 家鼠(Mus musculus)全基因组WGS分析流程
毅硕Sentieon | 家犬(canis lupus familiaris)全基因组WGS分析流程
毅硕Sentieon | 东方蜜蜂(Apis cerana)全基因组WGS分析流程
毅硕Sentieon | 电鳗(Electrophorus electricus)全基因组WGS分析流程
毅硕Sentieon | 红隼(Falco tinnunculus)全基因组WGS分析流程
毅硕Sentieon | 家猫(Felis catus)全基因组WGS分析流程
毅硕Sentieon | 尼罗罗非鱼(Oreochromis niloticus)全基因组WGS分析流程
毅硕Sentieon | 狮子(Panthera leo)全基因组WGS分析流程
毅硕Sentieon | 东北虎(panthera tigris altaica)全基因组WGS分析流程
毅硕Sentieon | 黑猩猩(pan troglodytes)全基因组WGS分析流程
毅硕Sentieon | 中国鳖(pelodiscus sinensis)全基因组WGS分析流程
毅硕Sentieon | 褐家鼠(rattus norvegicus)全基因组WGS分析流程
毅硕Sentieon | 家牛(Bos taurus)全基因WGS分析流程
毅硕Sentieon | 虎河豚(takifugu rubripes)全基因WGS分析流程
毅硕Sentieon | 人类(Homo sapiens)全基因组WGS分析流程
毅硕Sentieon | 狮尾狒(theropithecus gelada)全基因组WGS分析流程
毅硕Sentieon | 草鱼(Ctenopharyngodon idella)全基因组WGS分析流程
毅硕Sentieon文献解读
Sentieon文献解读 | Population Sequencing
Sentieon文献解读 | Agrigenomics
Sentieon | Agrigenomics-泛基因组揭示小麦结构变异与栖息地及育种的关联
Sentieon文献解读 | Genetic Disease
Sentieon文献解读 | Tumor Sequencing
Sentieon文献解读 | Benchmark and Method Study
Sentieon文献解读 | Long Read Sequencing
Sentieon文献解读 | Clinical Trial
Sentieon文献解读 | Epidemiology
Sentieon文献解读 | Gene Editing
Sentieon文献解读 | Liquid Biopsy
Sentieon | TNscope 分析流程详解
Sentieon | TNscope WES Panel 分析流程详解
-
+
首页
Sentieon | DNAscope Pangenome:赋能人类高精度生殖筛查
# 一、前言 在人类全基因组分析中,常常面对两个看似矛盾的目标:一方面,希望缩短 FASTQ 到 VCF 的分析时间,以有限算力支撑更多样本;另一方面,又希望提升 SNP、INDEL,尤其是结构变异(SV)的检出准确性。 Sentieon泛基因组流程(DNAscope Pangenome)是一个利用泛基因组图进行短读长 DNA 序列数据比对和变异识别的分析流程。该流程基于图结构的参考基因组表示法,旨在提升比对和变异检测的分析效率和精度,特别是在具有高序列多样性的复杂基因组区域中。 * * * # 二、生殖遗传检测为何更需要关注 SV 和 CNV? 在生殖遗传研究与检测中,除了 SNP 和短 INDEL,染色体结构异常和基因组剂量变化同样是不可忽视的重要变异类型。拷贝数缺失或重复、倒位、易位及其他结构重排,可能与携带者筛查、胚胎植入前遗传学检测、复发性流产研究以及产前遗传评估等场景相关。 现有二代测序结合线性参考基因组,已经能够有效识别非整倍体、大型缺失或重复以及部分常规 CNV。因此,不能简单地说“传统二代测序无法检测 SV/CNV”。 真正具有挑战性的,往往是以下场景: * 位于重复序列、片段重复和高度多态区域的变异; * 线性参考中缺失的非参考插入和替代单倍型; * 断点难以唯一定位的复杂 SV; * 倒位、易位等不伴随明显拷贝数变化的平衡重排; * 尺寸较小、嵌套或多断点组合的复杂 CNV/SV。 在这些区域中,短 reads 本身长度有限,而单一线性参考又只能提供一条主要路径,容易出现错误比对、多重比对或比对失败。由此得到的覆盖深度、异常 read pair 和 split-read 信号也可能不够稳定,给 SV 断点解析和复杂 CNV 判断带来困难。 * * * # 三、从线性参考到图泛基因组:为什么同样的 reads 能得到更好的结果? 传统 DNAseq 或 DNAscope 流程通常将 reads 比对到单一线性参考基因组。线性参考成熟、通用,但它只能提供一条主要参考路径,难以完整表达不同人群和不同单倍型中的序列多样性。当样本与线性参考差异较大,或者变异位于高度多态、重复、大片段插入缺失等复杂区域时,短 reads 可能出现错误比对、多重比对或无法比对,继而影响下游变异检测。 Sentieon DNAscope Pangenome 则利用泛基因组图中包含的多条单倍型路径,为 reads 提供更丰富的比对空间。泛基因组流程包含多个阶段,通过两个有向无环图(DAG)执行: 第一个 DAG * K-mer 计数:kmc 从输入的 FASTQ 文件中计数 k-mer。 * 样本特异性泛基因组:vg haplotypes 利用 k-mer 频率创建样本特异性的泛基因组。 * 泛基因组比对:vg giraffe 将读段比对到样本特异性泛基因组。 * 读段支持度计算:vg pack 计算变异体的读段支持度。 * 结构变异识别:vg call 根据读段支持度识别结构变异。 * 线性参考基因组比对:vg surject 将泛基因组比对结果投射回线性参考基因组。 * 重复标记:Sentieon Dedup 标记重复读段并计算相关指标。 * Indel 重新比对:Sentieon Realigner 执行 indel 重新比对。 * 小变异识别:Sentieon DNAscope 识别小变异(SNV和indel)。 * 倍性估计:估计样本性别和倍性,用于下游处理。 * HLA/KIR 基因分型:T1K 对 HLA 和 KIR 基因座进行分型(可选)。 * 片段重复变异识别:segdup-caller 识别片段重复区域的变异(可选)。 第二个 DAG * CNV 识别:Sentieon CNVscope 识别拷贝数变异,并进行性别特异性处理。 * 重复扩增识别:ExpansionHunter 识别重复扩增(可选)。 下游仍可使用熟悉的 VCF 和标准参考坐标,而复杂区域的比对与变异识别能力得到了增强。 用一句话概括,即“FASTQ 没有变,测序成本没有增加;改变的是参考基因组的表达方式,以及数据中有效信息被利用的程度。" * * * # 四、Pangenome 的优势:给复杂变异提供更多“可比对路径” 图泛基因组不是只增加一条新参考序列,而是把来自不同个体和单倍型的替代序列组织成图结构。当样本包含线性参考中没有的序列或结构时,reads 可以在图中找到更接近真实样本的路径,从而降低参考偏倚,改善复杂区域的比对质量。 人类泛基因组参考联盟发表的研究显示,与 GRCh38 线性参考流程相比,使用泛基因组分析短读长数据时,小变异发现错误减少 34%,每条单倍型检测到的结构变异数量增加 104% 。这说明图泛基因组不仅有助于 SNP/INDEL,也为短读长 SV 分析提供了更大的提升空间。 需要注意的是,Pangenome 并不会自动解决所有 CNV 和结构重排问题。常规 CNV 仍主要依赖覆盖深度、等位基因比例等证据;平衡易位、复杂嵌套重排和高度重复区域也可能需要核型分析、CMA、FISH、长读长测序或其他方法进行补充与确认。Pangenome 的核心价值,是改善参考表达和 reads 比对,为这些变异提供更充分、更可靠的分析证据。 * * * # 五、Sentieon Pangenome:让既有二代 WGS 看见更多复杂变异 Sentieon DNAscope Pangenome 将图泛基因组比对、个性化参考、DNAscope 小变异检测、PangenomeSV 和 CNVscope 整合到一套流程中,可同时输出: * SNP 和短 INDEL。 * 结构变异 SV。 * 拷贝数变异 CNV。 * 标准参考坐标下的 BAM/CRAM 和 VCF,便于衔接既有注释与解读流程。 对于关注 SV 和 CNV 的生殖遗传研究,Sentieon DNAscope Pangenome 的意义在于:无需重新测序,即可在保留二代 WGS 高通量和成本优势的同时,进一步挖掘复杂区域和结构变异信息;配合 Sentieon 的高效计算能力,也有利于将图泛基因组分析扩展到更大样本量。 生殖遗传检测不能只关注 SNP。Sentieon DNAscope Pangenome 让同一份二代 WGS 数据看见更多复杂变异,为 SV/CNV 分析提供新的流程升级路径。 * * * # 六、HG002 实测:同一份二代 FASTQ,Pangenome 模式全面提升检测精度 在此前的 HG002 测试中,使用 DNAscope Pangenome 模式,输入 FASTQ 与普通 DNAscope 模式完全相同。 两组分析的关键差异在于: * DNAscope 模式采用传统线性参考分析; * DNAscope Pangenome 模式引入图泛基因组比对和个性化单倍型信息。 在保持测序数据一致的前提下,DNAscope Pangenome 取得了更高的 SNP、INDEL 和 SV 检测精度: |变异类型|HG002 DNAscope F1 score|HG002 DNAscope Pangenome F1 score|Pangenome亮点| |--|--|--|--| |SNP|0.996|0.999|小变异检测保持极高精度| |INDEL|0.996|0.998|复杂插入缺失识别进一步改善| |SV|NA|0.955|短读长数据获得突出结构变异检测表现| 尤其值得关注的是,DNAscope Pangenome 的 SV F1 score 达到 0.955,已经超过此前对照测试中 10× 深度长读长 reads 的 SV F1 score。本次测试的结果传递出一个重要信号:在不更换测序数据、不增加一轮测序的情况下,图泛基因组方法可以显著拓展二代数据的分析能力。对于已经积累大量短读长 WGS 数据的研究机构而言,这也为存量数据再分析提供了新的路径。 * * * # 七、三例 WGS 测试:约 88 分钟完成三个样本的全流程分析 除官方公开数据外,我们还使用了三个人类 Illumina WGS 数据,对 Sentieon DNAscope Pangenome 进行了实际运行测试。 本次测试使用 Sentieon Genomics 202503.03,基于 HPRC v2.0 Pangenome Graph + GRCh38,配套 `SentieonIlluminaPangenomeRealignWGS1.1.bundle` 模型。三个样本均为 Illumina PE150 数据,单样本压缩 FASTQ(R1+R2) 约 71.5 GB,平均测序深度约 34.45×。 计算环境为 HPC:三个样本分别分配至一台 64 CPU 计算节点,并行完成分析。 测试集群单计算节点配置: * CPU为Intel(R) Xeon(R) Platinum 8358P CPU @ 2.60GHz 64核心 * 内存为 512GB DDR4 * 系统为 Ubuntu 22.04.3 LTS Sentieon 软件地址链接: * https://ftp.insvast.com/user/Sentieon/release/sentieon-genomics-202503.03.tar.gz (适配X86架构CPU服务器,例如Intel、 AMD、 曙光) * https://ftp.insvast.com/user/Sentieon/release/arm-sentieon-genomics-202503.03.tar.gz (适配ARM架构CPU服务器, 例如华为鲲鹏、 Ampare、阿⾥倚天) * 软件下载链接需用户名与密码,用户名:insvast;密码:Ins@1234 ## 1. 参考基因组文件下载 流程会相对于高质量参考基因组识别变异。除参考 FASTA 外,还需要提供 .fai 索引文件;如果从 FASTQ 开始进行 BWA 线性比对,还需要 BWA index。 对于 GRCh38,建议使用不含 ALT contigs 的参考版本,并保持 contig 命名与 pangenome、BED、VCF 文件一致。对于 CHM13 (T2T),必须确保参考 FASTA、GBZ、HAPL、population VCF、BED 以及已有 BAM/CRAM 都在同一坐标体系下,不能混用 GRCh38 和 CHM13 文件。 下载 GRCh38 参考基因组: ``` curl -L \ -O 'https://ftp.sentieon.com/public/GRCh38/hg38_canonical.bed' \ -O 'https://human-pangenomics.s3.amazonaws.com/pangenomes/freeze/release2/minigraph-cactus/hprc-v2.0-mc-grch38.gbz' \ -O 'https://human-pangenomics.s3.amazonaws.com/pangenomes/freeze/release2/minigraph-cactus/hprc-v2.0-mc-grch38.hapl' \ -O 'https://ftp.sentieon.com/public/GRCh38/population/pop-v20g41-20251216.vcf.gz' \ -O 'https://ftp.sentieon.com/public/GRCh38/population/pop-v20g41-20251216.vcf.gz.tbi' \ -o 'hg38_ucsc.fa' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/WholeGenomeFasta/genome.fa' \ -o 'hg38_ucsc.fa.fai' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/WholeGenomeFasta/genome.fa.fai' \ -o 'hg38_ucsc.fa.amb' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/BWAIndex/genome.fa.amb' \ -o 'hg38_ucsc.fa.ann' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/BWAIndex/genome.fa.ann' \ -o 'hg38_ucsc.fa.bwt' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/BWAIndex/genome.fa.bwt' \ -o 'hg38_ucsc.fa.pac' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/BWAIndex/genome.fa.pac' \ -o 'hg38_ucsc.fa.sa' 'https://ngi-igenomes.s3.amazonaws.com/igenomes/Homo_sapiens/UCSC/hg38/Sequence/BWAIndex/genome.fa.sa' \ -O 'https://storage.googleapis.com/gcp-public-data--broad-references/hg38/v0/Homo_sapiens_assembly38.dbsnp138.vcf.gz' \ -O 'https://storage.googleapis.com/gcp-public-data--broad-references/hg38/v0/Homo_sapiens_assembly38.dbsnp138.vcf.gz.tbi' ``` 下载 T2T 参考基因组: * https://42basepairs.com/browse/s3/human-pangenomics/submissions/89DF6EFF-E289-49A2-B2B4-ABF13E43731B--PanGenie?file=chm13v2.0\_maskedY\_rCRS.fa&preview= ``` aws s3 cp s3://human-pangenomics/submissions/89DF6EFF-E289-49A2-B2B4-ABF13E43731B--PanGenie/chm13v2.0_maskedY_rCRS.fa . --no-sign-request aws s3 cp s3://human-pangenomics/submissions/89DF6EFF-E289-49A2-B2B4-ABF13E43731B--PanGenie/chm13v2.0_maskedY_rCRS.fa.fai . --no-sign-request ``` ## 2. 泛基因组文件下载 新版 DNAscope Pangenome 主要需要以下 pangenome 文件: |文件|常见格式|说明| |--|--|--| |图文件|`.gbz`|pangenome graph 文件,包含图结构和路径信息| |单倍型文件|`.hapl`|pangenome haplotype 信息| |参考 FASTA|`.fa`/ `.fasta`|线性参考,用于坐标体系和变异定义| 早期流程中常见的 `.snarls` 和 `.xg` 文件在原文示例中用于 `vg` 相关步骤;在当前 `sentieon-cli dnascope-pangenome` 文档命令中,用户侧核心输入已简化为 `--gbz` 和 `--hapl`。 下载链接: * https://data.humanpangenome.org/alignments  ## 3. 模型包(Model bundle)文件下载 DNAscope Pangenome 需要 Sentieon model bundle。模型包需与测序平台、分析流程和 population VCF 匹配。Sentieon models 仓库中提供了 pangenome 相关模型入口,例如 Illumina whole genome pangenome 和 Ultima whole genome pangenome 模型。 Sentieon models 仓库 * https://github.com/Sentieon/sentieon-models ## 4. Population VCF 文件下载 新版流程明确要求提供 population VCF: ``` --pop_vcf POP_VCF ``` population VCF 必须与 model bundle 匹配,并且坐标体系要与当前参考一致。使用 CHM13 时,不能直接沿用 GRCh38 的 population VCF。 下载路径: https://ftp.sentieon.com/public/CHM13/population/ ``` wget https://ftp.sentieon.com/public/CHM13/population/pop-v20_chm13-20260528.vcf.gz wget https://ftp.sentieon.com/public/CHM13/population/pop-v20_chm13-20260528.vcf.gz.tbi ```  ## 5. 使用命令 ### 5.1 从 FASTQ 进行泛基因组比对和变异识别 新版 FASTQ 输入命令结构如下: ``` sentieon-cli dnascope-pangenome \ -r REFERENCE \ --hapl HAPL \ --gbz GBZ \ --r1_fastq R1_FASTQ \ --r2_fastq R2_FASTQ \ --readgroup READGROUP \ --pop_vcf POP_VCF \ -m MODEL_BUNDLE \ [-b INTERVAL_FILE] \ [-d DBSNP] \ [-t NUMBER_THREADS] \ [--pcr_free] \ [-g] \ [--call_svs] \ [--expansion_catalog EXPANSION_CATALOG] \ [--segdup_caller [GENES]] \ [--t1k_hla_seq T1K_HLA_SEQ --t1k_hla_coord T1K_HLA_COORD] \ [--t1k_hla_locus T1K_HLA_LOCUS] \ [--t1k_kir_seq T1K_KIR_SEQ --t1k_kir_coord T1K_KIR_COORD] \ [--t1k_kir_locus T1K_KIR_LOCUS] \ [--skip_metrics] \ [--skip_multiqc] \ SAMPLE_VCF ``` 必需参数包括: * `-r REFERENCE`:参考基因组 FASTA。 * `--hapl HAPL`:pangenome haplotype 文件。 * `--gbz GBZ`:GBZ 格式 pangenome graph。 * `--r1_fastq` / `--r2_fastq`:双端 FASTQ 输入。 * `--readgroup READGROUP`:样本 read group 信息。 * `--pop_vcf POP_VCF`:population VCF。 * `-m MODEL_BUNDLE`:Sentieon model bundle。 * `SAMPLE_VCF`:主输出 VCF,需以 `.vcf.gz` 结尾。 ### 5.2 从已排序 BAM/CRAM 进行变异识别 如果已有排序后的 BAM 或 CRAM,可使用 `-i` 输入: ``` sentieon-cli dnascope-pangenome \ -r REFERENCE \ --hapl HAPL \ --gbz GBZ \ -i SAMPLE_INPUT \ --pop_vcf POP_VCF \ -m MODEL_BUNDLE \ [-b INTERVAL_FILE] \ [-d DBSNP] \ [-t NUMBER_THREADS] \ [--pcr_free] \ [-g] \ [--call_svs] \ SAMPLE_VCF ``` BAM/CRAM 的坐标体系必须与 `-r` 指定的参考一致。例如,GRCh38 坐标的 CRAM 不能直接放入 CHM13 流程中运行。 ## 6. 单样本运行时间与资源消耗 |样本|单样本 Walltime|峰值内存 MaxRSS|CPU 效率| |--|--|--|--| |`clean.lab14_a`|1 小时 19 分 57 秒|211.0 GB|60.2%| |`AS24201083`|1 小时 20 分 12 秒|210.7 GB|60.1%| |`clean.lab14_b`|1 小时 20 分 14 秒|207.0 GB|60.2%| 三个样本的单样本 Walltime 均约为 80 分钟。由于三个样本分别在三个节点上并行运行,从项目初始化、参考检查、Pangenome Calling 到结果统计汇总,三个样本的项目级端到端总用时约为 88 分钟,其中核心 Pangenome Calling 阶段约为 77 分钟。 换句话说,在本次硬件和流程配置下,约一个半小时即可完成三例 34.5× 人类 WGS 数据的图泛基因组分析,并同时得到 SNP/INDEL、SV 和 CNV 结果。 ## 7. 各分析步骤的时间与内存画像 |分析步骤|耗时|峰值内存| |--|--|--| |KMC k-mer 分析与 vg 个性化图构建|约 5 分钟|约 40 GB| |BWA-MEM 线性比对与排序|约 25 分钟|约 160 GB| |Minimap2 Pangenome 重比对|约 10 分钟|约 60 GB| |双路数据去重复与排序|约 15 分钟|约 55 GB| |DNAscope 变异检测|约 12 分钟|1.33 GB| 完整作业的 MaxRSS 峰值为 207–211 GB,主要出现在比对、排序以及多数据流并行处理阶段; ## 8. 三种模式,应该如何选择? |分析模式|主要特点|推荐场景| |--|--|--| |Sentieon DNAseq|高效复现 BWA-GATK Best Practices 数学模型,结果稳定|已建立 GATK 标准流程、重点关注流程加速与结果一致性的项目| |Sentieon DNAscope|在线性参考框架下结合改进的局部组装和机器学习|希望兼顾高速度与更高 SNP/INDEL 检测精度的常规 WGS/WES 项目| |Sentieon DNAscope Pangenome|使用图泛基因组、个性化参考和单倍型信息|希望进一步改善复杂区域、小变异及 SV 检测的短读长人类基因组项目| 如果项目的首要目标是替代并加速既有 GATK 流程,DNAseq 是直接选择;如果希望在线性参考体系下提高检测精度,可选择 DNAscope;如果希望让同一份二代数据获得更全面的变异检测结果,尤其关注复杂区域和 SV,DNAscope Pangenome 更值得优先评估。 * * * # 八、总结 Sentieon DNAscope Pangenome 流程的核心价值,是将图结构参考引入短读长数据分析,在复杂区域和高多样性区域中改善比对与变异检测。同样的数据,更快的分析,更全面的变异结果。这正是 Sentieon DNAscope Pangenome 带来的核心价值:既保留二代测序成熟、经济和高通量的优势,又借助图泛基因组打开复杂变异检测的新空间,让每一份测序数据发挥更大价值。 Sentieon在不断地优化算法的运行效率,为科研工作者提供更快速、更经济的基因检测方案。若您刚好有需要检测的数据,不妨来申请试用Sentieon吧! * * * # Sentieon软件介绍 Sentieon为完整的纯软件基因变异检测二级分析方案,其分析流程完全忠于BWA、GATK、MuTect2、STAR、Minimap2、Fgbio、picard等金标准的数学模型。在匹配开源流程分析结果的前提下,大幅提升WGS、WES、Panel、UMI、ctDNA、RNA等测序数据的分析效率和检出精度,并匹配目前全部第二代、三代测序平台。  Sentieon软件团队拥有丰富的软件开发及算法优化工程经验,致力于解决生物数据分析中的速度与准确度瓶颈,为来自于分子诊断、药物研发、临床医疗、人群队列、动植物等多个领域的合作伙伴提供高效精准的软件解决方案,共同推动基因技术的发展。 截至2026年4月份,Sentieon已经在全球范围内为1860+用户提供服务,用户处理超过7400+PB数据量,被世界一级影响因子刊物如NEJM、Cell、Nature等广泛引用,引用次数超过1900篇。此外,Sentieon连续数年摘得了Precision FDA、Dream Challenges等多个权威评比的桂冠,在业内获得广泛认可。
chsnp
2026年8月27日 11:44
转发
收藏文档
上一篇
下一篇
手机扫码
复制链接
手机扫一扫转发分享
复制链接
Markdown文件
Word文件
PDF文档
PDF文档(打印)
分享
链接
类型
密码
更新密码
有效期