重磅发布|真迈生物联合Sentieon打造SURFSeq 5000 CMS + DNAscope工作流

举报
湾联科技 发表于 2026/09/15 15:20:31 2026/09/15
【摘要】 真迈生物SURFSeq 5000与Sentieon的联合方案在保障极致准确率的同时兼具显著的成本效益,并实现了传统线性参考与泛基因组 WGS 双工作流的无缝兼容,为大规模人群队列研究与常规临床遗传诊断构建了一套兼具高保真度、高扩展性与高性价比的软硬件一体化分析架构。

突破性准确率: CMS 化学技术 + DNAscope AI 实现 Q50 级别的精准度

群体学效能:整合 1KCP(千人中国泛基因组)优化东亚人群基因组的 Indel检测

实证稳定性:针对大规模临床与科研队列,具备卓越的批次一致性


一、引言

针对复杂区域测序丢失、硬件错误伪影及族源偏好性等瓶颈,真迈生物联合 Sentieon 推出端到端基因组分析流水线。方案整合 SURFSeq 5000 专有 CMS 化学技术与定制重构的 DNAscope 机器学习模型,实现全基因组均一覆盖、Q50 碱基识别与精准去伪影。

多项金标准基准测试证实,该联合方案在全变异类型检出上均展现出绝对优势。在 GIAB v5.0(T2T)复杂难测序区域中,累积变异错误数降至约 4.3 万例。在大尺度变异解析上,结构变异(SV)检出 F1 分数达 0.959,节段重复区拷贝数增加灵敏度高达 0.909,彻底解决了复杂断裂点与大片段变异的漏检难题。

依托 1000 中国泛基因组(1KCP)训练赋能,该方案在“中华家系1号”东亚参考面板上的 Indel 检出 F1 分数达 0.9932。同时,工作流在传统线性 WGS 与 50X-300X 临床 WES 场景下均保持最低错误率,为大人群队列与临床精准诊断提供了高保真度与高性价比的分析底座。


二、Sentieon与真迈生物联合推出新方案

在高通量基因组测序的实际应用中,存在着非经典 DNA 结构生化测序中的盲区、传统线性参考基因组引发的族源偏好,以及通用分析模型难以适配硬件特异噪声的行业痛点。针对这一系统性难题,真迈生物携手 Sentieon 推出了端到端高精度基因组分析流程。

  • 在硬件层面依托 SURFSeq 5000 专有的 CMS 测序化学技术,从生化底层有效解开了复杂折叠模板,消除了难测区域的覆盖度落差,保障了全基因组均一覆盖与 Q50 级的超高碱基识别质量;

  • 软件层面则基于平台实测数据,Sentieon 定制构建了三套 DNAscope GBDT 机器学习模型,全面覆盖泛基因组 WGS、传统线性 WGS 及临床靶向 WES 场景,精准滤除硬件存在的噪音。

  • 同时,该流程进一步融合了 1000 中国泛基因组(1KCP)与图参考架构,在保持 GRCh38 临床兼容性的同时,经中华家系1号标准面板严格验证,显著提升了东亚人群复杂变异的检出精度,尤其是Indel变异;为大规模人群队列与临床精准诊断提供了兼具高确定性与高性价比的分析底座。


 

三、研究概况

本次研究采用了权威标准样本与严谨的评估体系,全面验证真迈-Sentieon 集成工作流的基准性能。

测试面板涵盖了 v4.2.1 高置信可及区及 v5.0 T2T 复杂位点评估的全球 GIAB 标准基因组(HG001–HG005),还引入中华家系1号基准面板结合 1000 中国泛基因组(1KCP)数据评估族源特异性表现,并同步覆盖 PCR 与 PCR-free 两种主流建库方案。

模型训练依托 Sentieon 软件套件,基于 SURFSeq 5000 实测 WGS 数据构建专用的 GBDT 分类器。流程通过预留 20% 读段用于交叉验证,并将 20 号染色体完全隔离作为独立测试集以严防过拟合;同时结合 Pan-align 与 BWA-Turbo 比对引擎,在 WGS(15X-40X)与 WES(50X-300X)全梯度深度下采样模拟真实临床场景,确保算法能够精准分离真实变异与平台特异性测序伪影。

最终性能通过 Aardvark 工具对齐金标准,并与 Illumina 搭配 DRAGEN v4.5 或 DNAscope 、Illumina搭配GATK、MGI T7搭配DeepVariant 或 DNAscope 三种主流技术栈进行对比。


四、结果展示

1. DNAscope Pangenome WGS 性能表现

(1) 常规高置信区域的稳健表现

在标准30X WGS 深度下针对 GIAB v4.2.1 基准测试显示,GeneMind + Sentieon 流程的总变异错误数约 6,000 例,优于 MGI T7 + DeepVariant 流程,并与 Illumina + DRAGEN v4.5 及 Illumina + Sentieon 达到相当水平。该表现得益于 CMS 测序化学技术对局部覆盖度偏好的消除,以及平台定制化 ML 模型对 SURFSeq 5000 特异性噪声的精准识别。该结果表明,GeneMind + Sentieon 联合方案在常规基因组区域即可提供比肩乃至超越主流平台的基线准确度。

1.PNG

图1 使用针对真迈训练的 DNAscope Pangenome 模型,在 HG002 30X WGS 数据下与 GIAB v4.2.1 高置信度可及基因组区域基准对比的胚系变异总错误计数比较。相较于 Illumina NovaSeq + DRAGEN v4.5 和 MGI T7 + DeepVariant 等备选流程,Genemind+Sentieon 集成工作流表现出更低的累积假阳性与假阴性变异错误。

(2)攻克复杂难测序区域

在涵盖大量节段重复、串联重复及非 B 型 DNA 等高难度位点的 GIAB v5.0 端粒到端粒(T2T)基准下,GeneMind + Sentieon 工作流的总变异错误数仅约为42,000,显著优于测试的其他三款行业主流流程。其核心归因于 CMS 化学技术通过优化变性效率与聚合酶动力学,在生化源头消除了复杂构象导致的局部覆盖度丢失,为下游泛基因组图比对提供了高保真的原始读段。
这一结果证明Genemind+Sentieon方案能有效突破传统二代测序的技术盲区,在大范围复杂基因组区域中实现高确定性变异检出。

2.PNG

图2 基于真迈训练的 DNAscope Pangenome 模型在 HG002 30X WGS 下针对包含复杂重复、重复及非 B 型 DNA 位点的 GIAB v5.0 端粒到端粒金标准组装集的胚系变异总错误计数对比。在三个竞品行业测序和分析栈中,Genemind+Sentieon 工作流实现了最低的累积变异错误计数。

2. 消减族源参考偏好

现有大多数变异检出模型主要基于欧洲人群数据训练,导致东亚队列在临床关键的小片段 Indel 检出上出现显著准确率损失。为此,真迈 DNAscope Pangenome 模型在训练中深度整合了 1000 中国泛基因组(1KCP)数据集。
针对东亚金标准“中华家系1号”多组学参考面板的评测显示,GeneMind + Sentieon 工作流的 SNP F1 分数达 0.9966,高于 Illumina + GATK 的 0.9965;Indel F1 分数达 0.9932,也大幅超越 Illumina + GATK 的 0.9850。性能跃升的核心原因在于模型训练深度融合了 1000 中国泛基因组(1KCP)数据集,有效消除了传统算法因过度依赖欧洲人群参考基因组而产生的单倍型偏好。
该结果证实,将区域人群泛基因组数据融入平台定制模型,能够显著降低中国人群队列中高频临床小片段 Indel 变异的漏检与误判。

3.PNG

图3 针对中华家系1号人群参考面板中 4 个参考样本(D5, D6, F7 等)的 30X 测序数据集进行的平均 SNP 与 Indel F1 分数对比,对比了真迈 SURFSeq 5000 + Sentieon DNAscope Pangenome 与已发表的 Illumina 测序 + GATK 流程基线。得益于 1000 中国泛基因组模型训练整合,真迈集成工作流在 Indel 检测性能上获得了显著提升。

3. 结构变异和拷贝数变异检测性能

在针对染色体大尺度重排与拷贝数改变的评估中,GeneMind + Sentieon工作流实现了精确率与召回率的同步提升。SV 检测综合 F1 分数达到 0.959,优于 Illumina + DRAGEN v4.5 的 0.920;

在节段重复区域的拷贝数增加(Copy Gain)检测中,检出灵敏度由竞品基准的 0.300 大幅跃升至 0.909。这源于 CMS 均一覆盖度消除了断裂点测序丢峰,结合 DNAscope Pangenome 构建的个性化图参考,彻底化解了传统线性比对在复杂断裂点处的读段歧义。该结果体现了方案在临床大片段致病性结构变异筛查中极高的定性与定量可靠性。

4.png

图4 在由 Illumina NovaSeq + DRAGEN v4.5 与真迈 SURFSeq 5000 + Sentieon DNAscope Pangenome WGS 生成并分析的 30X WGS 数据集之间,SV 检测的精确率、召回率和综合 F1 分数对比。真迈工作流通过 CMS 均一覆盖度和基于图的断裂点比对,实现了大型结构重排精确率与召回率的同步提升。

5.png

图5 采用 DNAscope Pangenome 处理的真迈 SURFSeq 5000 WGS 与 Illumina DRAGEN v4.2 基准数据在拷贝数变异(CNV)检测准确率上的对比,评估了节段重复基因位点上的拷贝数缺失和拷贝数增加事件。

4. 传统线性参考 DNAscope WGS 性能表现

在沿用 GRCh38/GRCh37 线性参考基因组的测试中,GeneMind SURFSeq 5000 搭配专属线性 DNAscope 模型的总变异错误数为 23,670,低于同等条件下的 MGI T7与 Illumina NovaSeq的总变异错误数。这表明即使在不具备泛基因组图基础设施的传统工作流中,CMS 化学技术带来的高均一性数据与平台专用 GBDT 模型的背景降噪能力依然能充分发挥作用,确保不同实验室在原有的线性分析下均能获得质量更优的变异检出结果。

6.png

图6 线性参考 GRCh38 WGS 工作流的累积 SNP 和 Indel 假阳性/假阴性错误计数,对比了经 Sentieon 线性 DNAscope 对应模型处理的真迈 SURFSeq 5000、MGI T7 和 Illumina NovaSeq 测序平台的 30X WGS 数据集。真迈平台在传统线性参考基因组分析中产生了最低的总变异错误计数。

5. 临床靶向全外显子组(WES)性能表现

在临床罕见病诊断关注的 50X-300X 外显子捕获深度范围内,专用的 GeneMind WES DNAscope 模型在全梯度深度下均展现出对主流对比流程的持续优势。在标准 100X 与 150X 临床深度下,其 SNV F1 分数稳定在 0.9898 以上,Indel F1 分数大幅超越传统 GATK 临床分析流程。这表明定制模型能够完美适配外显子捕获导致的非均一深度波动,为高通量临床靶向筛查交付了极高确定性且兼具成本优势的诊断依据。

7.png

图7 临床 WES 测序深度(100X,150X)下真迈 SURFSeq 5000 + Sentieon WES DNAscope 与 Illumina (IDT)、MGI 及 Illumina GATK 对照流程针对 GIAB v4.2.1 外显子真集的 SNV 与 Indel 综合 F1 分数表现。真迈工作流在所有测试捕获深度下均带来持续的 F1 分数优势,其 Indel 检测准确率大幅高于标准 GATK 临床流程。


五、总结

真迈生物SURFSeq 5000与Sentieon的联合方案在保障极致准确率的同时兼具显著的成本效益,并实现了传统线性参考与泛基因组 WGS 双工作流的无缝兼容,为大规模人群队列研究与常规临床遗传诊断构建了一套兼具高保真度、高扩展性与高性价比的软硬件一体化分析架构。


Sentieon软件介绍

Sentieon为完整的纯软件基因变异检测二级分析方案,其分析流程完全忠于BWA、GATK、MuTect2、STAR、Minimap2、Fgbio、picard等金标准的数学模型。在匹配开源流程分析结果的前提下,大幅提升WGS、WES、Panel、UMI、ctDNA、RNA等测序数据的分析效率和检出精度,并匹配目前全部第二代、三代测序平台。

640.jpg

Sentieon软件团队拥有丰富的软件开发及算法优化工程经验,致力于解决生物数据分析中的速度与准确度瓶颈,为来自于分子诊断、药物研发、临床医疗、人群队列、动植物等多个领域的合作伙伴提供高效精准的软件解决方案,共同推动基因技术的发展。

截至2026年4月份,Sentieon已经在全球范围内为1860+用户提供服务,用户处理超过7400+PB数据量,被世界一级影响因子刊物如NEJM、Cell、Nature等广泛引用,引用次数超过1900篇。此外,Sentieon连续数年摘得了Precision FDA、Dream Challenges等多个权威评比的桂冠,在业内获得广泛认可。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。