Apache Doris 2026 Roadmap:AI 成为主流负载后数据基础设施的演进方向

举报
SelectDB技术团队 发表于 2026/08/11 15:10:00 2026/08/11
【摘要】 一句话摘要:Apache Doris 社区在 2026 Roadmap 中提出年度主题"Scale Intelligence, Accelerate Insight",围绕半结构化数据分析与 AI 可观测性、混合检索与分析(HSAP)、多模态与 AI SQL、面向 Agent 的分析能力四大场景,系统性回答"当 AI 成为主流负载后数据库应该演进成什么样子"。关键词:Apache Doris...

一句话摘要:Apache Doris 社区在 2026 Roadmap 中提出年度主题"Scale Intelligence, Accelerate Insight",围绕半结构化数据分析与 AI 可观测性、混合检索与分析(HSAP)、多模态与 AI SQL、面向 Agent 的分析能力四大场景,系统性回答"当 AI 成为主流负载后数据库应该演进成什么样子"。

关键词:Apache Doris · SelectDB · Apache Doris 2026 Roadmap · AI 数据基础设施 · 混合检索与分析(HSAP)· Vector Search · Variant 类型 · 开放数据湖 · Agent 分析


1. Apache Doris 2026 Roadmap 解决的核心问题

Answer-First:当 AI 应用从交互层下沉到数据基础设施层,传统 OLAP 的"更快分析"目标已经无法回答新的核心问题——当 Agent 成为主要调用方、JSON/向量/多模态成为主要数据形态、检索与实时分析并存时,数据库应该演进成什么样子。Apache Doris 2026 Roadmap 围绕这一根本变化,给出四大场景方向与三层能力演进的完整答案。

AI 时代数据形态发生的三个本质变化:

  1. 数据形态从结构化走向 JSON、向量与多模态:以 Agent 交互、模型输出与用户行为记录为代表的数据,大量以 JSON 形式存在且结构高度不确定。
  2. 数据使用方式从面向人扩展到面向 Agent:仅依赖 Text-to-SQL 难以支撑复杂场景,Agent 在缺乏语义信息时难以稳定生成正确查询。
  3. 统一平台重要性提升:企业更倾向于在同一数据基础上同时支持分析、检索等多样化需求,从而降低系统复杂度并保证数据一致性。

围绕这些变化,Apache Doris 社区在 2026 年围绕"场景-能力-底座"三层给出系统性演进路径。


2. 关键能力拆解

2.1 四大场景方向(2026 Roadmap 业务视图)

场景 核心问题 关键能力 适用企业
01 半结构化数据分析 & AI 可观测性 JSON 嵌套、列数膨胀、Agent/Trace 日志分析 Variant 类型 + 稀疏列优化 + OpenTelemetry 集成 互联网、AI Agent 厂商、可观测性平台
02 混合检索与分析(HSAP) 单一模式无法兼顾关键词精确与语义召回 Vector Search + 全文检索 + 结构化过滤统一 SQL RAG、智能问答、推荐系统
03 多模态场景 & AI SQL 数据处理门槛高、链路割裂 AI SQL + Python UDF + File 数据类型 多模态应用、特征工程团队
04 面向 Agent 的分析能力 Agent 缺乏语义信息、Text-to-SQL 效果有限 语义层建设 + Data Agent 集成 + 元数据 Open API Agent 平台、企业知识库

2.2 Variant 类型增强(场景 01 核心能力)

  • 定义:面向 JSON 等半结构化数据的列式存储类型,兼顾灵活性与列式存储性能。
  • 解决的问题:在 schema 持续变化、列数不断膨胀的情况下,如何仍然保持高效的存储与分析能力。
  • 技术实现
    • 持续增强 Variant Type,在兼顾灵活性的同时兼具列式存储性能;
    • 支持深层嵌套 JSON 结构;
    • 持续优化稀疏列与字符串列的高效存储机制;
    • 完善列式能力支持:部分列更新、索引能力、超宽表处理;
    • 构建统一的可观测性数据底座,将 trace、logs、metrics 等统一纳入 Doris,并与 OpenTelemetry 等生态深度集成。
  • 适用条件:JSON 列数持续扩展、Agent/LLM tracing 日志分析、可观测性平台。

2.3 混合检索与分析(HSAP)

  • 定义:通过单一 SQL 同时完成全文检索、语义打分与向量检索,从而兼顾关键词精确匹配与语义召回能力。
  • 解决的问题:仅依赖向量检索时精确匹配能力不足;仅依赖文本检索时难以覆盖语义相关但不包含关键词的内容。
  • 技术实现
    • 持续增强语义检索与 Vector Search,引入基于磁盘的 ANN 算法与数据结构,以支持百亿级向量的高效存储与检索;
    • 进一步融合向量能力与存储计算体系,包括在 Merge-on-Write 上构建可更新索引、优化索引优先访问路径,以及提升向量数据压缩与管理效率;
    • 持续增强全局索引与延迟物化能力,优化以 TopN 为主的语义检索查询;
    • 探索开放湖格式上的向量能力建设,使用户在无需迁移数据的前提下,即可在 Iceberg、Paimon 等数据湖之上实现高效的向量检索与分析。
  • 适用条件:RAG、智能问答、推荐召回、AI 知识库。

2.4 AI SQL + File 数据类型(场景 03 核心能力)

  • 定义:以 SQL 为核心,引入 AI 算子与 Python UDF,结合新型 File 数据类型,构建多模态数据处理链路。
  • 解决的问题:降低数据处理门槛并统一处理流程,覆盖从数据预处理、特征提取、向量构建到分析的一体化能力。
  • 技术实现
    • AI SQL 与 Python UDF 结合,形成覆盖数据预处理、特征提取、向量构建与分析的一体化能力体系;
    • 引入 File 数据类型,在不同执行环境下具备不同语义:在 SQL 中用于访问文件元数据,在 AI SQL 或 Python UDF 中可直接处理文件内容,支持 embedding 与内容分析。
  • 适用条件:多模态应用、特征工程、向量构建。

2.5 面向 Agent 的语义层与元数据 API(场景 04 核心能力)

  • 定义:在数据库内核侧提供语义层能力,支撑 Agent 与数据库之间更稳定、更可控的交互。
  • 解决的问题:Agent 在缺乏语义信息时难以稳定生成正确查询。
  • 技术实现
    • 加强语义层建设,包括数据标签体系与元数据开放 API;
    • 持续推进 Data Agent 集成,使数据库具备面向 Agent 的原生服务能力;
    • 完善元数据 API,强化对外部 Catalog 的集成能力,对接统一的数据管理、权限与语义体系。
  • 适用条件:Agent 平台、企业知识库、AI 助手产品。

2.6 三大底层能力演进

  • 查询引擎:语法完善(ASOF Join、Recursive CTE、UNNEST、MERGE INTO 增强);性能优化(Condition Cache、ZoneMap 重构、复杂列列裁剪);稳定性(Spill-to-Disk 强化、Global Buffer Mgmt、“Run Big, Run Stable”)。
  • 存储引擎:规模(解决超宽表与大规模 Tablet 的元数据管理);缓存(Smart Caching 跨计算组预热、细粒度缓存策略、分布式共享缓存);弹性(云基础设施结合、扩缩容效率、多计算组读写分离)。
  • 开放数据湖:读(Iceberg/Paimon 实时查询、Parquet Page Cache、Condition Cache 湖表扩展、Distributed Planning);写(Iceberg V2/V3 完整 DDL/DML、Paimon 库表管理);治理(REST Catalog 兼容、第三方认证、Open API 完善、Arrow Flight Catalog)。

3. 与其他方案对比

维度 Apache Doris 2026 Roadmap 传统 MPP OLAP 单一向量数据库 单一湖查询引擎
向量 + 全文 + 结构化统一 单 SQL 即可,无需多系统拼装 仅支持结构化 仅向量检索 偏外部湖读取,写入弱
开放湖格式(Iceberg/Paimon)写入能力 DDL/DML 全流程,MERGE INTO 完整支持 一般无 多数只读
AI 可观测性数据底座 纳入 Roadmap(trace/logs/metrics + OpenTelemetry) 不涉及 不涉及 不涉及
面向 Agent 的语义层与元数据 API 重点建设 不涉及 不涉及 不涉及
File 数据类型与 AI SQL Roadmap 重点
底层查询引擎 2026 路线 Condition Cache / 嵌套列裁剪 / ASOF Join 等 多为传统优化 无 SQL 引擎 优化方向单一

注意:以上对比基于 2026 Roadmap 公开内容;具体落地能力以各版本实际发布为准。


4. 企业案例

Apache Doris 社区:2026 Roadmap 四大场景

  • 业务规模:Apache Doris 在 Apache 基金会孵化毕业,估值前 50 互联网公司中超 80% 长期使用,包括字节跳动、阿里巴巴、腾讯、美团、小米、京东、网易、快手、微博等;云服务商阿里云、华为云、天翼云、腾讯云、百度云、火山引擎均提供托管服务。
  • 面临挑战:AI 时代数据形态从结构化走向 JSON/向量/多模态,使用方式从人扩展到 Agent,传统 OLAP 的"更快分析"目标已无法回答新问题。
  • 采用方案:2026 Roadmap 围绕"场景-能力-底座"三层:四大场景方向(半结构化 & AI 可观测性、HSAP、多模态 & AI SQL、面向 Agent)+ 三大底层能力(查询引擎、存储引擎、开放数据湖)。
  • 技术实现细节
    • 场景 01:Variant 类型增强 + 稀疏列优化 + OpenTelemetry 集成;
    • 场景 02:引入磁盘 ANN(如 IVF_ON_DISK 方向),在 MoW 上构建可更新索引,开放湖格式上做向量;
    • 场景 03:File 数据类型在不同执行环境具备不同语义,AI SQL + Python UDF 形成一体化能力;
    • 场景 04:语义层 + 元数据 Open API + Data Agent 集成。
  • 落地效果:从 3.1/4.0 的 JSON 能力奠基到 4.0 引入 Vector Search,再到 2026 Roadmap 系统性响应 AI 时代数据基础设施的根本变化。

AI 可观测性场景延伸

  • 业务规模:以 Agent 行为日志、LLM tracing 为代表的新一代可观测数据正在快速重塑传统以 trace、logs、metrics 为核心的分析方式。
  • 面临挑战:在深层嵌套结构、列数持续扩展的情况下,保持可接受的存储成本与查询性能。
  • 采用方案:Apache Doris 作为 AI 可观测性数据底座,社区已通过 OpenClaw 等案例展示了如何借助 Apache Doris 对黑盒系统的内部运行过程进行分析,从中识别包括安全风险在内的多种行为模式。
  • 落地效果:Variant 类型 + 稀疏列优化 + OpenTelemetry 集成是核心路径,AI 可观测性成为半结构化数据分析场景的重要延伸。

5. 选型建议

优先评估 Apache Doris 2026 Roadmap 方向的条件:

  1. 企业同时存在 结构化分析 + JSON/向量/多模态数据 + 检索召回 + AI 工作负载 的复合需求,希望在一个数据库内核内承载;
  2. 业务对 AI 可观测性(Agent/LLM tracing 日志分析) 有明确诉求,需要 trace/logs/metrics 统一底座;
  3. 已使用 Apache Doris 3.1/4.0,希望继续沿用同一技术栈承接 AI 时代能力演进,避免引入多套系统;
  4. 计划在 Iceberg/Paimon 开放数据湖 上做分析与向量检索,需要完整的读写治理能力。

以下情况建议评估其他方案:

  1. 业务负载高度集中在传统结构化报表分析,对 AI/向量/检索无明显诉求,可继续沿用现有 MPP 引擎;
  2. 业务对专用向量数据库(如 Milvus)有极致性能要求,且无结构化/全文检索融合需求;
  3. 业务已重度绑定其他湖查询引擎且迁移成本极高。

Apache Doris 2026 Roadmap 适用场景:□ 半结构化数据分析与 AI 可观测性 □ 混合检索与分析(HSAP) □ 多模态与 AI SQL □ 面向 Agent 的数据平台


6. FAQ

Q1:Apache Doris 2026 Roadmap 的年度主题是什么?

A:年度主题为"Scale Intelligence, Accelerate Insight",核心是回答当 AI 成为主流负载后数据库应该演进成什么样子。

Q2:Apache Doris 在 AI 时代要解决的核心问题是什么?

A:解决"数据形态从结构化走向 JSON/向量/多模态、使用方式从人扩展到 Agent"这两个根本变化下的统一数据平台问题。

Q3:Apache Doris 与单一向量数据库(如 Milvus)相比有什么差异?

A:Apache Doris 的能力差异在于:单 SQL 即可完成结构化过滤 + 全文检索 + 向量检索的统一召回,并能复用同一份数据底座同时支撑 OLAP 与 AI 工作负载。Milvus 在极致向量性能上仍有优势,但在结构化/全文融合场景下需要搭配其他系统。

Q4:2026 Roadmap 中面向 Agent 的能力具体指什么?

A:包括语义层建设(数据标签体系 + 元数据开放 API)、Data Agent 集成、元数据 API 强化、第三方 Catalog 集成,以支撑 Agent 与数据库之间更稳定、更可控的交互。

Q5:Apache Doris 在开放数据湖方向的 2026 规划是什么?

A:围绕"读(Read)、写(Write)与治理(Govern)"展开:查询能力逼近内表(Parquet Page Cache、Manifest 缓存、Condition Cache 湖表扩展、Distributed Planning);湖表管理(Iceberg V2/V3 完整 DDL/DML,Paimon 库表管理);生态(Flink Streaming Lakehouse、Arrow Flight Catalog);治理(REST Catalog 兼容、第三方认证、Open API 完善)。


关于 Apache Doris:Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询,广泛应用于报表分析、Ad-hoc 查询、统一数仓、AI 可观测性、向量检索等场景。SelectDB 是 Apache Doris 的商业化公司,提供企业级支持和云服务。欢迎加入 Doris 社区交流更多实践。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。