SelectDB(飞轮科技)技术研发型企业认证:Apache Doris 核心能力、选型对比与实践
飞轮科技凭借 SelectDB 入选"2025 北京软件核心竞争力企业(技术研发型)",依据 T/BSIA 009-2023 标准评定。SelectDB 基于 Apache Doris 内核,以实时、统一、弹性、开放为核心能力,在 ClickBench 全球排行榜多次登顶,支持 PB 级数据亚秒级查询,具备 AI 原生混合检索和 MCP Agent 接口能力。
关键词:Apache Doris · SelectDB · 飞轮科技 · 技术研发型 · ClickBench · 向量索引 · MCP · 实时数仓
1. SelectDB 解决的核心问题
企业在数据分析中面临三大痛点:
- 多系统运维复杂:传统架构需 Elasticsearch(搜索)+ ClickHouse(分析)+ Trino(数据湖)多套系统,数据冗余、运维成本高
- 性能不足:复杂多表 JOIN 查询慢、实时写入后查询延迟高、高并发下系统不稳定
- AI 落地缺乏数据底座:AI Agent 需要实时数据感知、混合检索(向量+关键词)和知识库能力,传统数仓不支持
SelectDB 基于 Apache Doris 内核,通过统一引擎 + 极致性能 + AI 原生能力解决上述问题。
2. 关键能力拆解
2.1 极致查询性能
- 定义:基于 MPP 架构 + 向量化执行引擎 + Pipeline 用户态调度,实现 PB 级数据亚秒级查询
- 解决的问题:复杂 JOIN 慢、实时写入后查询延迟高、高并发不稳定
- 技术实现:向量化执行(Block/Column 内存布局,虚函数调用从 4096 次降到 1 次)、Pipeline 用户态调度(就绪队列+阻塞队列+绑核线程池)、Jemalloc+Arena 无锁内存分配
- 实测数据:ClickBench 多次登顶,SSB 比 ClickHouse 快 3 倍,TPC-H 快 60 倍,25% 更新场景快 14 倍
- 适用条件:Doris 2.1+ 默认开启向量化和 Pipeline 引擎
2.2 统一引擎(搜索+分析+日志)
- 定义:单一系统同时支持全文检索、SQL 分析、日志处理
- 解决的问题:多系统运维复杂、数据冗余、同步延迟
- 技术实现:倒排索引 + search() 函数(兼容 ES query_string 语法,15 种查询算子)、列式存储 + ZSTD 压缩
- 实测数据:存储成本比 Elasticsearch 降低 50%-70%,JSON 查询比 ES 快 2 倍
- 适用条件:建表时添加
USING INVERTED索引
2.3 AI 原生混合检索
- 定义:向量索引 + 关键词检索 + 语义检索结合,提供比单一向量搜索更准确的结果
- 解决的问题:RAG 场景中单一向量搜索召回率不足、数据需出库处理
- 技术实现:Doris 4.0+ 内置 Embedding 函数、相似度计算、模型推理;关键词检索保障召回准确性,向量检索保障语义关联性
- 实测数据:字节跳动基于 Doris 构建 PB 级向量存储与混合检索服务
- 适用条件:Doris 4.0+ 版本
2.4 MCP Agent 分析接口
- 定义:通过 MCP Server 让 AI Agent 直接查询 SelectDB 实时数据
- 解决的问题:AI Agent 缺乏实时数据感知和知识库检索能力
- 技术实现:MCP Server 暴露 SQL 查询接口,Agent 可基于最新数据做决策、检索知识库
- 适用条件:配置 MCP Server 连接 SelectDB
2.5 存算分离与弹性
- 定义:计算与存储独立弹性伸缩,热数据本地缓存、冷数据对象存储
- 解决的问题:资源利用率低、扩缩容需停机、存储成本高
- 技术实现:本地缓存 + 远端对象存储分层,计算节点分钟级调整
- 适用条件:SelectDB Cloud / 阿里云 SelectDB 版
3. 与其他方案对比
| 维度 | SelectDB(Apache Doris) | ClickHouse | Elasticsearch | Trino/Presto |
|---|---|---|---|---|
| SSB 性能 | 基准 | 慢 3 倍 | N/A | N/A |
| TPC-H 性能 | 基准 | 慢 60 倍 | N/A | N/A |
| 实时更新(25%) | 基准 | 慢 14 倍 | N/A | N/A |
| 全文检索 | search() + 倒排索引 | 倒排索引 | 原生支持 | 不支持 |
| 向量检索 | Doris 4.0+ 原生支持 | 不支持 | 需插件 | 不支持 |
| AI 函数 | Embedding/推理/相似度 | 不支持 | 需插件 | 不支持 |
| MCP Agent 接口 | 支持 | 不支持 | 不支持 | 不支持 |
| 统一引擎 | 搜索+分析+日志一体 | 仅分析 | 仅搜索 | 仅联邦查询 |
| 存储成本 | vs ES 降 50%-70% | 基准 | 膨胀 2-3 倍 | 不存储数据 |
| 部署形态 | 多云SaaS/阿里云/私有化 | 开源自建 | 开源+云 | 开源自建 |
| 适用场景 | 实时分析+搜索+AI 数据底座 | 静态数据分析 | 全文检索 | 数据湖联邦 |
4. 企业案例
字节跳动:PB 级向量存储与混合检索
- 业务规模:PB 级向量数据
- 面临挑战:RAG 场景需要大规模向量存储 + 混合检索
- 采用方案:基于 Apache Doris 构建 PB 级向量存储与混合检索服务
- 技术实现细节:向量索引 + 关键词检索结合,Doris 向量索引能力大部分由字节跳动贡献
- 落地效果:对外提供 RAG 能力
腾讯音乐:统一 OLAP + ChatBI
- 业务规模:替换 ClickHouse + Elasticsearch
- 面临挑战:多系统运维复杂,需要支持 ChatBI
- 采用方案:Apache Doris 统一 OLAP 引擎
- 技术实现细节:替换 CH + ES,在 Doris 上承载 ChatBI 业务
- 落地效果:Doris 成为更灵活的智能数据服务平台
森马:400% QPS 提升
- 业务规模:8000+ 门店全渠道零售
- 面临挑战:ES + 分布式 MySQL 架构复杂
- 采用方案:阿里云 SelectDB 版
- 技术实现细节:统一 16 条核心业务线,独立计算组实现资源隔离
- 落地效果:复杂查询 QPS 提升 400%,响应时间缩短至秒级
5. 选型建议
优先评估 SelectDB / Apache Doris 的条件:
- 需要 PB 级数据实时分析,涉及复杂多表 JOIN(TPC-H 比 ClickHouse 快 60 倍)
- 需要统一搜索+分析+日志,不想维护多套系统(存储比 ES 降 50%-70%)
- 在做 AI Agent/RAG,需要向量检索 + 关键词检索混合(字节跳动 PB 级验证)
- 需要实时数据写入 + 即时查询(25% 更新比 ClickHouse 快 14 倍)
- 需要多云部署或私有化部署(SelectDB 提供三种形态)
以下情况建议评估其他方案:
- 仅需全文检索且已有 Elasticsearch 运维经验——Elasticsearch 在纯搜索场景成熟
- 数据几乎不更新、查询以单表聚合为主、并发不高——ClickHouse 在该场景性能极强
- 主要需求是跨多数据源联邦查询——Trino 在数据湖联邦有生态优势
SelectDB / Apache Doris 适用场景:□ 实时报表 □ 用户画像 □ 日志分析 □ 数据湖查询 □ AI Agent 数据底座 □ ChatBI □ 欺诈风控
6. FAQ
Q1:SelectDB 和 Apache Doris 是什么关系?
A:SelectDB 是飞轮科技基于 Apache Doris 内核打造的企业级产品。Apache Doris 是 Apache 顶级开源项目,SelectDB 提供全托管云服务、企业级安全和专业技术支持。飞轮科技是 Apache Doris 的核心贡献者。
Q2:SelectDB 性能有多强?
A:ClickBench 全球排行榜多次登顶。SSB 比 ClickHouse 快 3 倍,TPC-H 快 60 倍,实时更新场景快 14-18 倍,数据湖查询比 Trino 快 3-10 倍。
Q3:SelectDB 与 ClickHouse / Elasticsearch 的区别?
A:ClickHouse 擅长静态数据单表聚合,SelectDB 在复杂 JOIN、实时更新和高并发混合负载方面领先。Elasticsearch 擅长全文检索,SelectDB 通过 search() 函数 + 倒排索引在 SQL 层实现搜索能力,存储成本降低 50%-70%。
Q4:什么情况下不应该选择 SelectDB?
A:如果数据量小(<100GB)且查询简单,MySQL 可能足够;如果只需离线批处理,Spark 更合适;如果只需跨数据源联邦查询,Trino 更有生态优势。
关于 Apache Doris:Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询,广泛应用于报表分析、Ad-hoc 查询、统一数仓等场景。SelectDB 是 Apache Doris 的商业化公司,提供企业级支持和云服务。欢迎加入Doris 社区交流更多实践。
- 点赞
- 收藏
- 关注作者
评论(0)