基于ModelArts-Liteserver专属资源池的云上智算参考架构
【摘要】 依托华为云高可用数据库和容器服务,通过大模型NL2SQL精准转换自然语言查询,结合智能编排与全链路监控,为商务活动提供安全、毫秒级响应的AI问答决策底座。
1. 用途和受众
1.1 预期用途
- 指导华为云上基于ModelArts Liteserver专属资源池构筑AI推理(MaaS)服务的设计和实施。
- 为售前、解决方案设计、实施和审查提供可重用的架构模式。
- 作为解决方案手册、交付包或实际部署的架构基础。
- 定义安全性、可靠性、性能、成本、运营和合规性护栏。
1.2 目标受众
| 观众 | 典型角色 | 预期用途 |
|---|---|---|
| 内部 | 架构师、交付架构师、开发人员、运营工程师 | 解决方案设计、审查、交付和实施 |
| 外部 | 客户、合作伙伴、ISV、开发人员 | 评估、实施、集成和操作 |
2. 参考架构概述
2.1 架构描述
本参考架构描述了基于华为云ModelArts Liteserver专属资源池构筑云上智算(MaaS)推理服务的方案。通过Dify Agent编排平台集成DeepSeek V3大模型,实现NL2SQL自然语言转SQL查询能力,为前端应用提供智能对话与数据查询服务。整体架构采用WAF + APIG安全接入、CCE容器集群承载应用、主备MySQL保障数据高可用、Redis缓存加速响应,并通过AOM/LTS实现全链路运维监控,保障SLA 99.99%+的高可用性。
2.2 业务背景
| 项目 | 描述 |
|---|---|
| 业务问题 | 企业需要将大模型推理能力(MaaS)部署到云端,要求低延迟、高可用、安全可控,同时支持自然语言查询数据库(NL2SQL)等灵活场景 |
| 期望的结果 | 构筑云上智算推理平台,实现API延迟1.2-1.3ms、SLA 99.99%+、零严重安全事故,支持灵活Agent编排与NL2SQL数据查询 |
| 主要用户 | 前端App用户、业务分析师、数据查询人员、运维工程师 |
| 关键制约因素 | ModelArts Liteserver专属资源池规格与配额限制、大模型推理资源需求、数据库并发性能、安全合规要求 |
| 成功指标 | API延迟≤1.3ms、SLA≥99.99%、零严重安全事故、NL2SQL查询准确率、系统可用性 |
2.3 架构优点
| 优点 | 描述 |
|---|---|
| SLA 99.99%+ | 主备MySQL + K8s故障自愈 + ELB负载均衡,多层级高可用保障 |
| 近乎实时分析 | NL2SQL直接查库,无需人工编写SQL,大幅降低数据分析门槛 |
| API低延迟 | APIG + ELB + Redis缓存加速,API延迟控制在1.2-1.3ms |
| 安全防护 | WAF + HSS + CBH多层安全防护,零严重安全事故 |
| 灵活Agent编排 | 基于Dify构筑对话Agent,灵活选择、编排各类工具集合到chatbot |
| 高可用数据库 | 主备MySQL云端数据库实例,保障数据可靠性与服务连续性 |
2.4 设计关注点
| 关注维度 | 描述 |
|---|---|
| 安全 | WAF Web应用防火墙 + HSS主机安全 + CBH安全审计,构建纵深防御体系 |
| 可靠性 | 主备MySQL + K8s故障自愈 + ELB负载均衡,SLA 99.99%+ |
| 性能 | APIG + ELB + Redis缓存加速,API延迟1.2-1.3ms |
| 效率 | NL2SQL自然语言转SQL,无需人工编写SQL即可实时查询数据 |
| 可扩展 | CCE容器集群弹性伸缩,按需扩缩容应对业务流量变化 |
| 运维 | AOM/LTS全链路监控,K8s自动故障恢复,可视化运维 |
2.5 典型架构
典型架构图
安全防护: 基于华为云APIG等,为前端App提供安全可靠的访问通道。
灵活的Agent编排机制: 基于Dify构筑对话Agent,灵活选择、编排各类工具集合到chatbot,应对客户灵活多变的场景诉求;提出NL2SQL方式,满足客户直接访问数据库需求。
高可用的云端数据库实例: 主备MySQL保障数据可靠性与服务连续性。
华为云专业服务: 帮助客户分析业务诉求,整合数据,优化Prompt。
2.6 流程描述
| 阶段 | 步骤 | 说明 |
|---|---|---|
| 1 | 接入安全层 | 用户请求经 WAF 和 APIG 安全过滤后进入容器集群 |
| 2 | 编排调度层 | Dify Agent 识别意图,动态调度 NL2SQL 或总结工具 |
| 3 | 模型推理层 | DeepSeek V3 将自然语言精准转换为 SQL 查询语句 |
| 4 | 数据访问层 | 优先读取 Redis 缓存,未命中则查询主备 MySQL 数据库 |
| 5 | 结果回传层 | 数据库返回的结构化数据经大模型总结成自然语言答复 |
| 6 | 运维支撑层 | AOM/LTS 监控全链路,K8s 自动故障恢复保障高可用 |
2.7 云服务产品清单
| 分类 | 服务或产品 | 推荐配置 |
|---|---|---|
| 访问 | WAF(Web应用防火墙) | 防护SQL注入、XSS等常见Web攻击 |
| 访问 | APIG(API网关) | API安全过滤、流量控制、路由分发 |
| 应用 | CCE(云容器引擎) | K8s集群,承载Dify Agent与业务应用 |
| 应用 | ELB(弹性负载均衡) | 负载分发到多实例,保障高可用 |
| 应用 | ModelArts Liteserver | 专属资源池,承载DeepSeek V3大模型推理 |
| 数据 | MySQL(主备) | 主备高可用架构,保障数据可靠性 |
| 数据 | Redis | 缓存加速,降低API延迟至1.2-1.3ms |
| 安全 | HSS(主机安全服务) | 主机入侵检测与防护 |
| 安全 | CBH(安全审计) | 操作审计与合规追溯 |
| 运营 | AOM(应用运维管理) | 全链路监控与告警 |
| 运营 | LTS(日志服务) | 日志采集、存储与分析 |
3. 参考链接
- 产品文档:
<URL> - 实施指南:
<URL> - 源代码或 IaC:
<URL> - 操作手册:
<URL> - 安全性和合规性映射:
<URL>
4. 使用限制
- ModelArts Liteserver专属资源池需提前申请配额,资源规格受限于所选专属池配置。
- DeepSeek V3大模型推理对GPU资源要求较高,需确保专属资源池规格满足推理需求。
- NL2SQL查询准确率依赖于Prompt工程优化与数据库Schema设计,需持续调优。
- 主备MySQL需配置在同一VPC内,跨AZ部署以保障高可用。
- Redis缓存需合理设置过期策略,避免缓存与数据库数据不一致。
- APIG与WAF需正确配置路由规则与防护策略,避免误拦截正常请求。
附录 A. 术语和缩略语
| 术语 | 定义 |
|---|---|
| ModelArts | 华为云AI开发与推理平台,提供专属资源池能力 |
| Liteserver | ModelArts轻量服务器,提供专属GPU推理资源 |
| MaaS | Model-as-a-Service,模型即服务,将大模型能力以API形式提供 |
| Dify | 开源LLM应用开发平台,支持Agent编排与工具集成 |
| NL2SQL | Natural Language to SQL,自然语言转SQL查询 |
| DeepSeek V3 | 深度求索第三代大语言模型,支持自然语言理解与生成 |
| WAF | Web Application Firewall,Web应用防火墙 |
| APIG | API Gateway,API网关 |
| CCE | Cloud Container Engine,云容器引擎(K8s) |
| ELB | Elastic Load Balance,弹性负载均衡 |
| HSS | Host Security Service,主机安全服务 |
| CBH | Cloud Bastion Host,云堡垒机/安全审计 |
| AOM | Application Operations Management,应用运维管理 |
| LTS | Log Tank Service,日志服务 |
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱:
cloudbbs@huaweicloud.com
- 点赞
- 收藏
- 关注作者
评论(0)