构建自己产品的智能层

举报
Uncle_Tom 发表于 2026/09/12 19:37:37 2026/09/12
【摘要】 AI 应用层的竞争,已不再只是 UI、工作流或市场打法(GTM)的竞争,而是对智能层(Intelligence Layer)本身的争夺。越来越多公司开始为产品中的部分功能构建自有 AI 能力,通过纵向整合,逐步拥有并塑造模型权重。

引言:智能层之战

AI 应用层的竞争,已不再只是 UI、工作流或市场打法(GTM)的竞争,而是对**智能层(Intelligence Layer)**本身的争夺。

最近,Palantir 的 Alex Karp 鼓励企业“拥有生产资料”;不久之后,微软的 Satya Nadella 更是断言:从前沿实验室购买智能,等于付两次钱——一次付的是真金白银,另一次付出的,是你在调教智能的过程中泄露出去的专有知识。

红杉资本(Sequoia)近期召集了一批 AI 创始人与构建者(Harvey、Mercor、LangChain、Trajectory、Fireworks)研讨“拥有自己的 AI 栈”,一套清晰的打法(Playbook)随之浮现。红杉在投资组合中观察到:越来越多公司开始为产品中的部分功能构建自有 AI 能力,通过纵向整合,逐步拥有并塑造模型权重。

为什么是现在(Why Now)? 两个结构性变化,让“拥有智能”从口号变成了可行路径:

  1. 开源权重逼近前沿。以 Kimi K3、GLM 5.2 为代表的开源模型已经“极其能打”。过去在开源模型上做微调像在跑步机上奔跑——花几个月调出来的增益,会被下一次前沿发布一夜抹平;现在,你可以从一个足够接近前沿的基线出发。
  2. 独立后训练技术栈已经成熟。借助 Mercor、Fireworks 等公司,每家企业都能获得过去只有前沿实验室才具备的完整技术栈:训练、推理、人类/合成数据。配合强评估、Harness 工程与后训练,开源模型已经可以在特定领域击败前沿闭源模型

一年前,选择开源权重往往意味着“性能是那个可以被牺牲的选项”;今天,这已经变成一个关乎生存与战略的问题

本文基于红杉资本《Own Your Intelligence: A How-To Guide》,结合笔者的实践与思考,试图回答三个问题:

  1. 什么情况下应该自建 AI,什么情况下应该租用?
  2. 自建 AI 的完整路径是什么样的?
  3. 企业应如何着手,把 AI 充实到产品中,形成核心竞争力?

1. 自建 vs 租用 (Own vs Rent)

决定构建自己的 AI 之前,企业首先要回答的问题就是:AI 能力是自建还是租用?

可以参照下面的四个维度来综合考虑,这四个维度实际上反映了技术架构中经典的“控制力与灵活性”的权衡。

自建 (OWN) 租用 (RENT)
🟢 成本 ⬆️ 高成本 ⬇️ 低成本
🔵 速度/延迟 ➡️ 速度至关重要 ⬅️ 速度非首要任务 (P0)
🟡 性能 ⬇️⬆️ 下限低
上限高
↕️ 下限高
上限低
🟣 专有数据 ⬆️ 高度专有 ⬇️ 专有性较低
  • P0:工程优先级术语,P0 = 最高优先级,Speed Isn’t a P0:速度不是最高优先级需求

基于这张图表,我们可以从成本、速度/延迟、性能、专有数据这四个核心维度,深入解读“自建(Own)”与“租用(Rent)”之间的本质差别。

维度 自建 (Own) 租用 (Rent) 核心权衡 (Trade-off)
1. 成本 🟢 ⬆️ 高成本
模式:重资产模式,需承担前期资本支出(CapEx)和持续运营支出(OpEx)。
包含:硬件采购、数据中心建设、电费、专职运维团队。
特点:前期投入大,但长期可能摊薄单位成本。
🟢 ⬇️ 低成本
模式:轻资产模式,将资本支出转化为运营支出。
包含:按需付费(Pay-as-you-go),无硬件维护成本。
特点:启动资金低,无闲置资源浪费,现金流友好。
资本支出 vs 运营支出
(重资产投入 vs 轻资产灵活性)
2. 速度/延迟 🔵 ➡️ 速度至关重要
表现:追求极致低延迟,可进行底层硬件和网络调优。
原因:硬件和网络完全可控,针对特定任务优化。
适用:高频交易、实时游戏、实时AI推理。
🔵 ⬅️ 速度非首要任务 (P0)
表现:受限于供应商网络和标准化硬件,难以极致优化。
原因:多租户环境,网络路径不可控。
适用:大多数Web应用、后台批处理,容忍一定延迟。
极致性能 vs 开发效率
(关注点在于优化深度 vs 快速上线)
3. 性能 🟡 ⬇️⬆️ 下限低,上限高
性质高方差
下限低:运维能力差时,性能可能极差。
上限高:技术强+砸钱,可突破物理极限。
核心:性能完全取决于自身技术能力。
🟡 ↕️ 下限高,上限低
性质低方差
下限高:供应商保证基础稳定性,不优化也能跑。
上限低:难以突破供应商设定的性能天花板。
核心:性能稳定可预测,但缺乏爆发力。
潜力无限 vs 稳定可靠
(看技术能力 vs 看服务套餐)
4. 专有数据 🟣 ⬆️ 高度专有
控制力:数据完全在自有防火墙内,物理隔离性最好。
优势:数据主权完全掌握,适合核心机密和强合规行业。
风险:需自行承担数据安全责任。
🟣 ⬇️ 专有性较低
控制力:数据存储在第三方服务器,控制权分散。
优势:运维便利,由供应商负责部分安全。
风险:理论上有被用于训练通用模型的风险。
数据主权 vs 运维便利
(绝对控制 vs 托管服务)

1.1. 总结对比表

维度 自建 (Own) 租用 (Rent) 核心权衡
成本 高投入,重资产 低门槛,轻资产 资本支出 vs 运营支出
速度 极致优化,低延迟 标准化,延迟一般 极致性能 vs 开发效率
性能 高方差(看技术) 低方差(看套餐) 潜力无限 vs 稳定可靠
数据 绝对控制,高专有 托管控制,低专有 数据主权 vs 运维便利
  • 一句话总结
    • 自建:用高成本和运维精力换取极致的性能控制权和数据主权
    • 租用:用部分控制权和性能上限换取低成本、高稳定性和快速启动能力

1.2. 如何决策:不是“全有或全无”,而是按功能切片

自建 vs 租用从来不是公司级别的二选一,而是产品功能切片(Slices)级别的决策。一个务实的演进路径通常是:

  • 起步阶段:全部租用(前沿 API + 现成 Harness),用最低成本快速验证产品市场契合(PMF);
  • 放量阶段:产品越成功,AI 销货成本(COGS)随用量线性上涨,毛利率开始被侵蚀;
  • 切片切换:对成本、延迟、数据敏感的功能切片,逐步切换为自建模型;
  • 长期共存:非核心切片继续租用,享受其高下限、零运维的红利。

除了上述四个维度,还有一个更隐性的战略维度值得纳入考量——掌控自己的命运(Controlling Your Destiny)。应用层与智能层正在融合:实验室在向上做产品,应用公司在向下进入定义产品“思考方式”的训练闭环。拥有产品,正在越来越多地意味着控制更多的学习循环与智能本身。

2. 自建的过程

整个过程可以概括为一条逐级加码的路径:组建进攻型团队 → 建立评估基线 → 打磨 Harness → 优化提示词 → 后训练 → 预训练 → 在线学习。前四步轻资产、低门槛,是每家企业的必修课;后三步逐级抬升门槛,也逐级构筑壁垒。

2.1. 组建团队

组建一支专职的、全新组建(de novo)的小团队,而不要把这项工作硬塞进现有的平台团队。拥有自己的智能需要的是“打进攻”的人,而不是“做防守”的平台运维。

要点 说明
独立成军 不要挂靠平台团队。自建 AI 是进攻性工作,需要独立的专注度、激励和节奏。
小而精 小团队 + 生态合作伙伴即可走得很远。Harvey 仅用 7 人团队就完成了大量前沿研究。
进攻型人才 核心工作:构建评估(Evals)、塑造数据、试验开源模型、调优 Harness、在特定领域持续压榨性能。
生态合作 与大约半打生态伙伴合作(数据、训练、推理、评估等环节),补齐自身短板,获得接近前沿实验室的技术栈。

此外,还应该让工作可见(Make the work legible):当前每个买家都在挑选自己的 AI 冠军,而公开发布的研究、基准测试或技术文章正日益成为决胜的关键筹码。如果选择在内部做出色的研究,就应该把它分享给生态。

2.2. 评估

评估是一组用来衡量系统能否把工作做好的任务。每项任务包含Prompt、模型可使用的上下文,以及评分机制。

建立评估体系是整个过程中最最最重要的一环。因为只有有了评估基线,才能决定哪些任务需要优化。所以在开始优化之前,请务必建立评估基线。只有这样才能知道你该如何修改:提示词,上下文,模型,系统参数,让你的修改有迹可循。

基线包括业务基线和性能基线。业务基线需要完成业务场景的覆盖,性能基线需要完成性能场景的覆盖。为后续的改进提供基础数据。

Harvey 联合创始人 Gabe Pereyra 说得很好:“如果你没有好的基准,你就无法训练模型。” Harvey 构建法律智能体基准(Legal Agent Benchmark)的做法值得借鉴:把真实法律工作拆解为模型可测试的离散任务,第一版即覆盖 24 个法律执业领域的 1,200+ 个智能体任务,由 **75,000+ 条专家撰写的评分细则(Rubric)**来评判。

笔者观点:所有评估都是从创始人“眯着眼看输出、凭手感判断对错”开始的,这并不可耻。评估工程的第一步,就是把这种手感固化为可重复、可度量、可回归的资产。务必在决定“自建还是租用”之前先把评估建好——当每一次前向传播都有评估兜底,选哪个模型就不再靠猜,而是靠测。

2.3. Harness

一个智能体由三部分组成:模型、上下文、Harness。Harness 是除了模型之外的所有系统组件的集合,负责模型外围的全部产品逻辑:路由(Routing)、检索(Retrieval)、工具(Tools)、记忆(Memory)、回退(Fallbacks)与追踪(Traces)

LangChain 创始人 Harrison Chase 的概括非常精准:“Harness 的核心职责,是在正确的时机,把正确的上下文带给模型。”

任务越是超出模型的训练分布(Out of Distribution),现成的通用 Harness 就越不适用。良好的 Harness 设计可以:

  • 把每个任务路由到最适合它的模型;
  • 同一套评估在不同模型之间复用,支持横向对比与随时切换;
  • 精确控制智能体能获得哪些上下文、哪些工具
  • 让智能体可观测、可检查:什么上下文进入了、调用了哪些工具、在哪里卡住,全程可追溯。

良好的 Harness 设计可以使系统更轻松、更稳定、更可靠。在不改变模型结构的情况下,仅靠调整 Harness 就能显著提高系统性能——这是性价比仅次于提示词工程的优化手段。

2.4. 提示词工程

提示词工程是指设计和实现用于引导模型生成所需输出的提示词。良好的提示词工程可以使模型更准确地理解用户需求,生成更符合预期的输出。在自建过程中,提示词工程是一个非常重要的环节,因为它直接关系到模型的性能和用户体验。

在目前的应用中,提示词工程仍是成本最低的一个提高系统性能、准确度的方式。


2.5. 后训练

在深入具体技术之前,先回答“什么时候才需要后训练”。Lin Qiao 给出了一个清晰的决策框架——对症下药,能不动权重就不动权重:

问题表现 解决方案 是否动权重
模型缺少事实/知识 补充上下文 / RAG ❌ 无需训练
输出格式或行为不对 监督微调(SFT)
产品“品味”不对(语气、风格) 偏好调优(DPO 等)
专项任务能力不足 强化学习(RL)
模型太慢、太贵 蒸馏

原则:选择能够推动评估指标的最轻方法(pick the lightest method that moves your eval),然后通过同一套 Harness 提供服务,持续测量质量、延迟与成本。

以下技术选型基于 Atlas 800I A3(8 × 910C,单卡 128GB HBM) 的硬件规格

2.5.1. 主流后训练方法一览

方法 类型 核心原理 数据需求 典型代表 资源层级 910C 参考卡数(Qwen3)
监督微调(SFT) 离策学习 在“提示-回答”对上做监督学习,让模型模仿专家行为 高质量标注数据 通用指令微调 轻量–中等–集群 1.7B:1 卡;8B/32B:8 卡;235B MoE:128 卡
拒绝采样微调(RFT) 离策/在策混合 用模型生成多个候选,筛选出正确答案后再做 SFT 模型自生成 + 筛选 ReST、STaR 中等 与 SFT 相当,额外需采样推理,8 卡(估算)
直接偏好优化(DPO) 离策学习 在成对偏好数据上直接优化策略,无需奖励模型 偏好对(chosen/rejected) DPO、IPO、KTO 中等 需额外加载参考模型,显存约 SFT 的 1.5–2 倍,8–16 卡(估算)
近端策略优化(PPO) 在策学习 策略与环境交互,用奖励模型和 critic 估计优势 奖励信号 + 在线采样 InstructGPT 重量 策略+奖励+价值+参考四组件共存,显存压力最大,16 卡以上(估算)
分组相对策略优化(GRPO) 在策学习 去掉 critic,用组内相对奖励估计优势 奖励信号 + 组采样 DeepSeek-R1 中等–重量 7B 以下:2–4 卡;32B 以上:16 卡以上(估算)
过程奖励模型(PRM) 在策/离策 对推理的每一步打分,而非只看最终答案 步骤级标注 Let’s Verify Step by Step 中等 与 SFT/RL 配合使用,8 卡以上(估算)
模型蒸馏 离策学习 学生模型学习教师模型的输出分布(软标签) 教师模型输出 DistilBERT、Gemma 轻量 取决于学生模型规模,1.7B 学生:8 卡(参考实践)
拒绝采样 + RL 混合 混合 先 RFT 冷启动,再 RL 提升 两者结合 DeepSeek-R1 流水线 重量 组合开销,16 卡以上(估算)
LoRA 微调 离策学习 冻结原模型,只训练低秩适配器 指令/领域数据 通用轻量微调 轻量 32B:1–2 卡(INT4 量化后约 46GB)
GSPO(RL) 在策学习 序列级重要性比,稳定 RL 训练 奖励信号 + 组采样 verl-omni 重量 Qwen3-Omni-30B-A3B:16 卡(2 台 A3,官方实测)

2.5.2. 资源分层速览

层级 方法 910C 卡数范围
轻量档(单卡可跑) LoRA、小模型全参 SFT、小学生模型蒸馏 1–2 卡
中等档(多卡单机) 8B–32B 全参 SFT、DPO、RFT、PRM 8 卡(单机)
重量档(多机集群) PPO、GRPO(大模型)、GSPO、拒绝采样+RL 混合 16 卡以上(多机)
集群档 235B MoE 全参 SFT 128 卡(16 台 A3)

2.5.3. 理论计算依据

结合通用的全参微调显存公式(16 字节/参数)和 DeepSpeed ZeRO 切分规则,以下是 Qwen3 系列在 910C 上训练的理论值推算。

全参微调静态显存(不含激活值)的通用公式为:

总显存 ≈ 参数量 × 16 字节(2 字节权重 + 2 字节梯度 + 12 字节 AdamW 优化器状态)

在 ZeRO 不同阶段下,单卡静态显存需求会按卡数 N 切分:

  • ZeRO-1:单卡 ≈ 4 × 参数量 + 12 × 参数量 / N
  • ZeRO-2:单卡 ≈ 2 × 参数量 + 14 × 参数量 / N
  • ZeRO-3:单卡 ≈ 16 × 参数量 / N

2.5.4. Qwen3 系列在 910C 上的训练理论卡数

模型 训练方式 理论静态显存(未切分) 单机 8 卡下的理论配置 理论卡数下限
Qwen3-1.7B 全参 SFT 约 27 GB 单卡即可容纳(128GB) 1 卡
Qwen3-8B 全参 SFT 约 128 GB ZeRO-1 或 ZeRO-2 单机 8 卡可承载 8 卡(保守)或 4 卡(ZeRO-3 估算)
Qwen3-32B 全参 SFT 约 512 GB ZeRO-3 下 8 卡可切分至 64GB/卡 8 卡(单机)
Qwen3-32B LoRA 约 64 GB(仅权重)+ 极小 Adapter 单卡 128GB 可容纳权重 1 卡
Qwen3-235B-A22B 全参 SFT 约 3760 GB(按总参数算) 单机 1024GB 远不足,需多机 32 卡以上(4 台 A3)
Qwen3-235B-A22B LoRA / 部分微调 权重约 470 GB(BF16) 4-8 卡可容纳权重 4–8 卡

2.5.5. 当前趋势

从“单方法”走向“混合流水线”。DeepSeek-R1 的实践显示,纯 RL 容易不稳定,纯 SFT 泛化有限。主流做法是:SFT 冷启动 → 拒绝采样筛选 → RL(GRPO/PPO)提升 → 蒸馏压缩。每个阶段解决不同问题,SFT 给基础格式,RL 给推理能力,蒸馏给部署效率。

注:标注“估算”的条目无 910C 实测数据,基于显存公式和 ZeRO 切分规则推算。DPO/PPO/GRPO 的卡数会随 batch size、序列长度和奖励模型规模显著波动。

2.5.6. 结论

模型的后训练,除了复杂的数据准备以外,还需要大量的硬件支撑,这个不是一般中、小型企业所能满足的。例如 对一个模型进行 235B MoE 做全参 SFT 的训练,至少需要 128 卡(16 台 A3)。

模型的后训练大多数还停留在小模型(30B 以下的模型),完成意图识别和多模态任务。

2.6. 预训练

需要更多的资源,和人力投入。

例如:

模型 训练数据量 资源投入 成本估算
GPT-3(175B,2020) 约 300B token 约 3.14×10²³ FLOPs,万卡级 V100 集群连续训练数周 数百万美元
Llama 3.1 405B 约 15.6 万亿(15.6T)token 16,000 张 H100,连续训练约 54 天 数千万美元
DeepSeek-V3(671B MoE) 约 14.8 万亿(14.8T)token 2,048 张 H800,约 278.8 万 GPU 小时 约 557 万美元(其中纯预训练约 266 万美元)
Qwen3 系列 约 36 万亿(36T)token 数千卡级别集群 未公开

预训练的投入远超后训练一个数量级以上:

  • 数据:需要清洗到万亿(T)token 级别的语料,以及配套的数据采集、清洗、去重流水线。
  • 算力:数千张旗舰卡(H100/H800/910C 等)连续运转数周到数月,集群规模直接决定训练周期。
  • 人力:需要大规模分布式训练、容错 checkpoint、损失尖峰(loss spike)处理等前沿工程能力。
  • 稳定性:超长周期训练的硬件故障率不可忽略,必须具备自动容错与恢复能力。

对企业而言,从零预训练几乎不可行,实践中通常退而求其次采用增量预训练(Continued Pretraining):在开源基座模型上,用 10B–100B token 级别的领域语料继续预训练,让基座习得领域知识与词汇。其资源需求与全参后训练相当(数十卡到数百卡),但仍远超大多数中小企业的承受能力。

预训练是唯一能从零塑造模型权重(知识分布、能力底座)的手段,但动辄数百万到数千万美元的投入,决定了它只属于极少数头部公司。

2.7. 在线学习

当评估、Harness、模型都就位之后,最后一步是让系统在生产环境中持续变好——建立数据飞轮,不断收集用户反馈,闭环优化模型。

Mercor 的 Arjun Karanam 有一个精妙的观察:模型在不断变聪明,但每个会话都像是模型上班的第一天。你可以把陶哲轩放进一家会计师事务所,但至少在第一天,他大概率不是那里最好的会计师——他缺的不是智力,而是经验。而智能体恰恰会在运行中源源不断地创造这种经验。

这里的关键资产是轨迹(Trajectory):模型看到的上下文、调用的工具与子智能体、产出的答案,以及用户随后的编辑、撤销和重试。捕获轨迹之后,改进便形成闭环:

  • 一次失败的任务 → 沉淀为一条新的评估;
  • 缺失的信息 → 进入上下文或记忆;
  • 糟糕的工具返回 → 促成一次 Harness 修复。

完整的在线学习闭环目前尚未在产业界大规模落地,但它代表了“拥有智能”的终极形态:产品用得越多 → 轨迹数据越多 → 模型与 Harness 越好 → 产品体验越好 → 用得更多。这是一个一旦转起来就极难被复制的飞轮。

3. 结论:着手构建,充实产品,提升竞争力

从企业运用 AI、建立自己的智慧助手,到形成产品的核心竞争力——从行业现状看,目前大多数企业还停留在第一到第四步(组建团队、评估、Harness、提示词工程);后训练需要集群级算力,预训练动辄数百万美元,门槛确实很高。

但这不应成为观望的理由。 以下是笔者的几点观点:

第一,自建不是目的,产品竞争力才是目的。 红杉在原文末尾也提醒:拥有自己的智能是打开潘多拉魔盒——闭源栈简单省事,下限高但上限低;自建栈下限可能更低,却抬高了上限。是否自建、自建到哪一步,唯一的判断标准是它能否转化为产品差异化毛利率

第二,用“分层演进”代替“一步到位”。 自建 AI 不必从训练模型开始,完全可以边租边建、小步快跑:

阶段 动作 沉淀的资产
1. 租用起步 前沿 API + 现成 Harness,快速验证场景 场景认知
2. 评估驱动 建立业务/性能基线,让每次修改有迹可循 评估资产
3. 工程优化 提示词工程 + Harness + 上下文工程 Harness 资产
4. 轻量后训练 LoRA / 小模型 SFT:意图识别、格式、专项能力 权重资产
5. 深度定制 全参 SFT / DPO / RL 混合流水线 权重 + 数据资产
6. 数据飞轮 在线学习,轨迹回流,持续迭代 护城河

前三步几乎没有算力门槛,却贡献了大部分收益;第 4 步 1–2 张卡即可启动。真正的护城河不在于走到了第几步,而在于飞轮是否转了起来

第三,把 AI 充实到产品中:从边缘功能走向核心功能。 先从非关键路径的智能化功能入手(摘要、分类、意图识别、格式化),借真实流量积累评估集与轨迹数据;再逐步渗透到核心工作流,把“开源基座 + 自有数据 + 自建 Harness”打磨出的领域小专家嵌入产品最深处。用红杉的话说:最好的产品公司正在培育自己的小天才——快、有主见、痴迷于领域、针对自己所见的工作精调。

第四,不管怎样,现在就开始。 智能层与应用层正在融合:实验室在向上做产品,应用公司在向下做训练闭环,中间的观望地带正在消失。无论最终是否选择自建,企业都应该现在就着手构建自己的 AI 团队,来应对 AI 带来的各种冲击和挑战——即使短期内全部租用,也应立刻建立评估体系、开始沉淀领域数据。评估和数据不会过时,它们是未来一切自建动作的地基;观望的代价,是错过启动数据飞轮的时间窗口。

4. 参考

  • [Own Your Intelligence: A How-To Guide]
  • Harvey:Legal Agent Benchmark(24 个法律执业领域、1,200+ 智能体任务、75,000+ 专家评分细则)
  • LangChain / LangSmith:Harness 设计与轨迹(Trajectory)捕获实践
  • DeepSeek-V3 / DeepSeek-R1 技术报告:混合后训练流水线与公开训练成本
  • Meta Llama 3.1 技术报告:405B 模型的 16,000 卡 H100 训练实践
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。