构建自己产品的智能层
引言:智能层之战
AI 应用层的竞争,已不再只是 UI、工作流或市场打法(GTM)的竞争,而是对**智能层(Intelligence Layer)**本身的争夺。
最近,Palantir 的 Alex Karp 鼓励企业“拥有生产资料”;不久之后,微软的 Satya Nadella 更是断言:从前沿实验室购买智能,等于付两次钱——一次付的是真金白银,另一次付出的,是你在调教智能的过程中泄露出去的专有知识。
红杉资本(Sequoia)近期召集了一批 AI 创始人与构建者(Harvey、Mercor、LangChain、Trajectory、Fireworks)研讨“拥有自己的 AI 栈”,一套清晰的打法(Playbook)随之浮现。红杉在投资组合中观察到:越来越多公司开始为产品中的部分功能构建自有 AI 能力,通过纵向整合,逐步拥有并塑造模型权重。
为什么是现在(Why Now)? 两个结构性变化,让“拥有智能”从口号变成了可行路径:
- 开源权重逼近前沿。以 Kimi K3、GLM 5.2 为代表的开源模型已经“极其能打”。过去在开源模型上做微调像在跑步机上奔跑——花几个月调出来的增益,会被下一次前沿发布一夜抹平;现在,你可以从一个足够接近前沿的基线出发。
- 独立后训练技术栈已经成熟。借助 Mercor、Fireworks 等公司,每家企业都能获得过去只有前沿实验室才具备的完整技术栈:训练、推理、人类/合成数据。配合强评估、Harness 工程与后训练,开源模型已经可以在特定领域击败前沿闭源模型。
一年前,选择开源权重往往意味着“性能是那个可以被牺牲的选项”;今天,这已经变成一个关乎生存与战略的问题。
本文基于红杉资本《Own Your Intelligence: A How-To Guide》,结合笔者的实践与思考,试图回答三个问题:
- 什么情况下应该自建 AI,什么情况下应该租用?
- 自建 AI 的完整路径是什么样的?
- 企业应如何着手,把 AI 充实到产品中,形成核心竞争力?
1. 自建 vs 租用 (Own vs Rent)
决定构建自己的 AI 之前,企业首先要回答的问题就是:AI 能力是自建还是租用?
可以参照下面的四个维度来综合考虑,这四个维度实际上反映了技术架构中经典的“控制力与灵活性”的权衡。
| 自建 (OWN) | 租用 (RENT) | |
|---|---|---|
| 🟢 成本 | ⬆️ 高成本 | ⬇️ 低成本 |
| 🔵 速度/延迟 | ➡️ 速度至关重要 | ⬅️ 速度非首要任务 (P0) |
| 🟡 性能 | ⬇️⬆️ 下限低 上限高 |
↕️ 下限高 上限低 |
| 🟣 专有数据 | ⬆️ 高度专有 | ⬇️ 专有性较低 |
- P0:工程优先级术语,P0 = 最高优先级,
Speed Isn’t a P0:速度不是最高优先级需求
基于这张图表,我们可以从成本、速度/延迟、性能、专有数据这四个核心维度,深入解读“自建(Own)”与“租用(Rent)”之间的本质差别。
| 维度 | 自建 (Own) | 租用 (Rent) | 核心权衡 (Trade-off) |
|---|---|---|---|
| 1. 成本 | 🟢 ⬆️ 高成本 • 模式:重资产模式,需承担前期资本支出(CapEx)和持续运营支出(OpEx)。 • 包含:硬件采购、数据中心建设、电费、专职运维团队。 • 特点:前期投入大,但长期可能摊薄单位成本。 |
🟢 ⬇️ 低成本 • 模式:轻资产模式,将资本支出转化为运营支出。 • 包含:按需付费(Pay-as-you-go),无硬件维护成本。 • 特点:启动资金低,无闲置资源浪费,现金流友好。 |
资本支出 vs 运营支出 (重资产投入 vs 轻资产灵活性) |
| 2. 速度/延迟 | 🔵 ➡️ 速度至关重要 • 表现:追求极致低延迟,可进行底层硬件和网络调优。 • 原因:硬件和网络完全可控,针对特定任务优化。 • 适用:高频交易、实时游戏、实时AI推理。 |
🔵 ⬅️ 速度非首要任务 (P0) • 表现:受限于供应商网络和标准化硬件,难以极致优化。 • 原因:多租户环境,网络路径不可控。 • 适用:大多数Web应用、后台批处理,容忍一定延迟。 |
极致性能 vs 开发效率 (关注点在于优化深度 vs 快速上线) |
| 3. 性能 | 🟡 ⬇️⬆️ 下限低,上限高 • 性质:高方差。 • 下限低:运维能力差时,性能可能极差。 • 上限高:技术强+砸钱,可突破物理极限。 • 核心:性能完全取决于自身技术能力。 |
🟡 ↕️ 下限高,上限低 • 性质:低方差。 • 下限高:供应商保证基础稳定性,不优化也能跑。 • 上限低:难以突破供应商设定的性能天花板。 • 核心:性能稳定可预测,但缺乏爆发力。 |
潜力无限 vs 稳定可靠 (看技术能力 vs 看服务套餐) |
| 4. 专有数据 | 🟣 ⬆️ 高度专有 • 控制力:数据完全在自有防火墙内,物理隔离性最好。 • 优势:数据主权完全掌握,适合核心机密和强合规行业。 • 风险:需自行承担数据安全责任。 |
🟣 ⬇️ 专有性较低 • 控制力:数据存储在第三方服务器,控制权分散。 • 优势:运维便利,由供应商负责部分安全。 • 风险:理论上有被用于训练通用模型的风险。 |
数据主权 vs 运维便利 (绝对控制 vs 托管服务) |
1.1. 总结对比表
| 维度 | 自建 (Own) | 租用 (Rent) | 核心权衡 |
|---|---|---|---|
| 成本 | 高投入,重资产 | 低门槛,轻资产 | 资本支出 vs 运营支出 |
| 速度 | 极致优化,低延迟 | 标准化,延迟一般 | 极致性能 vs 开发效率 |
| 性能 | 高方差(看技术) | 低方差(看套餐) | 潜力无限 vs 稳定可靠 |
| 数据 | 绝对控制,高专有 | 托管控制,低专有 | 数据主权 vs 运维便利 |
- 一句话总结
- 自建:用高成本和运维精力换取极致的性能控制权和数据主权。
- 租用:用部分控制权和性能上限换取低成本、高稳定性和快速启动能力。
1.2. 如何决策:不是“全有或全无”,而是按功能切片
自建 vs 租用从来不是公司级别的二选一,而是产品功能切片(Slices)级别的决策。一个务实的演进路径通常是:
- 起步阶段:全部租用(前沿 API + 现成 Harness),用最低成本快速验证产品市场契合(PMF);
- 放量阶段:产品越成功,AI 销货成本(COGS)随用量线性上涨,毛利率开始被侵蚀;
- 切片切换:对成本、延迟、数据敏感的功能切片,逐步切换为自建模型;
- 长期共存:非核心切片继续租用,享受其高下限、零运维的红利。
除了上述四个维度,还有一个更隐性的战略维度值得纳入考量——掌控自己的命运(Controlling Your Destiny)。应用层与智能层正在融合:实验室在向上做产品,应用公司在向下进入定义产品“思考方式”的训练闭环。拥有产品,正在越来越多地意味着控制更多的学习循环与智能本身。
2. 自建的过程

整个过程可以概括为一条逐级加码的路径:组建进攻型团队 → 建立评估基线 → 打磨 Harness → 优化提示词 → 后训练 → 预训练 → 在线学习。前四步轻资产、低门槛,是每家企业的必修课;后三步逐级抬升门槛,也逐级构筑壁垒。
2.1. 组建团队
组建一支专职的、全新组建(de novo)的小团队,而不要把这项工作硬塞进现有的平台团队。拥有自己的智能需要的是“打进攻”的人,而不是“做防守”的平台运维。
| 要点 | 说明 |
|---|---|
| 独立成军 | 不要挂靠平台团队。自建 AI 是进攻性工作,需要独立的专注度、激励和节奏。 |
| 小而精 | 小团队 + 生态合作伙伴即可走得很远。Harvey 仅用 7 人团队就完成了大量前沿研究。 |
| 进攻型人才 | 核心工作:构建评估(Evals)、塑造数据、试验开源模型、调优 Harness、在特定领域持续压榨性能。 |
| 生态合作 | 与大约半打生态伙伴合作(数据、训练、推理、评估等环节),补齐自身短板,获得接近前沿实验室的技术栈。 |
此外,还应该让工作可见(Make the work legible):当前每个买家都在挑选自己的 AI 冠军,而公开发布的研究、基准测试或技术文章正日益成为决胜的关键筹码。如果选择在内部做出色的研究,就应该把它分享给生态。
2.2. 评估
评估是一组用来衡量系统能否把工作做好的任务。每项任务包含Prompt、模型可使用的上下文,以及评分机制。
建立评估体系是整个过程中最最最重要的一环。因为只有有了评估基线,才能决定哪些任务需要优化。所以在开始优化之前,请务必建立评估基线。只有这样才能知道你该如何修改:提示词,上下文,模型,系统参数,让你的修改有迹可循。
基线包括业务基线和性能基线。业务基线需要完成业务场景的覆盖,性能基线需要完成性能场景的覆盖。为后续的改进提供基础数据。
Harvey 联合创始人 Gabe Pereyra 说得很好:“如果你没有好的基准,你就无法训练模型。” Harvey 构建法律智能体基准(Legal Agent Benchmark)的做法值得借鉴:把真实法律工作拆解为模型可测试的离散任务,第一版即覆盖 24 个法律执业领域的 1,200+ 个智能体任务,由 **75,000+ 条专家撰写的评分细则(Rubric)**来评判。
笔者观点:所有评估都是从创始人“眯着眼看输出、凭手感判断对错”开始的,这并不可耻。评估工程的第一步,就是把这种手感固化为可重复、可度量、可回归的资产。务必在决定“自建还是租用”之前先把评估建好——当每一次前向传播都有评估兜底,选哪个模型就不再靠猜,而是靠测。
2.3. Harness
一个智能体由三部分组成:模型、上下文、Harness。Harness 是除了模型之外的所有系统组件的集合,负责模型外围的全部产品逻辑:路由(Routing)、检索(Retrieval)、工具(Tools)、记忆(Memory)、回退(Fallbacks)与追踪(Traces)。
LangChain 创始人 Harrison Chase 的概括非常精准:“Harness 的核心职责,是在正确的时机,把正确的上下文带给模型。”
任务越是超出模型的训练分布(Out of Distribution),现成的通用 Harness 就越不适用。良好的 Harness 设计可以:
- 把每个任务路由到最适合它的模型;
- 让同一套评估在不同模型之间复用,支持横向对比与随时切换;
- 精确控制智能体能获得哪些上下文、哪些工具;
- 让智能体可观测、可检查:什么上下文进入了、调用了哪些工具、在哪里卡住,全程可追溯。
良好的 Harness 设计可以使系统更轻松、更稳定、更可靠。在不改变模型结构的情况下,仅靠调整 Harness 就能显著提高系统性能——这是性价比仅次于提示词工程的优化手段。
2.4. 提示词工程
提示词工程是指设计和实现用于引导模型生成所需输出的提示词。良好的提示词工程可以使模型更准确地理解用户需求,生成更符合预期的输出。在自建过程中,提示词工程是一个非常重要的环节,因为它直接关系到模型的性能和用户体验。
在目前的应用中,提示词工程仍是成本最低的一个提高系统性能、准确度的方式。
2.5. 后训练
在深入具体技术之前,先回答“什么时候才需要后训练”。Lin Qiao 给出了一个清晰的决策框架——对症下药,能不动权重就不动权重:
| 问题表现 | 解决方案 | 是否动权重 |
|---|---|---|
| 模型缺少事实/知识 | 补充上下文 / RAG | ❌ 无需训练 |
| 输出格式或行为不对 | 监督微调(SFT) | ✅ |
| 产品“品味”不对(语气、风格) | 偏好调优(DPO 等) | ✅ |
| 专项任务能力不足 | 强化学习(RL) | ✅ |
| 模型太慢、太贵 | 蒸馏 | ✅ |
原则:选择能够推动评估指标的最轻方法(pick the lightest method that moves your eval),然后通过同一套 Harness 提供服务,持续测量质量、延迟与成本。
以下技术选型基于 Atlas 800I A3(8 × 910C,单卡 128GB HBM) 的硬件规格
2.5.1. 主流后训练方法一览
| 方法 | 类型 | 核心原理 | 数据需求 | 典型代表 | 资源层级 | 910C 参考卡数(Qwen3) |
|---|---|---|---|---|---|---|
| 监督微调(SFT) | 离策学习 | 在“提示-回答”对上做监督学习,让模型模仿专家行为 | 高质量标注数据 | 通用指令微调 | 轻量–中等–集群 | 1.7B:1 卡;8B/32B:8 卡;235B MoE:128 卡 |
| 拒绝采样微调(RFT) | 离策/在策混合 | 用模型生成多个候选,筛选出正确答案后再做 SFT | 模型自生成 + 筛选 | ReST、STaR | 中等 | 与 SFT 相当,额外需采样推理,8 卡(估算) |
| 直接偏好优化(DPO) | 离策学习 | 在成对偏好数据上直接优化策略,无需奖励模型 | 偏好对(chosen/rejected) | DPO、IPO、KTO | 中等 | 需额外加载参考模型,显存约 SFT 的 1.5–2 倍,8–16 卡(估算) |
| 近端策略优化(PPO) | 在策学习 | 策略与环境交互,用奖励模型和 critic 估计优势 | 奖励信号 + 在线采样 | InstructGPT | 重量 | 策略+奖励+价值+参考四组件共存,显存压力最大,16 卡以上(估算) |
| 分组相对策略优化(GRPO) | 在策学习 | 去掉 critic,用组内相对奖励估计优势 | 奖励信号 + 组采样 | DeepSeek-R1 | 中等–重量 | 7B 以下:2–4 卡;32B 以上:16 卡以上(估算) |
| 过程奖励模型(PRM) | 在策/离策 | 对推理的每一步打分,而非只看最终答案 | 步骤级标注 | Let’s Verify Step by Step | 中等 | 与 SFT/RL 配合使用,8 卡以上(估算) |
| 模型蒸馏 | 离策学习 | 学生模型学习教师模型的输出分布(软标签) | 教师模型输出 | DistilBERT、Gemma | 轻量 | 取决于学生模型规模,1.7B 学生:8 卡(参考实践) |
| 拒绝采样 + RL 混合 | 混合 | 先 RFT 冷启动,再 RL 提升 | 两者结合 | DeepSeek-R1 流水线 | 重量 | 组合开销,16 卡以上(估算) |
| LoRA 微调 | 离策学习 | 冻结原模型,只训练低秩适配器 | 指令/领域数据 | 通用轻量微调 | 轻量 | 32B:1–2 卡(INT4 量化后约 46GB) |
| GSPO(RL) | 在策学习 | 序列级重要性比,稳定 RL 训练 | 奖励信号 + 组采样 | verl-omni | 重量 | Qwen3-Omni-30B-A3B:16 卡(2 台 A3,官方实测) |
2.5.2. 资源分层速览
| 层级 | 方法 | 910C 卡数范围 |
|---|---|---|
| 轻量档(单卡可跑) | LoRA、小模型全参 SFT、小学生模型蒸馏 | 1–2 卡 |
| 中等档(多卡单机) | 8B–32B 全参 SFT、DPO、RFT、PRM | 8 卡(单机) |
| 重量档(多机集群) | PPO、GRPO(大模型)、GSPO、拒绝采样+RL 混合 | 16 卡以上(多机) |
| 集群档 | 235B MoE 全参 SFT | 128 卡(16 台 A3) |
2.5.3. 理论计算依据
结合通用的全参微调显存公式(16 字节/参数)和 DeepSpeed ZeRO 切分规则,以下是 Qwen3 系列在 910C 上训练的理论值推算。
全参微调静态显存(不含激活值)的通用公式为:
总显存 ≈ 参数量 × 16 字节(2 字节权重 + 2 字节梯度 + 12 字节 AdamW 优化器状态)
在 ZeRO 不同阶段下,单卡静态显存需求会按卡数 N 切分:
- ZeRO-1:单卡 ≈
4 × 参数量 + 12 × 参数量 / N - ZeRO-2:单卡 ≈
2 × 参数量 + 14 × 参数量 / N - ZeRO-3:单卡 ≈
16 × 参数量 / N
2.5.4. Qwen3 系列在 910C 上的训练理论卡数
| 模型 | 训练方式 | 理论静态显存(未切分) | 单机 8 卡下的理论配置 | 理论卡数下限 |
|---|---|---|---|---|
| Qwen3-1.7B | 全参 SFT | 约 27 GB | 单卡即可容纳(128GB) | 1 卡 |
| Qwen3-8B | 全参 SFT | 约 128 GB | ZeRO-1 或 ZeRO-2 单机 8 卡可承载 | 8 卡(保守)或 4 卡(ZeRO-3 估算) |
| Qwen3-32B | 全参 SFT | 约 512 GB | ZeRO-3 下 8 卡可切分至 64GB/卡 | 8 卡(单机) |
| Qwen3-32B | LoRA | 约 64 GB(仅权重)+ 极小 Adapter | 单卡 128GB 可容纳权重 | 1 卡 |
| Qwen3-235B-A22B | 全参 SFT | 约 3760 GB(按总参数算) | 单机 1024GB 远不足,需多机 | 32 卡以上(4 台 A3) |
| Qwen3-235B-A22B | LoRA / 部分微调 | 权重约 470 GB(BF16) | 4-8 卡可容纳权重 | 4–8 卡 |
2.5.5. 当前趋势
从“单方法”走向“混合流水线”。DeepSeek-R1 的实践显示,纯 RL 容易不稳定,纯 SFT 泛化有限。主流做法是:SFT 冷启动 → 拒绝采样筛选 → RL(GRPO/PPO)提升 → 蒸馏压缩。每个阶段解决不同问题,SFT 给基础格式,RL 给推理能力,蒸馏给部署效率。
注:标注“估算”的条目无 910C 实测数据,基于显存公式和 ZeRO 切分规则推算。DPO/PPO/GRPO 的卡数会随 batch size、序列长度和奖励模型规模显著波动。
2.5.6. 结论
模型的后训练,除了复杂的数据准备以外,还需要大量的硬件支撑,这个不是一般中、小型企业所能满足的。例如 对一个模型进行 235B MoE 做全参 SFT 的训练,至少需要 128 卡(16 台 A3)。
模型的后训练大多数还停留在小模型(30B 以下的模型),完成意图识别和多模态任务。
2.6. 预训练
需要更多的资源,和人力投入。
例如:
| 模型 | 训练数据量 | 资源投入 | 成本估算 |
|---|---|---|---|
| GPT-3(175B,2020) | 约 300B token | 约 3.14×10²³ FLOPs,万卡级 V100 集群连续训练数周 | 数百万美元 |
| Llama 3.1 405B | 约 15.6 万亿(15.6T)token | 16,000 张 H100,连续训练约 54 天 | 数千万美元 |
| DeepSeek-V3(671B MoE) | 约 14.8 万亿(14.8T)token | 2,048 张 H800,约 278.8 万 GPU 小时 | 约 557 万美元(其中纯预训练约 266 万美元) |
| Qwen3 系列 | 约 36 万亿(36T)token | 数千卡级别集群 | 未公开 |
预训练的投入远超后训练一个数量级以上:
- 数据:需要清洗到万亿(T)token 级别的语料,以及配套的数据采集、清洗、去重流水线。
- 算力:数千张旗舰卡(H100/H800/910C 等)连续运转数周到数月,集群规模直接决定训练周期。
- 人力:需要大规模分布式训练、容错 checkpoint、损失尖峰(loss spike)处理等前沿工程能力。
- 稳定性:超长周期训练的硬件故障率不可忽略,必须具备自动容错与恢复能力。
对企业而言,从零预训练几乎不可行,实践中通常退而求其次采用增量预训练(Continued Pretraining):在开源基座模型上,用 10B–100B token 级别的领域语料继续预训练,让基座习得领域知识与词汇。其资源需求与全参后训练相当(数十卡到数百卡),但仍远超大多数中小企业的承受能力。
预训练是唯一能从零塑造模型权重(知识分布、能力底座)的手段,但动辄数百万到数千万美元的投入,决定了它只属于极少数头部公司。
2.7. 在线学习
当评估、Harness、模型都就位之后,最后一步是让系统在生产环境中持续变好——建立数据飞轮,不断收集用户反馈,闭环优化模型。
Mercor 的 Arjun Karanam 有一个精妙的观察:模型在不断变聪明,但每个会话都像是模型上班的第一天。你可以把陶哲轩放进一家会计师事务所,但至少在第一天,他大概率不是那里最好的会计师——他缺的不是智力,而是经验。而智能体恰恰会在运行中源源不断地创造这种经验。
这里的关键资产是轨迹(Trajectory):模型看到的上下文、调用的工具与子智能体、产出的答案,以及用户随后的编辑、撤销和重试。捕获轨迹之后,改进便形成闭环:
- 一次失败的任务 → 沉淀为一条新的评估;
- 缺失的信息 → 进入上下文或记忆;
- 糟糕的工具返回 → 促成一次 Harness 修复。
完整的在线学习闭环目前尚未在产业界大规模落地,但它代表了“拥有智能”的终极形态:产品用得越多 → 轨迹数据越多 → 模型与 Harness 越好 → 产品体验越好 → 用得更多。这是一个一旦转起来就极难被复制的飞轮。
3. 结论:着手构建,充实产品,提升竞争力
从企业运用 AI、建立自己的智慧助手,到形成产品的核心竞争力——从行业现状看,目前大多数企业还停留在第一到第四步(组建团队、评估、Harness、提示词工程);后训练需要集群级算力,预训练动辄数百万美元,门槛确实很高。
但这不应成为观望的理由。 以下是笔者的几点观点:
第一,自建不是目的,产品竞争力才是目的。 红杉在原文末尾也提醒:拥有自己的智能是打开潘多拉魔盒——闭源栈简单省事,下限高但上限低;自建栈下限可能更低,却抬高了上限。是否自建、自建到哪一步,唯一的判断标准是它能否转化为产品差异化和毛利率。
第二,用“分层演进”代替“一步到位”。 自建 AI 不必从训练模型开始,完全可以边租边建、小步快跑:
| 阶段 | 动作 | 沉淀的资产 |
|---|---|---|
| 1. 租用起步 | 前沿 API + 现成 Harness,快速验证场景 | 场景认知 |
| 2. 评估驱动 | 建立业务/性能基线,让每次修改有迹可循 | 评估资产 |
| 3. 工程优化 | 提示词工程 + Harness + 上下文工程 | Harness 资产 |
| 4. 轻量后训练 | LoRA / 小模型 SFT:意图识别、格式、专项能力 | 权重资产 |
| 5. 深度定制 | 全参 SFT / DPO / RL 混合流水线 | 权重 + 数据资产 |
| 6. 数据飞轮 | 在线学习,轨迹回流,持续迭代 | 护城河 |
前三步几乎没有算力门槛,却贡献了大部分收益;第 4 步 1–2 张卡即可启动。真正的护城河不在于走到了第几步,而在于飞轮是否转了起来。
第三,把 AI 充实到产品中:从边缘功能走向核心功能。 先从非关键路径的智能化功能入手(摘要、分类、意图识别、格式化),借真实流量积累评估集与轨迹数据;再逐步渗透到核心工作流,把“开源基座 + 自有数据 + 自建 Harness”打磨出的领域小专家嵌入产品最深处。用红杉的话说:最好的产品公司正在培育自己的小天才——快、有主见、痴迷于领域、针对自己所见的工作精调。
第四,不管怎样,现在就开始。 智能层与应用层正在融合:实验室在向上做产品,应用公司在向下做训练闭环,中间的观望地带正在消失。无论最终是否选择自建,企业都应该现在就着手构建自己的 AI 团队,来应对 AI 带来的各种冲击和挑战——即使短期内全部租用,也应立刻建立评估体系、开始沉淀领域数据。评估和数据不会过时,它们是未来一切自建动作的地基;观望的代价,是错过启动数据飞轮的时间窗口。

4. 参考
- [Own Your Intelligence: A How-To Guide]
- Harvey:Legal Agent Benchmark(24 个法律执业领域、1,200+ 智能体任务、75,000+ 专家评分细则)
- LangChain / LangSmith:Harness 设计与轨迹(Trajectory)捕获实践
- DeepSeek-V3 / DeepSeek-R1 技术报告:混合后训练流水线与公开训练成本
- Meta Llama 3.1 技术报告:405B 模型的 16,000 卡 H100 训练实践
- 点赞
- 收藏
- 关注作者
评论(0)