全部建议 > 建议详情
  • 预审中
  • 预审通过
  • 3 未采纳

【用户体验】建议华为云模型为Agent场景优化计费模式,增加缓存命中Tokens部分单独费率 未采纳 编辑 删除

  • AI基础平台
  • MaaS模型即服务

场景描述:

目前华为云的模型计费时仅按输入Tokens和输出Tokens计费,但是没有考虑缓存命中部分的费率,在Agent模式下有大量重复上下文时会导致成本指数级增长,与行业其他平台为优化Agent等场景推出的计划相比缺乏竞争力。

在聊天场景里,用户问一句,模型答一句,成本相对容易估算。但在 Agent 场景里,一个任务可能包含长上下文、多轮推理、代码生成、工具调用、网页读取、文件分析和结果校验。用户看到的只是最后一次输出,后台却可能已经发生了多次请求和大量上下文读取。

Agent、代码助手和长上下文应用有一个共同特点:很多内容会反复出现。比如系统提示词、项目代码、API 文档、工具说明、历史对话、依赖文件等。这些内容如果每次都重新计算,成本会很高;但如果能被缓存,下次再用时只按缓存命中价格计费,推理成本就会明显下降。也就是说,缓存命中价格越低,越适合高频、多轮、长上下文的真实工作场景。

DeepSeek-V4-Pro 的输入缓存命中价格从 0.1 元直接降到了 0.025 元每百万 Tokens。MiMo-V2.5-Pro 输入命中缓存时,输入价格也将至 0.025 元每百万 Tokens。DeepSeek 和小米MIMO低价背后,其实也是为了先把开发者和高频应用吸引进来,让更多 Agent、代码助手和办公自动化应用愿意跑在自己的模型上。阿里云、腾讯云等也推出了针对Agent场景的套餐。

 

建议方案:

建议华为云模型为Agent场景优化计费模式,增加缓存命中Tokens部分单独费率,提升在Agent模式等有大量重复上下文场景的经济性和竞争力

halazi100 halazi100 发布于 2026-06-04 10:50:19 2026-06-04

346 2

100%
1人赞同
0%
0人不赞同

全部评论(2

评论(2

  • 【云声小管家】 子规 2026-06-09 16:26:24

    您好,关于您提交的建议产品和研发团队进行了评估,1、能力已支持:MaaS已具备缓存命中能力,并支持缓存命中单独计费。2、默认不开启:因资源不足、流量供不应求,不需要缓存命中的客户已经完全占满了资源,因此上线模型均默认不支持缓存命中。3、命中率不承诺:缓存命中率的呈现取决于输入输出长度、后台缓存资源情况等,具体命中率不对外承诺。综合考虑整体需求与产品规划,很抱歉未能采纳,还请您谅解。
    对您造成困扰深表歉意!希望以上可以解决您的疑虑,感谢您的反馈,若在使用还有其它建议,可在云声平台继续反馈,我们收到后会尽快处理。感谢您对华为云的支持

  • 【云声小管家】 子规 2026-06-04 11:26:02

    非常感谢您的反馈,您的建议和诉求已经收到,并已提交至相关产品团队进行核查评估,评估完成后对于建议是否采纳会尽快给您答复,也请您持续关注云声平台,了解反馈建议处理进展,感谢您对华为云的支持!

登录后可评论,请 注册

0/1000

+ 插入图片0/4

仅支持JPG、JPEG、PNG、GIF,数量不超过4张且每张大小不超过2MB

评论
发表评论...
取消 发表

0/1000

评论成功

+ 插入图片0/4

仅支持JPG、JPEG、PNG、GIF,数量不超过4张且每张大小不超过2MB

删除建议

设置昵称

在此一键设置昵称,即可发表云声建议!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。