当前位置: 首页 > news >正文

Databricks如何把AI编码支出砍掉70%:四个杠杆和一套网关架构

Databricks如何把AI编码支出砍掉70%:四个杠杆和一套网关架构

看完你会发现,你之前的理解可能要更新了。

AI 编码工具带来的效率提升是实打实的--Databricks 的原话是"order-of-magnitude gains in output",产出提升了一个数量级。但账单也是实打实的:成本指数级增长,如果不管,"eventually overtake revenue"--最终会吃掉营收。

这不是某一家公司的问题。Databricks 联合了 Stripe、Coinbase、Uber、Ramp 一起复盘,发现大家踩的是同一个坑:AI 编码工具用得越爽,成本就越失控。

Databricks 在官方博客上分享了他们的解法:不是限制使用,而是通过四个成本杠杆 + 一套 AI Gateway 架构,在保持开发效率不降的前提下,把 AI 编码支出砍掉了约 70%。这篇博客的含金量很高,不是泛泛而谈的"最佳实践",而是有具体数字、有架构图、有踩坑细节的工程复盘。

本文提纲

  1. 核心认知:追效率前沿,不是智能前沿
  2. 杠杆一:换模型--开源和低成本模型是最大赢家
  3. 杠杆二:动态路由--让便宜模型干它能干的活
  4. 杠杆三:可视化+渐进式摩擦--别用硬预算
  5. 杠杆四:砍 Token 开销--用户输入只占冰山一角
  6. AI Gateway:把四个杠杆串起来的中枢架构
  7. 数据复盘和关键启示

核心认知:追效率前沿,不是智能前沿

Databricks 提出了一个关键概念区分:效率前沿(Efficiency Frontier) vs 智能前沿(Intelligence Frontier)

智能前沿是最强的模型--GPT-5、Claude Opus 5.0 这些旗舰。效率前沿是"在给定智能水平下性价比最高的模型"。Databricks 的判断是:效率前沿的推进速度远快于智能前沿。几乎每周都有新模型发布,在同等智能水平下价格更低。

大部分日常编码任务根本不需要前沿级别的智能。重命名一个变量、补全一段 boilerplate、写个单元测试--这些活用轻量模型就够了。只有架构设计、复杂调试这类任务才真正需要旗舰模型。

这个认知是后续所有优化的前提:如果你还在无脑用最贵的模型,后面的杠杆都无从谈起。

杠杆一:换模型--开源和低成本模型是最大赢家

Databricks 把这一条列为"delivered the largest cost wins of any technique"--所有手段里省钱最多的。

听起来简单,做起来有个大坑:公开 benchmark 不能反映真实编码场景的表现。Databricks 和其他公司都发现,公开评测和实际开发任务之间的相关性很差。解法是建自定义的自动化评测--用自己团队的真实编码任务做 benchmark。

几个具体的决策案例:

  • Databricks 发布了一份 benchmark,显示 GLM 系列开源模型在编码任务上有极高的性价比,随后在内部大规模推广
  • Stripe 发现 Opus 4.7 相比 4.6 质量没有实质提升,但成本更高,直接拒绝上线
  • Databricks 比较 Opus 5.0 和 4.8 后也发现了类似的成本倒退,没有升级

这里有个容易被忽略的点:harness 和模型的耦合问题。旗舰模型越来越倾向于和特定 harness(编码工具)配合设计。直接换模型可能导致体验下降。

两种解法:

  1. 让用户切 harness:切换成本高,容易形成事实锁定
  2. 用 meta-harness:上层统一 UX,底层分发到不同 harness。Databricks 用的是 Omnigent 作为默认 meta-harness,也有公司自建了内部的 meta-harness

杠杆二:动态路由--让便宜模型干它能干的活

这是技术含量最高的一环。Databricks 把路由分成三类:

MERMAID_BLOCK_0

请求级路由

一个有状态的 proxy 拦截在客户端和模型之间,把每个请求路由到"能回答这个问题的最低成本模型"。关键细节:要考虑服务端缓存--大上下文负载下,冷缓存命中的成本非常高。

相关产品:Cursor Router、OpenRouter AutoRouter、Ramp Router、Databricks Unity AI Gateway Smart Routing。

任务级路由

在 meta-harness 层面,按任务复杂度分发。"把组件 X 重命名为 Y"这种简单任务给轻量模型,"探索降低延迟的设计方案"这种复杂任务给旗舰模型。

升级/委派模式

两个方向:

  • Claude Advisor Tool 模式:便宜模型跑主循环,遇到搞不定的再升级给贵模型
  • Cognition Devin Fusion 模式:反过来,贵模型跑主循环,把子任务外包给便宜模型

路由效果

Databricks 的 AI Gateway Smart Router 持续降低平均任务成本 超过 30%,而且质量"roughly matching the most expensive model in the working set"--和最贵模型基本持平。其他受访公司也得到了类似结果。

杠杆三:可视化+渐进式摩擦--别用硬预算

这一条反直觉。第一反应是给团队设预算上限,超了就停。但 Databricks 发现硬预算在所有受访公司里都只是"last resort"--最后手段。

原因有两个:

  1. 切断访问会重创生产力:开发者正在用 AI 工具高效产出,突然断了等于停工
  2. 花钱最多的人往往效率提升最大:那些 AI 编码支出最高的开发者,恰恰是工具用得最好、产出最高的。惩罚他们等于自我设限

Databricks 的解法是渐进式摩擦(Progressive Friction),分四级:

MERMAID_BLOCK_1

  1. 可视化:近乎实时的消费反馈,附降费建议,跨所有工具可见
  2. 消费门槛:自清零的门槛作为预警,过了就需要明确预算审批(走管理链)。Databricks 发现自清零门槛对防止"意外或无意识消费"特别有效
  3. 降档:把开发者切到更便宜的模型,而不是停用
  4. 暂停:只作为极端情况,且明确是临时措施,是对话的起点而不是惩罚

这个设计的精髓在于:不阻止花钱,但让花钱的行为变得可见、有意识。大部分超额消费来自无意识的使用--开发者忘了关 session、重复提交相同 prompt、用旗舰模型做简单任务。可视化就能解决一大部分。

杠杆四:砍 Token 开销--用户输入只占冰山一角

这是最容易被忽略的成本来源。

用户手敲的 prompt 只占喂给 AI 的数据的极小一部分。真正吃 token 的是上下文:对话历史、代码库索引、工具返回结果、system prompt。Databricks 的原话:"Costs are dominated by context the user did not explicitly include."

优化手段:

  • 更频繁的上下文压缩:及时 compaction,别让历史无限膨胀
  • 用不那么啰嗦的 harness:或者调参降低 verbosity
  • 审计热门工具:减少输出冗余
  • 拆分任务:鼓励开发者把大任务拆成小单元,减少单次上下文

Prompt Caching 是重头戏。开源和闭源 LLM 都支持 prompt caching,可以调缓存存储时长。写缓存要花钱,但读缓存能大幅降低单次推理成本。这个 trade-off 取决于工作负载--Databricks 通过手动调优默认缓存设置,大幅提升了缓存命中率。

Token 削减效果

Databricks 通过"相对简单的 harness 和缓存设置调优",实现了 接近 50% 的生成 token 数量和成本削减,而且开发者侧没有观察到质量下降。博客还提到"meaningful additional optimization remains possible"--还有进一步优化空间。

AI Gateway:把四个杠杆串起来的中枢架构

四个杠杆单独用都有效果,但要规模化运作,需要一个统一的中枢。Databricks 把这个角色交给了 AI Gateway

MERMAID_BLOCK_2

AI Gateway 承担四个职责:

  1. 容量管理和代理:统一接入闭源和开源模型,开发者不需要关心后端是哪个模型
  2. 预算追踪和执行:包括渐进式摩擦和模型降档机制
  3. 配置管理:强制模型白名单、压缩设置、本地化配置
  4. 会话日志:记录编码 session trace,用于效率分析和 benchmark 构建

Databricks 把 Unity AI Gateway 和 Omnigent 都开源了,"thousands of companies use these components every day"。

这套架构的核心价值在于:它让成本优化变成了一个工程问题,而不是管理问题。开发者不需要关心自己用的是什么模型、花了多少钱--Gateway 在后台处理路由、缓存、预算。管理者不需要逐个审批--Gateway 自动执行渐进式摩擦策略。

数据复盘和关键启示

把四个杠杆的效果汇总一下:

优化杠杆 效果 实现难度
模型替换(开源/低成本) 最大单项节省 中(需自建 benchmark)
智能路由 任务成本降 >30% 高(需 stateful proxy)
渐进式摩擦 防止无意识消费 低(主要是策略设计)
Token 削减 + 缓存 token 量和成本降 ~50% 低(调参为主)

四个杠杆叠加,Databricks 实现了约 70% 的整体成本削减,开发效率没有下降。

几个关键启示值得所有正在大规模采用 AI 编码工具的团队注意:

第一,别追最新模型。 效率前沿比智能前沿移动得快。Opus 4.7 比 4.6 贵但没更好,Opus 5.0 比 4.8 也是成本倒退。每升一级模型前,先用自己的 benchmark 验证值不值。

第二,硬预算是下策。 花钱最多的开发者往往产出最高,切断他们的工具等于自断臂膀。用可视化和渐进式摩擦替代一刀切。

第三,用户输入不是成本大头。 真正花钱的是上下文。Prompt caching 的调优可能是 ROI 最高的单一优化动作。

第四,这四个杠杆需要统一架构才能规模化。 零散地在各个工具里调参不可持续,需要一个 AI Gateway 做中枢。Databricks 把 Unity AI Gateway 开源了,直接拿来用就行。

Databricks 博客最后一句话说得特别好:"The exponential growth of AI coding costs is not an inevitability, it's a solvable engineering and governance problem."--AI 编码成本的指数级增长不是宿命,是一个可解的工程和治理问题。

参考文档与链接

  • Managing AI Coding Costs at Scale - Databricks 官方博客 - 原文,四个杠杆的完整论述,含 Stripe/Coinbase/Uber/Ramp 的实践数据
  • Unity AI Gateway - Databricks 开源组件 - 文中提到的 AI Gateway 实现,支持模型路由、预算追踪、日志审计
  • Omnigent - Meta-Harness 工具 - Databricks 使用的默认 meta-harness,统一 UX 层支持多模型分发
  • OpenRouter AutoRouter - 请求级路由的第三方实现,自动选择最低成本可用模型
  • Cursor Router - Cursor 内置的路由功能,支持自定义模型分发策略
  • Anthropic Prompt Caching 文档 - Prompt caching 的官方实现,含定价和缓存时长配置
  • Claude Advisor Tool - 便宜模型主循环+贵模型升级的委派模式实现
  • GLM 模型 Benchmark - Databricks - Databricks 发布的 GLM 模型编码性价比评测,推动内部大规模采用

你的团队AI编码账单涨了多少?用的什么优化手段?评论区聊聊。觉得有用点个赞让更多人看到。


作者: itech001
来源: 公众号:AI人工智能时代
网站: https://www.theaiera.cn/
每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

http://www.jsqmd.com/news/1368468/

相关文章:

  • Interplanetary Postal Service音效设计:如何用白噪音创造沉浸式太空体验
  • VueLocalStorage核心功能解析:从安装到高级配置的完整教程
  • 20260810 - 暑假热身 总结
  • supa_audit快速入门:3步启用PostgreSQL表变更跟踪功能
  • 如何用SSM快速构建隐马尔可夫模型?3步实现时间序列数据的动态模式识别
  • 革命性提升 SCINet 性能:RevIN 可逆归一化技术完全解析
  • 高效打卡系统设计:从行为心理学到实践工具
  • 海豚善学口碑怎么样,靠谱吗?结合公开信息与学员反馈客观聊聊 - 培训机构评测网
  • 如何在3分钟内安装csview?跨平台安装指南与常见问题解决
  • Shopify是什么?中国卖家做独立站前必须搞清楚的10个问题
  • Comedy框架高级特性:资源管理与依赖注入实战
  • 提升主题质量的7个高级Regularizer:BigARTM实战技巧分享
  • EMBA排行榜涉及项目海外模块时长与学分设置对比
  • 2026年 深圳疑难注销代办机构**:工商异常、税务非正常户、失联吊销快速解决方案深度解析 - 卓企推荐
  • AnimeGarden终极指南:一站式动漫BT资源聚合平台快速上手
  • 为什么选择RT-Thread?5大优势助力物联网项目开发
  • RuoYi-Vue权限管理系统 | 微服务架构下的企业级应用开发平台演进
  • geektime-nginx中的SSL配置:5分钟实现HTTPS安全访问
  • 从WebSQL到IndexedDB:IDBWrapper助你平滑迁移离线存储方案
  • 论文笔记:Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
  • 靠谱的EMBA院校对比 5个主流项目课程模块差异参照
  • Volume Cloud与大气散射系统集成:创建电影级天空环境的实用教程
  • 8个独特关卡全解析:Interplanetary Postal Service挑战攻略与技巧
  • mccabe高级应用:大型Python项目的复杂度监控与管理策略
  • 5分钟解决音频编辑难题:Audacity实战指南
  • 视频去水印方法合法吗?去水印工具电脑手机优缺点与风险解析 - 免费软件工具方法教程
  • 2026年金华创业选公司注册服务要注意什么?拓昶财税(金华服务中心)来解答 - 品牌优推
  • AI 情感陪伴与智能助手产品开发实践:定价、成本与投入产出测算
  • DataBuff 发布 v0.1.7 版本:新增平台自监控,支持 AI 一键巡检与修复等多项功能
  • JadbConnection深度剖析:如何构建与ADB服务器的稳定连接