当前位置: 首页 > news >正文

Anthropic 靠 Claude Code 赚了 10 亿,但我更担心 AI 生成代码的质量危机

上周有个消息在我朋友圈刷了屏:Anthropic 单季度利润突破 10 亿美元,成了全球第一家靠大模型赚到真钱的前沿公司。不是靠 API 调用量,不是靠卖会员——靠的是 Claude Code,那个终端里的编程 Agent。同一周,Bun 项目用 AI 在 11 天内重写了超百万行代码,从 Zig 搬到 Rust,测试通过率 99.8%,官方发推庆祝。评论区却没跟着嗨。有人翻出 CodeRabbit 那篇报告:AI 生成代码的缺陷率是人工的 1.7 倍,开发者信任度从 43% 跌到了 33%。两个新闻放在一起看,就很有意思了——一边是钱在疯狂涌入,一边是代码质量在悄悄塌方。我不是来唱衰的,我自己也在用 Cursor 和 Claude Code 写东西。但有些话,我觉得得有人说清楚。

先说那个 Bun 的案例。11 天、百万行、99.8% 测试通过率——这三个数字放在一起,任何一个工程团队看了都会心跳加速。可仔细想想,"测试通过率"和"代码可靠"从来不是一回事。测试覆盖的是你已知的边界,AI 埋雷的地方往往是你没想到的边界。Bun 那条推文下面,最高赞的评论是:"测试通过不等于代码正确,更不等于可维护。"说这话的人大概踩过类似的坑。我自己也踩过——上个月让 Claude Code 重构一个权限模块,10 分钟改了 12 个文件,diff 看得我直点头,合进去两天后接口全炸了。它把 role 字段从 string 改成 string[],但只修了类型定义和守卫层,没碰下游的数据库查询和前端契约。一个字段,三个地方返回了不一样的结果。这 bug 你靠单元测试是测不出来的,因为每个模块单独测都绿。只有集成到一起跑,才炸。

这事让我一直在想一个问题:AI 编程工具到底在"提升"什么?

从表面看,答案很明确——效率。Cursor 的 Composer 一键改多文件,Claude Code 自己规划自己写自己跑测试,Windsurf 的 Agent 模式也能一口气干完一整套 CRUD。2026 年的数据显示,AI 已经写了全行业 42% 的提交代码。这个数字放在两年前,没人敢信。但同样的数据也说明了另一个事实:96% 的开发者不完全信任 AI 生成的代码,只有 48% 的人会在提交前逐行审查。换句话说,代码在飞快地堆,但看代码的人越来越少了。这不是效率提升,这是效率幻觉——你写得更快了,但改得更慢了。Hacker News 上有个 Stripe 的工程师说得挺扎心:他花 6 小时调试 Copilot 写的一个分布式竞态条件,而那代码他自己手动写只要 2 小时。净亏 4 小时。

C++ 之父 Bjarne Stroustrup 今年直接开炮:AI 生成的代码普遍臃肿、充满幻觉,而且极难维护。他说得不算客气,但你在 PR 里见过 AI 生成的代码就会明白——一个简单的排序逻辑,人类写十几行,AI 能写出四五十行,嵌套四层 if,兜了三层底,变量名还又长又没意义。看起来逻辑是对的,但任何一个老手看了都会皱眉:这代码能跑,但谁敢改?

所以我的判断是:AI 编程工具现在的核心矛盾,不是"能不能写代码",而是"写出来的代码到底归谁管"。Cursor 和 Claude Code 在"写"这个阶段已经好到让人上瘾了——你给个 prompt,它刷刷刷出一堆文件,那个爽感是真的。但代码的 90% 生命周期在写完之后的维护阶段。AI 不维护,它只生产。你让 AI 十分钟搓出来的模块,可能要你花两天去理解它为什么要这么写,再花两天去改它没考虑到的那条边界。METR 今年 2 月的研究也印证了这一点:开发者自我感觉快了 20%,但实际测量中,复杂任务上的净效率提升远没那么乐观。感觉快和真的快,是两码事。

我不是说要回到手写代码的原始时代。我自己的日常工作流里,Cursor 的 Tab 补全和 Claude Code 的 Agent 模式已经是标配了。但用了大半年,我慢慢总结出三条底线,分享出来供你参考。

第一条,AI 最适合干的活是"样板代码、CRUD 逻辑、单元测试骨架"。这些场景里,提效 40%-60% 是真实的,因为代码本身没有什么"架构决策"可言,纯粹是翻译。第二条,涉及架构变更、数据模型设计、跨模块契约的时候,AI 只能当副驾驶,不能当主驾。你让它出初稿可以,但每一行你都得看,而且要看懂。第三条,也是最容易被忽略的——AI 生成的代码需要专门的"质量门禁"。不是传统的 lint 和单元测试就够了,你需要集成测试、契约测试,甚至需要专门的 AI 代码审查工具来跑差异分析。因为 AI 最擅长制造的 bug 不是语法错误,是"看起来对但逻辑不对"的沉默失败。

Claude Code 帮 Anthropic 赚了 10 亿美元,这件事本身是好事——它证明了 AI 编程工具的商业价值,会倒逼更多资源投入这个方向。但商业价值和工程质量之间,天然存在一个张力:资本要的是"快",工程要的是"稳"。如果这个张力不处理好,2026 年的"AI 编程繁荣"可能变成 2027 年的"AI 代码债务危机"。

你觉得呢?你团队里 AI 写的代码,是直接合了,还是加了额外的审查步骤?你踩过最坑的 AI 生成代码 bug 是什么?评论区聊聊,我想听听你们的门槛设在哪。

http://www.jsqmd.com/news/1394053/

相关文章:

  • 从GPT-2到Kimi K3:大模型架构演进与MoE技术实践
  • 8月码字实战指南:2026年10款写小说软件体验测评(含ai写小说避坑经验)
  • 产品图片怎么生成3D模型?拍摄、重建与商业展示的完整做法 - 生活动态圈
  • 北京至臻至美祛斑有隐形消费吗深度解析:行业专家视角 - 米諾
  • OpenClaw强化学习框架:稀疏奖励环境下的高效探索算法解析与实践
  • Windows系统文件uexfat.dll丢失找不到问题解决
  • 广州公司注册流程及费用2026:怎么注册、多少钱、避坑指南 - 米諾
  • 告别卡顿与黑边:WarcraftHelper魔兽争霸3性能优化与兼容性完整指南
  • 天道7
  • 未来社群进化:从中心化运营到分布式创造的实践路径
  • 二手车价格预测框架
  • 突破LLM局限:从Text2JSON到Text2SQL的Agent架构实战
  • 角色扮演ASMR:从声音模仿到情境构建的心理按摩艺术
  • Windows 系统优化可以多快?我用开源工具 WinUtil 把新电脑配置压缩到 30 分钟
  • Harness Managed Agents 进化:从托管代理到智能工作负载网格
  • 教师培训工具推荐:用练题簿帮小程序助学生把课堂知识真正练会
  • 彩钢瓦翻新喷漆改色和直接更换新瓦,该怎么选,结合厂房实际情况理性判断 - 本地便民网
  • Claude Code MCP配置实战:让AI助手安全操作数据库与代码库
  • 手把手带你认识SMUDebugTool:AMD Ryzen平台调试与优化的一把钥匙
  • 生成模型表示接口设计与软等变性诊断实战
  • 【CAPL】调用外部程序发送钉钉消息:从C#封装到CAPL集成实战
  • 《天道》观后感7
  • ANSYS 2024 安装与配置全攻略:从许可服务器到稳定运行的完整心法
  • 彩钢瓦翻新、除锈喷漆与换瓦怎么选?厂房屋面修缮投入产出对比分析 - 本地便民网
  • AI开发文档难题:用元数据注解与运行时追踪构建自文档化智能体
  • React 19 + Vite 企业级前端项目:从零搭建到规范交付
  • 基于多智能体协作的AI绘画:GPT-Image-2 Skill与Hermes框架实战
  • 基于LangChain构建工业级RAG系统:从原理到实战优化
  • 工厂/物业工地设备安检巡检报修小程序制作开发教程,新手也能上手
  • 跨厂商网络智能体信任管理:构建自治网络的“交通法规”