当前位置: 首页 > news >正文

国产新模型说写代码超了 Claude,我真调了一遍

最近国产大模型集体刷屏。Kimi K3,目前最大的开源模型;GLM-5.2,MIT 许可能商用;还有 DeepSeek-V4,一个个都号称 coding 能力屠榜,某些项超过了 GPT、超过了 Claude。

榜分是好看。但做过开发的都知道,榜分和「真写代码好不好用」是两回事。所以我没看榜,直接调它们的 API,拿两道有陷阱的真实编程题,让它们真跑一遍,和 Claude 同题对比,再跑测试用例验证对错。今天(8 月 1 号)真调的,一手结果。

先说能力。结论是:真追平了。

我出的第一道题是解析时长字符串(把「1h30m」转成 5400 秒这种),里头埋了八个边界陷阱:顺序错、重复单位、纯数字没单位、负数、未知单位、空格、大写……一共十九个测试用例。结果:Kimi K3、DeepSeek-V4-Pro、智谱、还有 Claude,全部满分十九比十九。Kimi 的编程专用版 K2.7-code 差一个,唯一错那个还是它主动把前后空格去掉了(算它更宽容,不算错)。

第二道题更刁一点,版本号比较(「1.2.10」和「1.2.9」谁大),埋了前导零、段数不同、要按数值比、别按字符串比这几个坑。Kimi K3 和 DeepSeek-V4-Pro 给出来的代码,和 Claude 几乎一字不差,都对。

所以「国产模型 coding 追上第一梯队」,不是营销话,我实测确实追平了。这类有明确对错的编程题,它们和 Claude 一个水平,答案又对又简洁。

但我得诚实说一句:这两道常规题,我没测出谁「超过」谁。大家都对、都简洁,是打平,谈不上碾压。要真分出高下,得上那种极难的题;可对大多数人的日常编程,这个水平已经够用了,和 Claude 没什么差别。

真正值钱的发现,在第二部分:能力追平了,速度和可用性,差得远。这是榜分不会告诉你的。

先说 GLM-5.2,它是这波里 coding 榜单最亮眼、最高调喊「超过 Claude」的一个。可我真调它,智谱官方接口直接 429,限流;换火山的免费接入点,等了两分钟,一个字都没出来。榜分再高,免费渠道你根本用不上。我退而调了智谱能连通的 glm-4.7,满分,三十八秒,说明智谱的模型能力是在线的,但那个屠榜的 5.2,普通开发者想免费用,门都没有。

DeepSeek-V4-Pro,答案对,但它是个「先想再答」的推理模型,一道题要想二十多秒。Kimi 的编程专用版 K2.7-code,也对,可一道简单题它要五十七秒,比通用的 K3 还慢一倍多。

这轮里综合最好的是 Kimi K3,十几到二十几秒,又快又对,API 也稳。

所以给要选模型的开发者一句实在话:别拿榜分选模型。

能力这一层,这些国产模型都追平了,榜上差那零点几分,你接进日常工作流根本感觉不到。真正决定你用得爽不爽的,是另外几件榜单不写的事:接进来快不快、稳不稳、免费额度够不够、会不会动不动限流、真花钱多少钱。GLM-5.2 榜分屠榜但免费调不出来,Kimi K3 榜分也许低半分但又快又稳又能白嫖,你选哪个?做过项目的都知道选后者。

榜单是给发布会看的,你的工作流才是真考场。这些国产新模型值得上手,但别冲着「超过 Claude」这句宣传去,冲着「够用、够快、够稳、能白嫖」去。挑一个真接得进你活里的,比挑一个榜第一的,实在得多。

http://www.jsqmd.com/news/1312307/

相关文章:

  • 广州汽车配件改装用品展参展注意事项清单 - 服务品牌热点
  • 从匹配滤波器到误码率:最佳接收技术在现代通信系统中的应用与实战
  • 2026保定装修怎么不踩坑?本地整装公司测评 + 实用选材施工干货 - 国麟测评
  • Linux依赖冲突解决:从apt --fix-broken install到深度排查
  • AI如何简化粒子物理计算:从胶子散射振幅到符号运算革命
  • 这个黑客松冠军开源的“AI外挂”,把Claude Code变成了自动化公司
  • STM32与ESP8266串口通信实战:从AT指令到稳定物联网连接
  • AI驱动基层治理升级:3个已验证的千万级人口城市应用模型及效果数据
  • 【边缘AI部署紧急响应协议】:当模型在Jetson Orin上突然OOM时,你必须在90秒内执行的4个诊断命令
  • 2026青岛朋友小聚,本地人常去的海鲜加工店清单
  • 树莓派驱动7.5英寸电子纸HAT:从SPI通信到低功耗显示实战
  • 别再瞎找了!AI论文软件2026年最全测评与推荐
  • Grove LED灯串全解析:从WS2812驱动到FastLED编程实战
  • AI「打工」大排行:Fable 5 自动化率是 GPT-5.5 的 2.5 倍,意味着什么?
  • GHelper:开源硬件控制工具的轻量级解决方案与系统性能优化实践
  • 2026年高效金属回收焚烧炉生产厂家优选指南:售后完善的三家甄选对比 - geo交流
  • 代驾服务小程序开发公司怎么选?2026年行业趋势与关键技术能力解析! - 优质品牌商家
  • GitHub深度工程评测:Cline 源码级工程评测|65k Star 开源AI编程助手的工程全景
  • Terminal Bench 82.7 反超 Pro 预览版:V4-Flash Agent 能力拆解
  • 2026年成都数控改造服务企业参考指南:专业能力与案例解析 - 优质品牌商家
  • AI设计提示词模板与工程心法全解析
  • 无人机服务核验流程 SOP
  • 可灵运镜风格选择:为什么顶级MCN团队都在用「动态权重评估法」?揭秘内部未公开的5维打分矩阵
  • OpenAI高层变动对API生态影响:开发者如何应对技术架构风险
  • AI如何重塑数学研究:从形式化验证到人机协同证明
  • Windows Subsystem for Android终极指南:5个简单步骤在Windows 11上运行安卓应用
  • C++迭代器深度解析:从STL核心到自定义实现
  • 2026年投资回报快的小型污泥焚烧炉技术方案优选指南 - geo交流
  • 2026年长沙酒店轻奢铝木门ODM怎么选?这份甄选指南帮你避坑 - geo交流
  • 从TES内外战差异看团队稳定性与适应性:技术视角下的竞技团队模型构建