美版豆包G3.7Flash,快到飞起,超3分钟算我输!
美版豆包又更新了!
还有人记得谷歌的 Gemini 系列么?好像被极度边缘化了!上次 Flash 更新的时候,我其实专门写过一系列文章,介绍 Antigravity 这个智能体,以及测试了 3.5 Flash。当前的感觉是 Flash 的前端设计还是很屌的,然后我就再也没关注过了!
看到 3.7 Flash 更新了,我又打开了尘封已久的 Antigravity,又折腾了一下网络。用了一下发现一种很神奇的感觉。
先说一下我的第一感受,Flash 真的是快到飞起,好像完全不用思考,也不需要纠错,一个任务给它,它刷的一下做完了。
GLM 5.3 需要一小时完成一个任务,Gemini 3.7 Flash 三分钟搞定。我测试了好多个例子,大部分例子没有超过 3 分钟。唯一一个让它用了 4 分钟的是超级玛丽。
没有过多思考,没有大量调用工具,没有什么功能验证,也不搞截图验证,没有疯狂的修改代码。 就是双手插兜,一句话就帮你把事儿给办了。
我严重怀疑它在敷衍我!
但是看了一下结果好像也还行,比 DSP 强多了。
这是一种什么样的存在啊,谷歌是在什么平行时空发展么,Gemini 3.7 的气质,和当前主流的模型完全不一样。
今天有必要来好好观摩观摩了!
基准数据
按照惯例,我们先要看一下官方的发布描述和基准信息!
我首先刷到的帖子是 DeepMind 发布的这个帖子:
帖子的内容也非常简洁:
Gemini 3.7 Flash 来了。 它在编码、知识工作和网页开发方面更强大。
所以这次的重点是:编码、知识工作、网页开发!
谷歌真的是与世隔绝了么,它居然没有说 Agent 这个词,只说了 Coding!
我也不知道它说的更强大是强大到什么程度了。赶紧来看一波基准数据吧!
关于基准,它主要是发了 4 张截图。
第一张是 FrontierCode:
这个基准是和生产代码质量相关的指标,主要是评估模型产出可直接上线的生产级代码的能力,看代码是否健壮、可部署,不是玩具样例。
这个指标比 3.6 高了很多,也要强于 Sonnet 5 和 Terra。
第二张是 DeepSWE:
长周期软件工程,真实开源项目的 bug 修复任务,长上下文、真实仓库代码,复现真实工程师改 bug 场景,考验长代码理解、项目级调试。
这个指标仅比 Terra 低一些,比其他选手都要高。
第三张是:AutomationBench
企业工作流自动化,企业办公自动化任务,写脚本、API 调用、业务流程自动化,偏向 RPA / 业务脚本场景。
这个指标遥遥领先同台选手。
第四张是 Code Arena:
Web 前端 / 全栈开发竞技场,输出完整可运行网页应用,分数是 Arena 得分,数值越高 Web 开发能力越强。
这个指标也是遥遥领先同台选手。
看数据是不是也挺不错的!这个主要是得益于它选择的对手。它这次选的对手都不是顶级版本,而是二线版本。Claude 家的没有选 Opus 5,而是选了 Sonnet 5,GPT 5.6 家的没有选 Sol,而是选了 Terra。
从这里可以看出一个关键点。谷歌已经不想在技术上争第一了。它只希望能在二流队伍里就行了。
这个多少有点让人失望,但是如果它这个模型能力真的还可以,然后又快又便宜,那么也不错,这也算是一种务实吧。
今天重点是来看一下它的能力,现在到底是什么水平!
七七八八的介绍差不多了,终于可以进入正题了,开始上手实测咯!
我已经把最近的几个例子全部测了一波了,下面看详情!
赛博朋克版清明上河图
我们还是从这个例子开始吧。为什么要测这个例子,以及具体的提示词是什么,这些我已经讲过很多次了。早上刚说过,我就不重复了。
测试工具,我们就用谷歌官方的 Antigravity !
然后创建一个 Gemini 3.7 Flash 目录,然后在里面创建一个对话,把我们的提示词扔给它!
接下来我就要开始准备进行漫长的等待了。
没想到的是,它两分钟就搞定了,我直接惊掉下巴!
结果如下:
打开之后没有任何错误,就是这个风格有点独特和抽象,和以往的都不一样。我看了一下细节,细节并不是很好。毕竟只用了 2 分钟。以往测过的模型一般是在十几分钟到几十分钟。
这次测试最凸出的是它的速度,这个速度实在是太快了!
天文机械表
和 GLM 5.3 的测试顺序保持一致,第二个例子是天文机械表。
直接看结果吧:
这个配色和界面设计好像还不错。但是它少了两个指针,我用黄色箭头补全了。另外就是画面里面一直有个东西在闪烁,我也不知道是啥。
效果大概就是这个样子,时间嘛,就是 1 分钟搞定。 太离谱了,别人起码要消耗十几分钟才能完成。
由于 G哥 写代码,根本不存在过程,所以我也没必要去分析什么了。
复刻游戏
按照惯例,也让它复刻一下经典的《坦克大战》和《超级玛丽》!
坦克大战的 UI 做得还不错!
游戏界面也还可以:
这个界面是有一些细节问题的,但是整体来说还可以,玩起来也没啥问题。基本达到了中上水平。
完成这个例子的时间依旧没有超过 3 分钟,没有任何复杂的验证,就是刷刷一下子就搞好了,搞完之后没有任何基础错误!
超级玛丽除了色调有点独特之外,完成度也很高:
第一个版本主要是存在跳跃高度问题,导致游戏无法继续。然后花费 1 分钟让它修复了一下,就全部 OK 了。游戏里下蹲水管、隐藏蘑菇、无敌和子弹全部都是有的。
整体的效果已经是中上偏上水平了。
这个例子很多选手花了几十分钟做得惨不忍睹,而它只花了 4 分钟。这是它唯一一个超过 3 分钟的例子。
到这里确实有点惊人了。
我早上测试 GLM 5.3 的时候,整整跑了一个多小时,做了无数验证,还错了一次。最后是花了两个小时做到了不错的效果。而 G3.7 Flash 只用了 4+1 分钟!
G3.7 Flash 到底是一个什么样的存在呢?它为什么可以在极短的时间里完成这么多事情呢?
3D台球
最后,我们来一个开放题。不提供详细的提示词。直接跟它说:“我想做一个 3D 台球,你有什么想法”
我看了一下,它的想法还是挺到位:
你看它说的多好啊:
制作一款高品质的3D 网页端台球游戏(3D Pool / Billiards)是一个非常精彩且兼具技术挑战性的项目。它不仅要求精准的物理模拟,还需要细腻的 3D 光影质感和直观流畅的击球操控。
以下我从技术架构、核心物理、视觉与镜头、游戏模式、交互设计五个维度为你梳理的一套完整方案与创意构想:
这个例子的制作过程,简直就是和许愿一样,你说要什么,它立马改,不管你提多么复杂的需求,二话不说给你改,1 分钟给你效果。几轮对话之后已经做得比较完善了,都包含了十几个功能菜单了。
大部分改得还不错,只是有一个问题,它一直修复不了。就是球桌上的 6 个孔,一直挖不好。你怎么说都挖不好!
这个 3 分钟成型、1 分钟改一次的版本的例子,在以往的测试中,已经属于上等水平了,比 GLM 5.3 和 K3 要好。
谷歌的模型太奇特了,好像完全不用动脑子,就是靠肌肉记忆做事情,特别快。
但是你也不要希望它自己反思什么,反思,这种事情不存在的。
另外一个神奇之处是,比如 DSP 和 GLM 写的代码如果不反复检测和修复,基本没法用。但是谷歌这个模型,不做任何复杂的校验,生成的代码居然是可以跑的,也没有出现基础的语法错误。
鉴于它的速度实在是太快了,首次生成的代码也不是不能用,即便有问题,改一下也极快。所以这个模型其实是有很大的实用性的,效率真的太高太高太高了!
除了模型之外,我必须要吐槽一下谷歌的Antigravity体验太糟糕了。
这么大个公司,做的编程智能体真的是一坨:
莫名其妙,动不动就未知错误,这个 agent error 我都看吐了!大部分时间就浪费在这个上面了。另外要找生产的文件,我还得自己去文件管理器里面找,他都无法右键直达,也无法在对话中预览结果。
另外,模型配额消耗方面好像还可以:
我这些个例子,在其他模型上面跑,基本能把基础套餐的周配额都跑完。但是 Gemini 这里看着好像还可以啊,周配额只消耗了 5 个点!!!只能说,不内耗的模型,做事就是快,消耗就是少。
谷歌真的是玩了一波与众不同,我感觉它炼丹的方式和追求的目标已经和当前主流模型公司分道扬镳了。它就是练出了一个能力中等偏上,但是速度极快的模型。当别人全部在搞 Agent 的时候,感觉它是完全在硬练模型,所以它的公告里只说了编程能力有很大的提升,但是没有说 Agent 能力有很大的提升,因为它在 Antigravity 中基本上不怎么调用工具,也不做什么复杂的验证,直接一把梭。
我记得 3.5 的时候它还喜欢动不动就做个计划,现在是计划都不做了。拿到需求立马开干,干完立马收工,绝对不浪费一秒钟!
我G哥,可谓是大模型中的“闪电侠”!
