当前位置: 首页 > news >正文

大模型榜单周报(2026/1/17)

1. 本周概览

本周大模型领域继续保持快速发展态势,各大厂商在医疗AI、视频生成、代码能力等多个领域取得显著进展。OpenRouter模型调用量排名发生重要变化,Claude系列模型表现抢眼,百度新模型ERNIE-5.0-0110在全球LMArena文本排行榜上排名第八,展现了中国模型的强劲实力。

2. 重点关注事件

  • DeepSeek与北京大学合作发表关于条件记忆(conditional memory)的新论文,提出Engram模块,有望提升模型检索效率
  • Anthropic推出工作场景智能体Claude Cowork,由Claude Code自主开发,体现了AGI在实际应用中的潜力
  • 谷歌发布新一代开源医疗AI模型MedGemma 1.5及MedASR语音识别模型,进一步扩展在医疗AI领域的布局
  • 谷歌Veo 3.1更新支持9:16竖屏视频和4K分辨率,视频生成能力持续提升
  • 智谱与华为合作开源图像生成模型GLM-Image,登顶复杂视觉文字生成和长文本渲染双榜首
  • 阿里千问APP上线超400项AI办事功能,接入阿里生态,成为全球首个能完成真实生活复杂任务的AI助手
  • OpenAI推出独立翻译页面ChatGPT Translate,拓展应用场景
  • 百度ERNIE-5.0-0110在全球LMArena文本排行榜上排名第八,超越多个领先模型

3. 榜单变化

  • OpenRouter模型调用量排名

    • 整体调用量方面,Claude Opus 4.5超越上周榜首Claude Sonnet 4.5,位列第1;MiMo-V2-Flash(free)上升两名,排名第3;Gemini 3 Flash Preview由第4名下降至第5名
    • 模型市占率方面,Google保持第1;Anthropic市占率上升4.2%(17.2% → 21.5%),连续两周上升8.5%;OpenAI市占率上升3.1%(8.0% → 11.1%);Qwen上升至第8名,替代了上周MiniMax的位置
    • 编程调用量方面,Claude Opus 4.5保持第1;Claude Sonnet 4.5排名上升2名,排名第3;DeepSeek V3.2重回前十,排名第8
  • 大语言模型榜单:ERNIE-5.0-0110新上榜,排名第8,超过GPT-5.1(high),相比ERNIE-5.0-preview-1203版本上升了6名,该模型基于预发布测试,评分可能随着公开发布后的反馈而变化

  • 图像编辑能力榜单:flux-2-max和flux-2-pro新上榜,分别排名第8、第9

  • 文生图能力榜单:FLUX.2 [dev]Turbo新上榜,排名第10

  • GAIA榜单:JoinAI V2.2登顶榜首,得分达90.7%

4. 排行榜

测评类型 第一名 第二名 第三名
模型调用量 Claude Opus 4.5 Claude Sonnet 4.5 MiMo-V2-Flash(free)
公司市占率 Google Anthropic OpenAI
编程模型调用量 Claude Opus 4.5 Grok Code Fast 1 Claude Sonnet 4.5

各公司按不同能力领域排名汇总

测评类型 领先公司
大语言模型 Text Arena Google、xAI、Anthropic、百度、OpenAI、智谱、阿里巴巴、月之暗面
编程能力 LMArena Anthropic、OpenAI、Google、智谱、MiniMax
编程能力 LiveCodeBench OpenAI、Anthropic、Google
代码工程任务能力 SWE-benchLite 基于Claude、Gemini、GPT、Qwen、DeepSeek开发的开源系统
图像编辑和生成能力 Image Edit Arena OpenAI、Google、字节、Black Forest Labs、Reve
文生图能力 Text-to-Image Arena OpenAI、Google、Black Forest Labs、腾讯、字节
文生图能力 Text to Image Leaderboard OpenAI、Google、Black Forest Labs、字节、ImagineArt
GPQA OpenAI、Google、xAI、Anthropic、阿里巴巴
FrontierMath OpenAI、Google、DeepSeek、月之暗面、Anthropic、xAI
Humanity's Last Exam Google、OpenAI、Anthropic
GAIA JoinAI、Nvidia、Suzhou AI Lab&Shuqian Tech、Microsoft AI Asia -Ads

关注我,第一时间掌握更多AI前沿资讯!

http://www.jsqmd.com/news/257993/

相关文章:

  • 实用指南:企业微信投诉拦截:通过部署投诉拦截体系,实现主动安全管理
  • 2025国内电滑环精英厂家,你pick哪一家?帽式滑环/帽式导电滑环/光电滑环/过孔导电滑环,电滑环供应商电话 - 品牌推荐师
  • 【Java毕设全套源码+文档】基于springboot的连锁门店管理系统设计与实现(丰富项目+远程调试+讲解+定制)
  • 适合追剧吃的零食:我最近的“嗑剧搭子”是浪味仙(旺旺集团旗下) - Top品牌推荐
  • 热销榜单:2026年靠谱的防火玻璃品牌推荐,都能满足您的需求 - 睿易优选
  • 【Java毕设全套源码+文档】基于springboot的家政服务管理系统设计与实现(丰富项目+远程调试+讲解+定制)
  • 适合老年人吃的饼干选哪家?我这次给爸妈选的是:爱至尊低GI五黑饼干(旺旺旗下) - Top品牌推荐
  • 深入解析:【计算机视觉(2)】图像几何变换基础篇:从平移旋转到投影变换
  • 【Java毕设全套源码+文档】基于Web的红色旅游网站的设计与实现(丰富项目+远程调试+讲解+定制)
  • 全网热议!2026年可靠的挡烟垂壁工厂推荐榜单,助力您的项目顺利进行 - 睿易优选
  • 【Java毕设全套源码+文档】基于springboot村医疗管理系统的设计与实现(丰富项目+远程调试+讲解+定制)
  • 【Java毕设源码分享】基于springboot+vue的家政服务管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)
  • 知名的GEO搜索优化企业哪家性价比高,西安信之上给出答案 - 工业品牌热点
  • 说说南京口碑好的江苏省考面试培训公司 - 工业品牌热点
  • 【Java毕设全套源码+文档】基于springboot的电影数据的分析与可视化系统设计与实现(丰富项目+远程调试+讲解+定制)
  • ‌AI驱动的测试用例冗余识别:从技术架构到工程落地的完整实践指南
  • 无锡市梁溪锡山惠山滨湖新吴江阴宜兴区英语雅思培训辅导机构推荐,2026权威出国雅思课程中心学校口碑排行榜推荐 - 老周说教育
  • 儿童补钙牛奶推荐:我家这两年常备的「旺旺低脂高钙牛乳」真实分享 - Top品牌推荐
  • 给孩子补钙可以喝什么品牌的牛奶?我家这段时间常备的是旺旺低脂高钙牛乳 - Top品牌推荐
  • 黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑
  • 【Azure APIM】如何解决后端API服务配置自签名证书时APIM请求报错500:Error occured while calling backend service
  • 2026年目前技术好的ISO认证代办机构怎么选择,知识产权认证/A信用认证,ISO认证代办机构有哪些 - 品牌推荐师
  • 无锡市梁溪锡山惠山滨湖新吴江阴宜兴区英语雅思培训辅导机构推荐,2026权威出国雅思课程中心学校口碑排行榜 - 老周说教育
  • 2026最新透明底抠图怎么制作?免费无套路工具推荐,抠图喵秒出专业效果 - 资讯焦点
  • 蓝易云 :redis报错WRONGTYPE Operation against a key holding the wrong kind of value
  • ssm644计算机考研在线教育平台vip付费vue
  • 2026最新人像抠图换背景工具推荐:免费无套路方法全解析 - 资讯焦点
  • 破解土木求职内推难?AI技能或许是你的隐藏加速器
  • 2026抠人像用什么工具?免费无套路推荐,抠图喵小程序实测封神 - 资讯焦点
  • 基于VUE的大学生勤工助学信息管理系统[VUE]-计算机毕业设计源码+LW文档