当前位置: 首页 > news >正文

性能碾压Qwen3.5/Gemma4!Nanbeige4.2-3B在代码生成/数学推理上的7大突破

性能碾压Qwen3.5/Gemma4!Nanbeige4.2-3B在代码生成/数学推理上的7大突破

【免费下载链接】Nanbeige4.2-3B项目地址: https://ai.gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3B

Nanbeige4.2-3B是一款基于Nanbeige4.2-3B-Base构建的紧凑型智能模型,它将强大的智能体行为与广泛的推理和对齐能力相结合。其循环Transformer架构通过重用Transformer层来增加模型容量,而无需添加参数。仅凭借3B非嵌入参数,该模型就在通用智能体和代码智能体任务上展现出了出色的性能。

🌟 7大核心突破解析

1. 3B参数实现9B级智能体性能

在复杂工具使用、办公智能体和代码智能体基准测试中,Nanbeige4.2-3B超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。其GDPval评分达到74.3分,远超Qwen3.5-9B的61.9分和Gemma4-12B的68.5分。

2. 代码生成能力跃升

在SWE-Bench Verified测试中,Nanbeige4.2-3B以63.6%的通过率领先Qwen3.5-9B(53.1%)和Gemma4-12B(44.2%)。SWE-Bench Pro测试中同样以46.9%的成绩大幅领先竞品。

3. 数学推理能力超群

HMMT-Feb-2026数学测试中,Nanbeige4.2-3B获得82.8分,远超Qwen3.5-9B的69.6分和Gemma4-12B的51.5分。IMO-Answer-Bench测试中以67.3分领先Qwen3.5-9B的56.3分。

4. 本地部署的个人助理

仅3B非嵌入参数使其足够紧凑,可在本地部署,同时保留多步骤工作流所需的智能体能力。在Pinch-Bench-V2(74.7分)和Claw-Gym(65.0分)等日常任务测试中均大幅领先Qwen3.5系列。

5. 创新的循环Transformer架构

通过Looped Transformer架构重用Transformer层,在不增加参数的情况下提升模型容量。modeling_nanbeige.py中还包含最新的架构改进,包括LoopSplit、带深度注意力的mHC和连接的n-gram嵌入。

6. 超长上下文支持

模型支持高达262,144个token(256K)的上下文长度,为长文档处理和复杂任务提供充足空间。

7. 多框架部署支持

提供Huggingface、SGLang、vLLM、llama.cpp和ollama等多种部署方式,满足不同场景需求。

🚀 快速开始使用

要开始使用Nanbeige4.2-3B,首先克隆仓库:

git clone https://gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3B
Huggingface部署示例
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Nanbeige/Nanbeige4.2-3B" tokenizer = AutoTokenizer.from_pretrained( model_id, use_fast=False, trust_remote_code=True ) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True ) messages = [ {"role": "user", "content": "Which number is bigger, 9.11 or 9.8?"} ] prompt = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=False ) input_ids = tokenizer( prompt, add_special_tokens=False, return_tensors="pt" ).input_ids output_ids = model.generate( input_ids.to("cuda"), max_new_tokens=131072, temperature=0.6, top_p=0.95, top_k=20, eos_token_id=166101 ) response = tokenizer.decode( output_ids[0][len(input_ids[0]):], skip_special_tokens=True ) print(response)

⚡ 性能优化建议

根据目标场景调整推理设置:

场景温度最大新token数
智能体和工具使用任务1.065,536
推理和聊天任务0.6131,072

技术报告提供了更详细的模型信息和评估结果:Nanbeige42_report.pdf。

Nanbeige4.2-3B证明了小型模型通过架构创新和优化训练流程,可以在特定任务上超越更大规模的模型,为本地部署和资源受限环境提供了强大的AI解决方案。

【免费下载链接】Nanbeige4.2-3B项目地址: https://ai.gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.jsqmd.com/news/1268964/

相关文章:

  • G-Helper完整教程:轻量级华硕笔记本控制工具终极指南
  • AtmanOS实战教程:3步编译并部署你的第一个Xen unikernel应用
  • 【音视频】局域网搭建推流测试平台 SRS+FFmpeg
  • OmenSuperHub技术解密:如何彻底掌控你的惠普游戏本性能
  • Unity游戏逆向工程神器:Il2CppDumper完全使用指南
  • 5大核心功能彻底解放双手:M9A重返未来1999自动化助手完全指南
  • 亳州医药行业从业者:2026电大中专中药/药剂专业火热报名中,符合执业药师报考资格 - 最新资讯
  • 车载以太网故障注入怎么做?网准通NetAccura网络损伤仪“混沌之桥”实战
  • 终极指南:3步批量下载国家中小学智慧教育平台电子课本PDF
  • 南京美妆个护行业GEO城市合伙人选型推荐哪家靠谱:代理方为什么要重点看技术壁垒与本地化交付能力? - 企业新闻快传
  • 3步掌握Godot逆向工具:PCK文件分析与游戏资源恢复完全指南
  • Theos跨平台构建系统:5分钟掌握iOS开发环境配置终极指南
  • 基于Java+MySQL+SSM家政公司服务平台的设计与实现
  • 无人机集群仿真终极指南:10分钟掌握XTDrone多机编队控制
  • Linux内存管理:脏页回写与交换机制深度解析
  • Wand-Enhancer:如何本地解锁Wand游戏修改器的完整功能?
  • 解决Flutter列表性能瓶颈:infinite_scroll_pagination高级优化技巧
  • 2026哈尔滨呼兰区名包回收,爱马仕、香奈儿、LV保值率怎样,六大实体门店就近变现 - 肉松卷
  • Leetcode 300. 最长递增子序列
  • 角色扮演提示词模板全拆解,深度还原ChatGPT企业级Agent底层Prompt架构逻辑
  • Auto_Simulated_Universe:基于图像识别与OCR的游戏自动化框架技术解析
  • 无人机固件降级终极指南:如何用DankDroneDownloader重获设备控制权
  • RustGLM SDK:智谱 AI 自然语言大模型 Zhipu ChatGLM Rust SDK
  • 南京品牌出海赛道,GEO城市合伙人选型推荐哪家靠谱?技术、权益与收益三维透视 - 企业新闻快传
  • TMS320F240xA DSP时钟、低功耗与GPIO实战配置与避坑指南
  • 端到端AI视频不是“点按钮”,而是“调神经环路”:基于Transformer-LSTM混合架构的实时渲染延迟压测报告(实测<117ms端到端抖动)
  • 使用up8ai.com部署Codex中转API
  • 如何高效使用Python大麦网自动抢票工具:实战配置与优化指南
  • 计算机Django毕设实战-基于 Python Web 的网络化在线考核平台设计 轻量化校园在线考试题库管理系统实现【完整源码+LW+部署说明+演示视频,全bao一条龙等】
  • AI云原生实战10-K8s HPA撑不住了?KEDA事件驱动让AI推理服务缩容到0,GPU成本砍半