当前位置: 首页 > news >正文

Gemma 4 全系列本地部署指南

2026年4月,Google DeepMind 发布了 Gemma 4 模型家族,这是继 Gemma 3 之后又一次重大升级。本次发布的最大亮点是采用了 Apache 2.0 开源协议——终于,商用无障碍,没有合成数据限制,也没有使用场景约束。

四个版本覆盖了从移动设备到服务器的全场景需求,31B 版本更是登上了 Arena AI 开源排行榜前三,AIME 2026 数学基准达到 89.2%,相比上代提升超过四倍。本文详细介绍如何将这些模型部署到本地环境。

先搞明白四个型号怎么选

你的电脑能不能跑

型号4-bit8-bitBF16

E2B

4 GB

5-8 GB

10 GB

E4B

5.5-6 GB

9-12 GB

16 GB

26B-A4B

16-18 GB

28-30 GB

52 GB

31B

17-20 GB

34-38 GB

62 GB

💡提示:总内存(RAM + 显存)应至少超过量化模型大小。如果内存紧张,优先选择更小的量化版本。

三种部署方式对比

方式一:Ollama(最简单)

Ollama 是目前最流行的本地 LLM 运行工具,支持一键下载和运行模型,跨平台支持 Windows、macOS、Linux,API 兼容 OpenAI 格式。

安装 Ollama

# macOS 和 Linux curl -fsSL https://ollama.ai/install.sh | sh # Windows 访问:ollama.com/download

运行 Gemma 4

# 根据内存选择版本 ollama run gemma:2b # E2B,4GB+ ollama run gemma:4b # E4B,6GB+ ollama run gemma:27b # 26B MoE,18GB+ ollama run gemma:31b # 31B,20GB+

API 调用

curl http://localhost:11434/api/generate -d '{ "model": "gemma:2b", "prompt": "用一句话解释大语言模型", "stream": false }'

方式二:llama.cpp(性能更优)

如果你对推理性能有更高要求,或者需要 GPU 加速,llama.cpp 是更好的选择。它是纯 C/C++ 实现,内存占用更低,支持 CUDA 加速。

编译 llama.cpp

# 安装依赖 apt-get update && apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y # 克隆并编译(GPU 版本) git clone https://github.com/ggml-org/llama.cpp cd llama.cpp cmake -B build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON cmake --build build --config Release -j --clean-first --target llama-cli llama-server # CPU 版本改为 -DGGML_CUDA=OFF

下载并运行

# 下载 Unsloth 优化的 GGUF 模型 pip install huggingface_hub hf_transfer huggingface-cli download unsloth/gemma-4-26B-A4B-it-GGUF \ --local-dir ./models/gemma-4-26B-A4B-it-GGUF \ --include "*UD-Q4_K_XL*" # 运行推理 ./llama-cli -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \ --temp 1.0 --top-p 0.95 --top-k 64

方式三:Mac MLX(苹果芯片专用)

如果你使用的是 Apple Silicon Mac(M1/M2/M3/M4/M5 芯片),可以用 MLX 框架获得原生加速。Ollama 底层其实也是调用 MLX,但这种方式可以更灵活地控制参数。

# 安装 MLX 版本 curl -fsSL https://raw.githubusercontent.com/unslothai/unsloth/main/install_gemma4_mlx.sh | sh source ~/.unsloth/unsloth_gemma4_mlx/bin/activate # 运行模型 python -m mlx_lm chat --model unsloth/gemma-4-E4B-it-UD-MLX-4bit python -m mlx_lm chat --model unsloth/gemma-4-31b-it-MLX-8bit

Apple Silicon Mac 上的 MLX 加速体验

型号4-bit8-bit

31B

gemma-4-31b-it-UD-MLX-4bit

gemma-4-31b-it-MLX-8bit

26B-A4B

gemma-4-26b-a4b-it-UD-MLX-4bit

gemma-4-26b-a4b-it-MLX-8bit

E4B

gemma-4-E4B-it-UD-MLX-4bit

gemma-4-E4B-it-MLX-8bit

E2B

gemma-4-E2B-it-UD-MLX-4bit

gemma-4-E2B-it-MLX-8bit

推荐参数配置

⚠️注意:不要使用 CUDA 13.2 运行时运行 GGUF,会导致输出质量差。

思考模式(Thinking Mode)

Gemma 4 支持 Chain-of-Thought 思考模式,会在回答前先展示推理过程。

# 启用思考模式 <|think|> You are a precise reasoning assistant. # 禁用思考 --chat-template-kwargs '{"enable_thinking":false}

多模态能力

E2B、E4B、26B-A4B 支持图片输入(31B 暂不支持视觉功能)。llama.cpp 运行多模态需要同时加载主模型和视觉投影器:

./llama-cli \ --model ./models/gemma-4-26B-A4B-it-GGUF/UD-Q4_K_XL.gguf \ --mmproj ./models/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \ --temp 1.0 --top-p 0.95

快速对照表

场景推荐方案最低内存

新手尝鲜

Ollama

4 GB

Mac 用户

MLX

8 GB

追求性能

llama.cpp + CUDA

16 GB

满血体验

llama.cpp + 31B

20 GB

http://www.jsqmd.com/news/631796/

相关文章:

  • 2026诚信古树茶TOP5推荐:普洱古树茶/普洱白茶/普洱红茶/普洱茶/云南古树茶/云南普洱荼/古树白茶/古树红茶/选择指南 - 优质品牌商家
  • 2026年质量好的铁塔口碑好的厂家推荐 - 行业平台推荐
  • HifiGAN实战:如何用Python在本地快速搭建高质量语音合成环境(附代码)
  • PX4 EKF滤波效果不好?别只盯着Q和R,这些隐藏参数和传感器预处理同样关键
  • 异步知识库索引管线:与在线问答链路解耦架构介绍(离线构建,在线查询)分层索引、Elasticsearch
  • Adafruit Arcada库:嵌入式游戏开发的硬件抽象实践
  • 2026年Q2塑料管道核心供应商名录及能力评测:公元暖通、公元服务、公元燃气、公元电线、公元空气能、公元管道好吗选择指南 - 优质品牌商家
  • 麒麟V10系统下微信PC版安装与系统升级全攻略
  • 2026年热门移动厕所技术解析:座式移动公厕、流动移动厕所租赁、环保移动公厕、移动公厕租赁、节能移动厕所租赁、连排移动公厕选择指南 - 优质品牌商家
  • 国际半导体展会推荐:2026年优质国际半导体展会推荐精选 - 品牌2026
  • OpenCV直方图均衡化翻车实录:彩色图直接均衡化为什么效果差?正确姿势在这里
  • Keil5工程瘦身指南:除了`.bat`脚本,还有哪些清理工作空间的高效方法?
  • 集成电路行业展会哪家好?值得参与的集成电路行业展会详细盘点 - 品牌2026
  • RSA 算法介绍
  • 保姆级教程:用STM32F407ZGT6的HAL库驱动火焰传感器,从CubeMX配置到代码调试(附完整工程)
  • 你的SSH密钥可能已经过期了细
  • 联邦学习+差分隐私+可信执行环境,三重防护体系构建大模型数据安全护城河,2024最新工程实践全披露
  • 内网开发避坑指南:告别node_modules拷贝不全与压缩出错的实战方案
  • Arduino实战:从零到一构建DHT11/DHT22温湿度监测系统
  • LangGraph生产环境配置:高性能Agent系统的部署架构与运维要点
  • 语言的边界,与软件的命运秃
  • 别再只调参了!用Python给CFD/CAE仿真结果加个‘AI修正器’,精度提升看得见
  • 低代码平台能承载复杂业务吗?我用接口引擎验证了一下
  • 2026免费降AI率软件推荐TOP3:降到10%以下不是梦
  • OpenClaw 本地内存检索与 node-llama-cpp 的依赖关系深度解析
  • Agent-Sandbox UI 上线,来看看有哪些的功能是你经常使用的?馗
  • 意义行为原生论:自感痕迹论 ——应然与实然、舍得与承受、知行合一的系统阐释
  • ArcGIS密度分析实战:从点、线到核密度的全流程解析
  • 硬件设计实战--电源芯片异常烧毁的深层诊断与防护策略
  • Skills 编写学习融