当前位置: 首页 > news >正文

干货|Ubuntu 24.04 + AMD 7900 XTX 24G:Ollama 纯 Vulkan 加速部署(免 ROCm)

前言

 
Ollama 对 AMD 显卡默认依赖 ROCm,但配置复杂、依赖冲突多(你之前已遇)。7900 XTX (Navi31) 在 Ubuntu 24.04 可直接用 Ollama 内置 Vulkan 加速,免装 ROCm,24GB 显存满血跑 30B+ 模型,速度快、稳定性高。本文全命令、零废话、一步到位。
 

一、环境与优势

 
  • 硬件:AMD RX 7900 XTX 24GB(Navi31)
  • 系统:Ubuntu 24.04 LTS(桌面 / 服务器均可)
  • 加速:Ollama 原生 Vulkan(免 ROCm、免编译、免依赖地狱)
  • 效果:显存 24GB 全识别,GPU 100% 占用,跑 32B 量化模型流畅
  • 端口:11434(可局域网访问)
 

二、前置:系统与驱动(1 分钟)

 
Ubuntu 24.04 自带 AMD 开源驱动(RADV),完美支持 7900 XTX Vulkan。
 
bash
 
运行
 
 
 
 
# 1. 更新系统
sudo apt update && sudo apt upgrade -y# 2. 安装 Vulkan 基础库(必须,Ollama 依赖)
sudo apt install -y libvulkan1 mesa-vulkan-drivers vulkan-tools# 3. 验证 Vulkan(看到 7900 XTX 即成功)
vulkaninfo | grep "GPU"
 
 
输出含:Radeon RX 7900 XTX (RADV NAVI31)
 

三、安装 Ollama(官方脚本)

 
bash
 
运行
 
 
 
 
# 一键安装(官方)
curl -fsSL https://ollama.com/install.sh | sh# 安装后将用户加入 render 组(GPU 权限)
sudo usermod -aG render $USER
newgrp render
 
 

四、核心:启用 Vulkan 加速(关键!)

 
不设置则默认用 CPU。直接修改 systemd 服务:
 
bash
 
运行
 
 
 
 
# 编辑 Ollama 服务(覆盖配置)
sudo systemctl edit ollama.service
 
 
写入以下内容(直接复制):
 
ini
 
 
[Service]
# 强制启用 Vulkan(核心)
Environment="OLLAMA_VULKAN=1"
# 监听所有网卡(局域网访问)
Environment="OLLAMA_HOST=0.0.0.0:11434"
# 允许跨域(WebUI/客户端调用)
Environment="OLLAMA_ORIGINS=*"
# 取消 HSA 重写(避免干扰 Vulkan)
Environment="HSA_OVERRIDE_GFX_VERSION="
 
 
保存退出,重启服务:
 
bash
 
运行
 
 
 
 
sudo systemctl daemon-reload
sudo systemctl restart ollama
sudo systemctl enable ollama  # 开机自启
 
 

五、验证:7900 XTX Vulkan 生效(必查)

 
bash
 
运行
 
 
 
 
# 实时查看日志
journalctl -u ollama -f
 
 
关键成功行:
 
plaintext
 
 
inference compute" id=00000000-0300-0000-0000-000000000000 library=Vulkan name=Vulkan0 description="Radeon RX 7900 XTX (RADV NAVI31)" total="24.0 GiB" available="23.4 GiB"
 
 
  • ✅ 识别到 7900 XTX
  • ✅ 加速:Vulkan
  • ✅ 显存:24GB 全可用
  • ✅ 监听:0.0.0.0:11434(局域网可访问)
 

六、防火墙:放行 11434(局域网必备)

 
bash
 
运行
 
 
 
 
sudo ufw allow 11434/tcp
sudo ufw reload
 
 

七、跑模型:7900 XTX 24GB 推荐清单

 

1. 32B 级(24GB 完美)

 
bash
 
运行
 
 
 
 
# Qwen 2.5 32B 4-bit量化(速度最快、通用最强)
ollama run qwen2.5:32b-q4_K_M# 代码专用(你之前要的 coder)
ollama run qwen2.5-coder:32b-q4_K_M# Llama 3 70B 量化(极限,24GB 刚好)
ollama run llama3:70b-q4_K_M
 
 

2. 轻量(快速测试)

 
bash
 
运行
 
 
 
 
ollama run qwen2.5:7b  # 秒启
 
 

八、GPU 监控(确认满载)

 
bash
 
运行
 
 
 
 
# 安装监控工具
sudo apt install -y radeontop# 运行(跑模型时看 GPU 100%、显存 15–22GB)
radeontop
 
 

九、局域网访问(其他设备调用)

 
  1. 查本机 IP:
 
bash
 
运行
 
 
 
 
hostname -I  # 例:192.168.1.100
 
 
  1. 其他设备(Windows/macOS/Linux):
 
bash
 
运行
 
 
 
 
# 终端连接
export OLLAMA_HOST=http://192.168.1.100:11434
ollama run qwen2.5-coder:32b-q4_K_M# 网页测试
http://192.168.1.100:11434  # 显示 Ollama is running
 
 

十、常见问题(避坑)

 
  1. 仍用 CPU:
     
    • 必查:OLLAMA_VULKAN=1 已写入服务
    • 必做:sudo systemctl restart ollama
    • 验证:journalctl -u ollama -f 看 Vulkan 行
     
  2. 显存不足:
     
    • 用 q4_K_M 量化(32B 仅占~16GB)
    • 不要跑 fp16 原版(32B 需~64GB)
     
  3. 依赖报错(如之前 ROCm 冲突):
     
    bash
     
    运行
     
     
     
     
    # 彻底清理 ROCm(如装过)
    sudo apt purge -y rocm* amdgpu*
    sudo apt autoremove -y
    sudo rm -rf /etc/ld.so.conf.d/rocm.conf
    
     
     
 

十一、总结(一句话)

 
Ubuntu 24.04 + 7900 XTX:装 Vulkan 库 → 装 Ollama → 设 OLLAMA_VULKAN=1 → 重启,免 ROCm、24GB 满血、32B 流畅、局域网可用,5 分钟搞定。
 

 
要不要我把以上所有命令整合成一键脚本,你直接复制运行就能完成全部部署?
http://www.jsqmd.com/news/551380/

相关文章:

  • Sinkhorn算法实战:用Python手把手教你解决最优传输问题(附完整代码)
  • 3D Glow 风格的提示词革命:放弃随意堆砌描述,用这个 JSON 模板直接锁住高端辉光效果
  • GLM-4-9B-Chat-1M实战:vLLM部署教程+Chainlit前端搭建,一步到位
  • ollama部署本地大模型|granite-4.0-h-350m在智能硬件语音指令解析应用
  • Go 生态最快 JSON 库 - jsoniter
  • Windows用户福音:WSL2+Docker快速部署Coze Studio开源版(附常见错误解决方案)
  • 跨平台游戏画质增强工具:OptiScaler打破显卡壁垒的全方位解决方案
  • 前端文本布局的“最后一块地狱拼图”:纯 TypeScript 用户态测量算法,彻底解放 AI 时代的 UI 想象力
  • OpenClaw数据脱敏:Qwen3-VL:30B处理飞书敏感信息
  • oTranscribe:3个技巧让音频转录效率提升300%的免费开源工具
  • BGE-Large-Zh快速部署:Kubernetes集群中BGE-Large-Zh服务编排实践
  • CANoe CAPL编程:为什么你的#define在子文件中不生效?手把手教你正确使用作用域
  • AI图像放大神器Upscayl:告别模糊时代的终极解决方案
  • 终极bilibili视频解析指南:三步实现免费高效下载方案
  • 零代码自动化:OpenClaw+nanobot图形界面操作指南
  • 数学发现的“笔记本革命”:Axplorer 把 PatternBoost 塞进 MacBook,2.5 小时就找到 Turán 4-圈极值
  • 阿里云:数据分析Agent白皮书——AI重构数据消费 2026
  • RexUniNLU国产信创适配:麒麟OS+达梦数据库全栈国产化部署案例
  • 进程、线程与协程:并发执行模型的原理、权衡与实践
  • Chandra OCR 2的Docker Compose配置:多容器部署方案
  • UltraStar Deluxe免费K歌软件终极指南:5步打造家庭KTV系统
  • 突破macOS限制:Mac Mouse Fix如何彻底解决第三方鼠标兼容性难题
  • 手把手教你用51单片机+74HC154驱动16*16点阵,显示自定义汉字(附完整代码)
  • 从MATLAB到Python:脑网络连通性分析之PLI/wPLI的跨平台实现与结果对比
  • Untrunc终极指南:如何快速修复损坏的MP4视频文件
  • 百川2-13B-4bits量化版中文优势:OpenClaw本地化任务处理实测
  • 告别位置编码!用SegFormer+B0/B5在Cityscapes上实战语义分割(附PyTorch代码)
  • Reward Hacking实战:从扫地机器人到游戏AI,那些让人哭笑不得的‘聪明’行为
  • B站全量数据资产保护指南:从备份到价值挖掘的完整方案
  • 避坑指南:glmnet做lasso回归时分类变量的3个常见错误及解决方法