当前位置: 首页 > news >正文

vllm 大模型启动缓存相关环境变量 export

你设置的这些环境变量,本质上是在把默认缓存目录从/root/.cache改到指定目录

逐个解释:

环境变量控制内容默认目录(未设置时)你现在设置后
HF_HOMEHugging Face 模型/Tokenizer 缓存/root/.cache/huggingface/hyperai/input/input0/hub
VLLM_CACHE_ROOTvLLM 编译缓存/root/.cache/vllm/local_nvme/vllm_cache
FLASHINFER_CACHE_DIRFlashInfer CUDA kernel 编译缓存/root/.cache/flashinfer/local_nvme/flashinfer_cache
TORCHINDUCTOR_CACHE_DIRPyTorch Inductor 编译缓存/tmp/torchinductor_<user>或用户 cache 目录(版本有关)/local_nvme/torch_cache
TRITON_CACHE_DIRTriton kernel 缓存~/.triton/cache/local_nvme/triton_cache

1. HF_HOME

你设置:

export HF_HOME=/hyperai/input/input0/hub

原来:

/root/.cache/huggingface/

里面通常:

/root/.cache/huggingface/ ├── hub/ │ ├── models--xxx │ └── snapshots/ ├── assets/ └── datasets/

设置后:

/hyperai/input/input0/hub/ ├── models--unsloth--Qwen3.6-27B-NVFP4/ │ └── snapshots/ │ └── ccdaab7... │ ├── config.json │ ├── model.safetensors │ └── tokenizer.json

你现在这个:

models--unsloth--Qwen3.6-27B-NVFP4

就是 HF cache 格式。


2. VLLM_CACHE_ROOT

你设置:

export VLLM_CACHE_ROOT=/local_nvme/vllm_cache

原来:

/root/.cache/vllm/

例如:

/root/.cache/vllm/ └── torch_compile_cache/ └── cca9c83bef/ └── rank_0_0/ └── backbone/

设置后:

/local_nvme/vllm_cache/ └── torch_compile_cache/ └── cca9c83bef/ └── rank_0_0/

保存:

  • torch.compile graph

  • vLLM 编译产物


3. FLASHINFER_CACHE_DIR

你设置:

export FLASHINFER_CACHE_DIR=/local_nvme/flashinfer_cache

原来:

/root/.cache/flashinfer/

你之前看到:

/root/.cache/flashinfer/0.6.12/120f/

设置后:

/local_nvme/flashinfer_cache/ └── 0.6.12/ └── 120f/ └── cached_ops/ └── fp4_gemm_cutlass_sm120/

这里就是:

你的:

Qwen3.6-27B-NVFP4

启动时编译的:

FP4 GEMM kernel

4. TORCHINDUCTOR_CACHE_DIR

你设置:

export TORCHINDUCTOR_CACHE_DIR=/local_nvme/torch_cache

原来可能:

/tmp/torchinductor_root/

或者:

/root/.cache/torch/

保存:

PyTorch 2.x:

torch.compile | v TorchDynamo | v Inductor | v 生成CUDA代码

例如:

/local_nvme/torch_cache/ ├── fxgraph/ ├── triton/ └── xxx.so

5. TRITON_CACHE_DIR

你设置:

export TRITON_CACHE_DIR=/local_nvme/triton_cache

原来:

/root/.triton/cache

保存:

Triton kernel:

例如:

attention kernel layernorm kernel matmul kernel

结构:

/local_nvme/triton_cache/ ├── xxx/ │ └── kernel.so

你的最终目录结构大概会变成

推荐:

/local_nvme/ | ├── vllm_cache/ │ └── torch_compile_cache/ | ├── flashinfer_cache/ │ └── 0.6.12/ | ├── torch_cache/ │ └── triton_cache/ /hyperai/input/input0/ | └── hub/ └── models--unsloth--Qwen3.6-27B-NVFP4/

关系:

模型 | v HF_HOME -----------------> safetensors权重 启动vLLM | +---- FlashInfer | | | v | FLASHINFER_CACHE_DIR | +---- torch.compile | | | v | VLLM_CACHE_ROOT | +---- Triton | v TRITON_CACHE_DIR

针对你现在的RTX PRO 6000 + Qwen3.6-27B-NVFP4,这个设置是合理的:

  • /hyperai/input/input0/hub:可以共享(模型)

  • /local_nvme/*cache:每台 GPU 节点独立保存(编译产物)

这样既避免重复下载模型,也避免不同 GPU 节点之间污染 CUDA kernel 缓存。

http://www.jsqmd.com/news/1241598/

相关文章:

  • SpringBoot异步事件总线设计与实战
  • LLM推理延迟飙升,如何用eBPF+Py-Spy精准捕获Python层热函数,,实时性能诊断三步法
  • 慢性前列腺炎治疗误区与科学抗炎策略
  • Python AI开发必备的5个核心库解析
  • 万万没想到,程序员失业后,都跑去干这些行当
  • macOS与iOS 26.5.2更新解析与升级指南
  • 模拟黑客特效网站合集!新手从零玩转,建议完整收藏
  • 靠谱的礼品代发平台优势
  • 答辩紧急救命!Okbiye AI PPT实操教程|10秒生成学术答辩PPT+逐字稿✅
  • 大语言模型路由器:动态调度优化API成本与性能
  • VLAN 技术
  • 2026留学生求职机构评测:靠谱品牌推荐与实用选择攻略 - 极欧测评
  • AI节日视频生成器深度测评:5大平台实测对比,仅1家支持方言语音+动态水印+自动合规审核
  • C语言指针核心原理与高效应用指南
  • 广东AI获客代理多少钱?GEO优化工具价格详解 - 红枫叶GEO优化公司
  • 电影预告片制作技术工作流:从素材管理到专业输出
  • TI C2000 DSP开发实战:F2802x头文件库架构解析与工程集成指南
  • 笔记本电脑关机与睡眠模式选择指南:效率与硬件寿命的平衡
  • sqli-labs之Kali搭建靶场环境
  • 欧米茄广州售后维修服务中心|广州欧米茄手表维修售后服务中心热线 + 售后电话 400-883-8097 (2026 年 7 月 最新公布) - 欧米茄中国售后中心
  • 金融分析师:研报上的红色批注,让我重新理解工作
  • Jacobian Lens与J-space:探索LLM内部潜在意图的5大属性与8组实验
  • 湖南省GEO优化代理覆盖哪些城市?AI搜索优化服务区域详解 - 红枫叶GEO优化公司
  • 戴尔维修信任缺口破解:2026年上海戴尔笔记本进水维修中心权威测评 - 苹果手机电脑维修
  • AI写作赛道突围指南:从0到1拆解Top 5爆款账号的底层模型、提示词库与发布节奏(内部数据首次披露)
  • 参考文献格式错误率超41%?——用RAG+Schema-aware Parsing实现IEEE/AMA/APA一键合规(附可运行Python微服务脚本)
  • 微信公众号自动化发布:n8n工作流实践指南
  • EMIFA接口驱动NAND Flash实战:硬件连接、EDMA传输与ECC校验详解
  • 西双版纳回收足金 999,鑫清黄金珠宝,零手续费,无隐形扣费 - 清奢黄金上门回收
  • 在线销售自行车网站的设计与实现