Thor 上手第一天 Checklist
文章目录
- 1. 第一天目标
- 2. 认板与供电
- 3. 刷机
- 3.1 材料
- 3.2 安装顺序(DevKit)
- 3.3 刷完立刻记版本
- 4. 登录与网络
- 5. 功耗与温度
- 6. 算力路径冒烟
- 7. Docker
- 8. 磁盘与内存
- 9. 不要从 Orin 硬搬的东西
- 10. 常见坑
- 11. 收工检查
- 12. 下一步
- 13. 小结
摘要:Thor 不是 Orin 换皮。封装不兼容,软件走 JetPack 7 / CUDA 13 / SBSA,刷机也常变成「U 盘装系统」而不是老一套 recovery。本文按第一天顺序写:认板与供电、ISO 刷机、登录网络、功耗温度、算力样例、磁盘与 Docker,以及不要从 Orin 硬搬什么。适合刚到手的 Jetson AGX Thor 开发者套件。步骤以 NVIDIA Quick Start 与当前 JetPack 文档为准。
1. 第一天目标
第一天只建立基线,不堆业务:
- 能稳定开机、登录,网络和磁盘正常
- 记下 JetPack / L4T 版本,后面装组件和容器才有依据
- 功耗档和温度看过一眼
- CUDA / TensorRT 至少有一条官方路径能跑
检测、大模型、Isaac、自研工程,都放到这些确认之后。环境没捋清就搬 Orin 上的镜像和引擎,后面半天都在猜:是板子问题,还是软件代际问题。
官方入口:
- AGX Thor Quick Start
- BSP Setup(ISO / SDK Manager / flash 脚本)
- JetPack 下载页
2. 认板与供电
本文默认是Jetson AGX Thor Developer Kit(常见集成T5000、板载大容量 NVMe)。量产模组加载板的接口与供电以载板手册为准,不要把 DevKit 假设原样搬过去。
开箱先记下:
| 项 | 建议记下的内容 |
|---|---|
| 模组 | T5000 / 其他 SKU,内存容量 |
| 存储 | 系统是否在 NVMe,容量多少 |
| 电源 | 是否使用套件标配 USB-C 电源 |
| 散热 | 风扇能否转,风道有没有被挡 |
| 软件目标 | 计划安装的 JetPack 大版本 |
和 Orin 比,第一天最容易翻车的是供电与散热。Thor 功耗可配置区间更高(公开材料常见约 40W~130W 量级),标配电源不是装饰。官方 Quick Start 也强调优先用套件电源。电源偏弱时,表现可能是随机重启、USB 掉线、文件系统异常,看起来像软件坏了。
另外记住:Thor 与 Orin无针脚兼容。载板、外壳、供电方案不能按「Orin 换模组」理解。选型背景见同目录《Jetson Orin 和 Thor 怎么选》《NVIDIA Jetson Thor 简介》。
3. 刷机
JetPack 7 起,开发者套件常见路径是制作 Jetson ISO 安装 U 盘 → 装到 NVMe,不一定非要一台符合版本要求的 Ubuntu 主机 + SDK Manager。Windows / Mac / Linux 主机都可以先做 U 盘。
3.1 材料
- 主机:至少约 25GB 空闲空间(下 ISO)
- U 盘:16GB 及以上
- 写盘工具:如 Balena Etcher(不能只是把 ISO 文件复制进 U 盘)
ISO 从 JetPack 下载页 取面向 AGX Thor 的当前版本,不要拿过期镜像硬装。
3.2 安装顺序(DevKit)
- 接显示器 / 键鼠,或按文档走 Debug 串口的 headless 流程
- 插入安装 U 盘,接上标配电源,按电源键开机
- 若提示QSPI capsule update,按Y,等更新完成;不要跳过
- 安装菜单优先选Install on NVMe
- 装完重启前拔掉安装 U 盘,否则可能再次进安装盘
- 进入
oem-config:用户、密码、时区、网络
细节、重装注意项、UEFI 兼容性以 Quick Start 为准。需要 SDK Manager 或Linux_for_Tegra脚本时,看 BSP Setup。
3.3 刷完立刻记版本
cat/etc/nv_tegra_releaseuname-a# 包名随版本可能变化,以镜像实际为准dpkg-l|rg-i"nvidia-jetpack|nvidia-l4t"把输出贴进一个小文本:型号、内存、JetPack/L4T、安装日期。后面装 CUDA 组件、拉容器、对论坛,都靠这份基线。
注意:ISO 路径往往先把BSP(Jetson Linux)装上;CUDA、TensorRT 等 JetPack 组件是否已齐全,要以当前文档的JetPack SDK Setup为准。第一天发现nvcc/ TensorRT 不在,优先补官方组件,不要按 x86 方式重装一份 CUDA。
4. 登录与网络
datetimedatectl statusipaddrping-c38.8.8.8时间不对,下证书、拉包、拉容器都可能怪到别处。只用 ssh 时:
- 记下 IP;路由器里做 DHCP 绑定或静态地址
- 大文件尽量让板子自己拉,少经笔记本中转
- 公司网有代理,第一天就把 apt / Docker 代理设好
Thor DevKit 网络口比常见 Orin 套件更丰富(例如多千兆 / QSFP 等,以载板为准)。第一天有线能通即可;高速相机、Holoscan Sensor Bridge、25GbE 类链路放到环境稳后再接,少一次变量。
远程桌面可以后做。第一天能 ssh、能拷文件、能跑样例就够。图形远程更占资源,也更容易把「环境不通」和「桌面卡」搅在一起。
5. 功耗与温度
tegrastatssudonvpmodel-qsudonvpmodel-p空载看一两分钟,确认风扇在转。字段名随 JetPack 可能变化,温度与 GPU 相关项看懂即可。
写测试记录时带上功耗档。同一模型在不同档位上差一截很正常。闷壳、风道堵、标配风扇被替换成静音方案时,高档位空转也可能降频或保护重启——DevKit 开放散热上的数字,不能直接写成量产指标。
jetson_clocks一类锁频手段,第一天知道存在即可,不必一上来锁满。先摸清模式和温度,再谈锁频。
6. 算力路径冒烟
目标不是跑通业务模型,而是证明加速栈在:
nvcc--versionnvidia-smi python3-c"import tensorrt as trt; print(trt.__version__)"Thor 走 SBSA / 更接近服务器语义的软件路线,nvidia-smi等工具的表现可能比老 Jetson 更「像独显」。以你当前 JetPack 实际输出为准;命令不存在或权限不对时,先回到 JetPack 组件是否装全。
建议再做一件:
- 跑一个官方 CUDA sample,或
- TensorRT 自带小例子
样例失败时的排查顺序:
- JetPack 组件是否装全
- 功耗档是否过低,或已经热降频
df -h是否磁盘满- 是否把 x86 / 旧 Orin 的 wheel、引擎、容器硬搬过来
第一天不要编译大型开源仓库,也不要按桌面 PC 教程重装 CUDA。官方路径通了,再上 YOLO、VLM、Isaac。
7. Docker
不用容器可跳过。要用则先做 smoke test:
dockerversion# 镜像标签必须匹配当前 JetPack / L4T,不要用桌面 x86 镜像dockerrun--rm--runtimenvidia<匹配当前版本的L4T镜像>nvidia-smi注意:
- runtime 没配好时,容器能起、GPU 不可用
- Orin 上能用的 L4T 镜像,不能默认拿到 Thor 上复用
- 镜像很大,先看磁盘与网络
Docker 数据目录默认常在系统盘。有独立数据分区时,第一天就可以规划镜像与容器层放哪,避免两周后满盘伪装成各种 GPU 故障。
8. 磁盘与内存
df-hfree-hlsblkDevKit 常见大容量 NVMe,但仍建议:
- 系统与大数据(模型、数据集、Docker 层)分区或分目录清楚
- 系统分区只剩几个 G 时,
apt、拉镜像、导引擎都会突然失败 - 日志(
journalctl、Docker 日志、自己的 debug)也会吃盘
内存通常远高于 Orin Nano/NX,第一天仍别同时开:远程大桌面 + 多容器 + 本机大编译 + 无节制拉模型。基线清爽,后面压测才有对照。
9. 不要从 Orin 硬搬的东西
| 类别 | 原因 |
|---|---|
TensorRT.engine | 绑定 GPU 架构与 TensorRT 版本 |
| 旧 L4T / JetPack 5·6 容器 | 用户态与驱动代际不同 |
| 按 Orin 写死的刷机习惯 | Thor 常见 ISO U 盘安装,细节已变 |
| 「换模组升级」的结构假设 | 封装与供电不兼容 |
| 把 Orin 上的峰值 FPS 当 Thor 合同指标 | 负载类型与软件栈都不同 |
Orin 上的算法与数据可以迁;运行时产物按目标板重建。第一天就把这条边界划清,后面少吵两天。
10. 常见坑
| 现象 | 多见原因 | 处理 |
|---|---|---|
| 装完又进安装盘 | 没拔 U 盘 | 拔掉安装盘再启动 |
| 卡在 QSPI / 固件提示 | 跳过了 capsule update | 重来并按 Y 等完成 |
| 无显示(经 KVM) | 部分 KVM 不兼容 | 显示器直连试 |
nvcc/ TensorRT 没有 | 只装了 BSP,组件未装全 | 按 JetPack SDK Setup 补 |
| 容器无 GPU | runtime 或镜像标签不对 | 查 Docker 与 L4T 标签 |
| 随机重启、USB 掉 | 供电不稳 | 先换标配电源与线 |
| 样例异常慢 | 功耗档低、降频、实际走 CPU | 看nvpmodel与温度 |
| 按 Orin 教程硬套 | 版本与架构假设错误 | 回到 Thor 当前文档 |
第一天尽量少做:无目的full-upgrade、按 x86 重装 CUDA、并行堆多个互相打架的 Python 环境、封闭壳里最高档空转很久。
11. 收工检查
- 能稳定登录(屏幕或 ssh)
- JetPack / L4T 版本已记下
- 系统在 NVMe 上,磁盘空间够用
- 当前
nvpmodel清楚 tegrastats看过温度与风扇nvidia-smi/ CUDA / TensorRT 至少一条路径冒烟通过- 用 Docker 的话,匹配镜像的 GPU 测试过
- 明确:不从 Orin 拷引擎和旧容器当第一依赖
几人共用板时,把型号、内存、JetPack、功耗档、数据目录、基础镜像标签放进同一份小文档。
12. 下一步
环境稳了再往下,按你的目标选一条:
- 视觉检测:本板重建 TensorRT 引擎,再谈 DeepStream
- 端侧大模型 / VLM:先小模型打通内存与吞吐,再上业务模型
- 机器人 / Physical AI:再接 Isaac、相机与高速传感链路
相机、QSFP、多模型并发,都不是第一天必选项。先保证「版本、供电、磁盘、加速路径」比较清楚了。
13. 小结
Thor 第一天不着急上业务,而是把供电、ISO/BSP、版本、功耗档、官方算力路径摸清楚,并接受它和 Orin 不是同一套搬迁假设。这几样清楚了,后面上模型与传感,问题更好处理。
命令与包名随 JetPack 会变;对不上就查当前官方文档,不要用旧 Orin 教程硬套。
