当前位置: 首页 > news >正文

Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试

Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。

在能力方面,Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化,同时支持 MTP(Multi-Token Prediction)等推理加速技术,可结合 vLLM、SGLang 等主流推理引擎进行部署。

1. 登录 GPUStack 选择推理后端

测试环境:

  • 8 × H20-141G

2. 添加版本

点击添加版本(Add Version)

镜像名称:

vllm/vllm-openai:nightly

3. 点击部署,开始部署

Node 0 参数

--trust-remote-code --tokenizer-mode=inkling --kernel-config.enable_flashinfer_autotune=False --tensor-parallel-size=8--data-parallel-size=2--data-parallel-size-local=1--enable-expert-parallel --data-parallel-rpc-port=13389--data-parallel-address=10.91.3.213 --data-parallel-hybrid-lb --max-model-len=131072--max-num-seqs=10--enable-auto-tool-choice --tool-call-parser=inkling --speculative-config'{"method":"mtp","num_speculative_tokens":1}'--reasoning-parser=inkling

环境变量:

PYPI_PACKAGES_INSTALL=scipy==1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/

Node 1 参数

--trust-remote-code --tokenizer-mode=inkling --kernel-config.enable_flashinfer_autotune=False --tensor-parallel-size=8--data-parallel-size=2--data-parallel-size-local=1--data-parallel-start-rank1--enable-expert-parallel --data-parallel-rpc-port=13389--data-parallel-address=10.91.3.213 --data-parallel-hybrid-lb --max-model-len=131072--max-num-seqs=10--enable-auto-tool-choice --tool-call-parser=inkling --speculative-config'{"method":"mtp","num_speculative_tokens":1}'--reasoning-parser=inkling

环境变量:

PYPI_PACKAGES_INSTALL=scipy==1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/

模型进入 Running 状态后,可以直接通过 GPUStack 试验场进行交互测试。

在默认配置下,Inkling 输出速度达到80+ Tokens/s,能够正常完成多轮文本对话,并支持思考过程解析。

同时支持原生多模态能力。

4. 测评

测试配置:

  • Input Length:64K
  • Output Length:3K
  • Requests:10

测试结果如下:

指标结果
Output Token Throughput56.10 tok/s
Peak Output Throughput78.00 tok/s
Total Token Throughput1253.09 tok/s
Mean TTFT92.77s
Mean TPOT97.09 ms/token

在长上下文输入场景下,Inkling 可以稳定完成 64K 上下文推理任务,并保持持续输出能力。

http://www.jsqmd.com/news/1241989/

相关文章:

  • (Python基础教程之八)Python中的list操作
  • 深入解析ISS CBUFF:嵌入式图像处理中的硬件环形缓冲与流量控制
  • Windows上安装APK的终极解决方案:告别模拟器的完整指南
  • ARM中断控制器与eCAP模块实战:嵌入式实时系统高精度时序测量
  • 医疗问答大模型的越狱:让模型开具违规处方的诱导路径
  • 汽车音响改装店口碑亲测汽车音响首推宁波尚音 - 米諾
  • 从ChatGPT写Hello World到生产环境API上线:一个需求的12小时AI开发实录(含完整日志与耗时拆解)
  • 【会议征稿通知 | 深圳理工大学主办 | ACM出版 | EI 、Scopus稳定检索】第三届智能计算与数据分析国际学术会议(ICDA 2026)
  • 新型电力系统红区光伏管控政策解读 防逆流在线监测防护体系 安科瑞软硬件一体化助力项目顺利并网
  • TI TMS320TCI6484/C6457 DSP硬件设计:电源、时钟与配置实战指南
  • 【小程序计算机毕业设计案例】Android 端在线答题练习与考试管理系统 智能化随机组卷模拟考试服务平台(程序+文档+讲解+定制)
  • Unity 2D雨夜场景实现:粒子系统与音频同步技术详解
  • AI搜索框架选型不是技术比武,而是业务对齐——17个关键问题清单帮你30分钟锁定最优解
  • 2026英国老牌留学机构排名盘点,梳理主流中介优缺点、避雷要点与申请服务特点 - 速递信息
  • 个人AI模型上手即用:无需GPU、不装Docker、5分钟完成本地部署(含Ollama+LM Studio双路径实操录屏要点)
  • 嵌入式系统SYSCFG模块与引脚复用配置深度解析
  • 聊城卖黄金铂金白银必看!新手常见问题解答,本地靠谱回收商家大盘点 - 不晚生活号
  • AI数据飞轮:高质量数据集的商业价值与技术实践
  • Runway背景替换响应延迟超800ms?工程师紧急修复的4层缓存优化链(含FFmpeg+WebGL协同调度代码)
  • 【会议征稿通知 | 北京经济管理职业学院支持 | AP出版 | CNKI稳定检索】第五届公共艺术与人文发展国际学术会议 (ICPAHD 2026)
  • SATA控制器寄存器配置实战:从PLL锁定到信号完整性优化
  • 低代码AI Agent框架Dify与Coze对比解析
  • 大模型部署实战:从硬件选型到性能优化
  • 新型电力系统配套技术:电梯能量回馈双向精算,支撑楼宇节能改造与碳资产台账申报
  • 【计算机Python毕业设计案例】智能食谱推荐与膳食健康管理系统设计 基于 Python + 数据分析的营养膳食系统(程序+文档+讲解+定制)
  • 2026 青岛本地上门收包包,下班周末,禹竞名奢汇均可上门鉴定 - 企业家观察员
  • 业财一体软件怎么选?2026年国内六大主流数智业财厂商深度盘点
  • 深入解析I2C总线寄存器:中断、DMA与GPIO配置实战
  • Playwright浏览器自动化:从环境配置到高级启动策略实战指南
  • Unity异步编程实战:深入理解async与await的应用技巧