T4 16G显卡最新Qwen3.8 27B初步安装测试
废话不多说,初步测试记录整理如下:
复刻Ollama应用
打开模板中心页面:https://cloudstudio.net/t
找到Ollama项后,点击【使用模板】按钮,或者直接打开应用【AI模板——Ollama - Cloud Studio】(https://cloudstudio.net/a/26997635105468416)后复刻,结果是一样的。这里读者直接复刻本人已经复刻好的应用Ollama-Qwen3.8 - Cloud Studio[https://cloudstudio.net/a/37595859894779904]就好了。
启动及升级应用环境
由于是最新版本的模型,这里需要升级一下ollama引擎。
curl -fsSL https://ollama.com/install.sh | sh
拉取模型运行
考虑到16GB显卡运行成本较低,这里特意选取大小合适性能不错的基于Unsloth Dynamic V3.0的UD-Q3_K_XL量化版本。
ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
测试默写长诗
总的说来,eval rate大约10 tokens/s。
root@8f17b6ae31ac(Qwen3.8):/workspace 2026-08-15 09:21:26+00 #
ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
>>> /show parameters
Model defined parameters:
stop "<|im_start|>"
stop "<|im_end|>"
stop "<think>"
stop "<|im_start|>user"
>>> /set nothink
Set 'nothink' mode.
>>> /set parameter temperature 0.1
Set parameter 'temperature' to '0.1'
>>> 你是谁
我是通义千问(Qwen),是由阿里巴巴集团通义实验室独立开发的大型语言模型。
我可以帮你解答问题、提供建议、进行创意写作、编写和调试代码、分析数据,或者只是陪你聊聊
天。
请问今天有什么我可以帮你的吗?
total duration: 6.224271694s
load duration: 423.265261ms
prompt eval count: 13 token(s)
prompt eval duration: 489.461ms
prompt eval rate: 26.56 tokens/s
eval count: 58 token(s)
eval duration: 5.308317s
eval rate: 10.93 tokens/s
>>> /bye
root@8f17b6ae31ac(Qwen3.8):/workspace 2026-08-15 09:23:25+00 #
ollama ps
NAME ID SIZE PROCESSOR CONTEXT UNTIL
hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL d389d2a85119 13 GB 100% GPU 4096 4 minutes from now
root@8f17b6ae31ac(Qwen3.8):/workspace 2026-08-15 09:23:28+00 #
```
## 文章默写测试之《春江花月夜》
```
root@8f17b6ae31ac(Qwen3.8):/workspace 2026-08-15 09:23:28+00 #
ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
>>> 《春江花月夜》
Thinking...
【此处省略部分】
...done thinking.
你是指唐代张若虚的《春江花月夜》吗?这是中国古典诗歌中非常著名的一首乐府旧题诗,常被称作“孤
篇横绝”“孤篇盖全唐”。下面是全文与简要赏析:
## 《春江花月夜》
**唐·张若虚**
春江潮水连海平,海上明月共潮生。
滟滟随波千万里,何处春江无月明!
江流宛转绕芳甸,月照花林皆似霰。
空里流霜不觉飞,汀上白沙看不见。
江天一色无纤尘,皎皎空中孤月轮。
江畔何人初见月?江月何年初照人?
人生代代无穷已,江月年年望相似。
不知江月待何人,但见长江送流水。
白云一片去悠悠,青枫浦上不胜愁。
谁家今夜扁舟子?何处相思明月楼?
可怜楼上月徘徊,应照离人妆镜台。
玉户帘中卷不去,捣衣砧上拂还来。
此时相望不相闻,愿逐月华流照君。
鸿雁长飞光不度,鱼龙潜跃水成文。
昨夜闲潭梦落花,可怜春去不复还。
江水流春去欲尽,江潭落月复西斜。
斜月沉沉藏海雾,碣石潇湘无限路。
不知乘月几人归,落月摇情满江树。
---
## 简要赏析
这首诗以“春、江、花、月、夜”五个意象为核心,把自然景色、人生哲理与离愁别绪融合在一起。
### 1. 开篇气势宏大
“春江潮水连海平,海上明月共潮生。”
春潮浩荡,月光随潮水升起,视野辽阔,意境开阔,一下子把读者带入一个宏大而清明的夜晚。
### 2. 月色之美极尽清丽
“滟滟随波千万里,何处春江无月明!”
月光洒满江面,随波荡漾,无处不在。这里写的是视觉之美,也有一种无处不在的思念之情。
### 3. 由景入理,追问宇宙人生
“江畔何人初见月?江月何年初照人?”
诗人由眼前明月联想到人类与宇宙的关系:人生短暂,代代更替;而江月恒久,年复一年。
### 4. 离情与相思贯穿全诗
后半部分转入具体的人情:
“谁家今夜扁舟子?何处相思明月楼?”
一边是漂泊在外的游子,一边是楼上思念的闺人。月光成为连接两地情感的媒介。
### 5. 结尾余韵悠长
“不知乘月几人归,落月摇情满江树。”
月亮落下,情思却仍在江树间摇荡。结尾不直接说愁,却把愁思写得弥漫、深远、余味无穷。
---
这首诗最动人之处,在于它不是单纯写景,也不是单纯抒情,而是把**自然之美、生命之思、离别之情
**融为一体,语言清丽,意境空明,是中国诗歌中极具代表性的名篇。
total duration: 3m17.50365817s
load duration: 414.802759ms
prompt eval count: 58 token(s)
prompt eval duration: 716.266ms
prompt eval rate: 80.98 tokens/s
eval count: 1866 token(s)
eval duration: 3m16.113149s
eval rate: 9.51 tokens/s
>>> Send a message (/? for help)
32G V100下速度超过30t/s
ollama show hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
total duration: 4.526492467s
load duration: 424.568082ms
prompt eval count: 53 token(s)
prompt eval duration: 1.368403s
prompt eval rate: 38.73 tokens/s
eval count: 99 token(s)
eval duration: 2.729842s
eval rate: 36.27 tokens/s
>>>
显卡相关
root@fa50b9ca797b(Qwen3.8):/workspace 2026-08-15 09:41:34+00 #
ol ps
NAME ID SIZE PROCESSOR CONTEXT UNTIL
hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL d389d2a85119 15 GB 100% GPU 32768 4 minutes from now
root@fa50b9ca797b(Qwen3.8):/workspace 2026-08-15 09:41:38+00 #
nv
Sat Aug 15 09:41:52 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.65.06 Driver Version: 580.65.06 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 Tesla V100-SXM2-32GB On | 00000000:00:0A.0 Off | 0 |
| N/A 38C P0 37W / 300W | 16107MiB / 32768MiB | 0% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| No running processes found |
+-----------------------------------------------------------------------------------------+
root@fa50b9ca797b(Qwen3.8):/workspace 2026-08-15 09:41:52+00 #
注意事项
上下文长度
如果上下文过长,导致暴显存就会速度明显下降,可以使用下面命令限制较小的尺寸。
>>> /set parameter num_ctx 8192
Set parameter 'num_ctx' to '8192'
>>>
在线预览
1分钟就能进入在线预览环境体验哦
打开
https://cloudstudio.net/a/37595859894779904
后,点预览数秒后启动环境,出现命令提示符。马上执行此命令行即可:
ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
测试记录
➜ /workspace cd /workspace/tools && sh ollama_start.sh
Creating log directory...
Starting Ollama service...
-e Ollama service is running
-e Log file: /workspace/logs/ollama.log
-e Recent logs:
time=2026-08-15T10:22:34.713Z level=INFO source=images.go:919 msg="total unused blobs removed: 0"
time=2026-08-15T10:22:34.713Z level=INFO source=routes.go:1990 msg="Listening on [::]:11434 (version 0.32.13)"
time=2026-08-15T10:22:34.716Z level=INFO source=runner.go:60 msg="discovering available GPUs..."
time=2026-08-15T10:22:35.618Z level=INFO source=model_list_cache.go:112 msg="model list cache hydration complete" models=3 failures=0 elapsed=904.678546ms
time=2026-08-15T10:22:35.981Z level=INFO source=model_recommendations.go:177 msg="model recommendations cache sleep scheduled" wait=4h1m32.182861324s consecutive_failures=0
➜ tools ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
>>> 你是谁
Thinking...
用户问“你是谁”,这是一个直接的自我介绍请求。我可以直接回答我是通义千问(Qwen),由阿里巴巴集团通义实验室研发
。回答应简洁、自然,不需要提及内部指令或版本信息。
...done thinking.我是通义千问(Qwen),由阿里巴巴集团通义实验室自主研发的大语言模型。我可以协助你进行问答、创作、逻辑推理、编
程等多类任务,也可以与你进行多轮对话。很高兴为你服务!total duration: 10.373439949s
load duration: 416.912759ms
prompt eval count: 53 token(s)
prompt eval duration: 1.195378s
prompt eval rate: 44.34 tokens/s
eval count: 95 token(s)
eval duration: 8.757272s
eval rate: 10.85 tokens/s
>>> Send a message (/? for help)
