跳到主要内容

Qwen3.8-27B 部署

Qwen3.8-27B 是 Qwen 开源的多模态稠密(Dense)模型,于 2026-08-14 发布。

Qwen3.8-Flash-Next 是 Qwen 开源的多模态 MoE 模型,也是 Qwen4 预览,于 2026-08-26 发布。

原想看一下能不能部署 Flash,但没有个小集群是跑不起来了 😥,就算 Q4 量化也要上百 GB 显存。

所以,选择部署 Qwen3.8-27B 玩一下,256K 上下文,Q4 约 18 GB 显存。消费级显卡可部署。

怎么部署

部署方式很多,如下:

生产环境或多卡吞吐,推荐 SGLang 或 vLLM。个人单卡或本地使用,则用 llama 就行。

发现 Ollama 各量化版本模型很全,所以这里选此来部署。

Ollama 部署

安装部署,

# 下载 https://ollama.com/download
curl -fsSL https://ollama.com/install.sh | sh

# 验证
$ ollama -v
ollama version is 0.33.1

# 拉取,指明版本
# Q4_K_M 量化 ~18 GB
ollama pull qwen3.8:27b-q4_K_M
ollama pull qwen3.8:27b-mtp-q4_K_M # 多 Token 预测
# NVFP4 量化 ~18 GB (MLX)
# 适合 RTX 5090(利用五代 Blackwell FP4 核心加速)
# 但需 MLX 后端,linux 上还不完善,待其整合更新
ollama pull qwen3.8:27b-nvfp4

# 对话运行,指明版本
ollama run qwen3.8:27b-mtp-q4_K_M

# 停止服务(Linux)
sudo systemctl stop ollama

测试 OpenAI 兼容 API,

curl -X POST http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8:27b-mtp-q4_K_M",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "请用一句话解释什么是量子计算"}
],
"max_tokens": 100,
"temperature": 0.3
}'

# --- 以下为响应 ---
{"id":"chatcmpl-199","object":"chat.completion","created":1787895128,"model":"qwen3.8:27b-mtp-q4_K_M","system_fingerprint":"fp_ollama","choices":[{"index":0,"message":{"role":"assistant","content":"","reasoning":"用户要求用一句话解释什么是量子计算。需要简洁、准确、易懂。\n\n量子计算的核心:利用量子比特(qubit)的叠加态和纠缠等量子力学特性,进行信息处理,从而在某些问题上比经典计算机具有指数级加速优势。\n\n一句话要涵盖:\n- 利用量子力学原理(叠加、纠缠)\n- 用量子比特代替经典比特\n- 能解决某些经典计算机难以处理的问题\n\n我尽量用一句通顺的话表达"},"finish_reason":"length"}],"usage":{"prompt_tokens":27,"completion_tokens":100,"total_tokens":127}}

测试图像理解(也用 OpenAI 兼容 API),

# 下载图片
curl -L -o test.jpg "https://upload.wikimedia.org/wikipedia/commons/3/3a/Cat03.jpg"
# 编码图片(生成 Base64)
IMG=$(base64 -w 0 < test.jpg 2>/dev/null || base64 < test.jpg | tr -d '\n')
# 准备请求
cat > request.json <<EOF
{
"model": "qwen3.8:27b-mtp-q4_K_M",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片里的内容"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,${IMG}"}}
]
}
],
"max_tokens": 200,
"temperature": 0.5
}
EOF
# 测试请求
curl -X POST http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d @request.json

# --- 以下为响应 ---
{"id":"chatcmpl-393","object":"chat.completion","created":1787895371,"model":"qwen3.8:27b-mtp-q4_K_M","system_fingerprint":"fp_ollama","choices":[{"index":0,"message":{"role":"assistant","content":"这张图片是一只橘色(姜黄色)虎斑猫的特写照片。\n\n主要内容包括:\n\n- **主体**:一只橘猫,毛色为橙黄底色带有淡淡的虎斑条纹,胸前和下巴处毛色偏白。\n- **面部细节**:它有一双黄绿色的眼睛,瞳孔呈竖线状,眼神专注地望向镜头侧前方;鼻子是粉褐色的;嘴边伸出许多细长的白色胡须,向两侧和下方散开;两只耳朵竖立,耳内可见浅色绒毛。\n- **姿态**:猫的身体朝向画面左下方,头部抬起,神情警觉而平静。\n- **背景**:背景被虚化处理,呈浅","reasoning":"用户要求描述图片内容。我需要观察图片细节:一只橘色虎斑猫的特写,绿色眼睛,粉色鼻子,白色胡须,背景虚化,有红色线条状物体。直接组织成自然的中文描述即可,不需要冗长铺垫。"},"finish_reason":"length"}],"usage":{"prompt_tokens":2523,"completion_tokens":200,"total_tokens":2723}}

Agent 使用

Claude Code

Anthropic 兼容 API 见: https://docs.ollama.com/api/anthropic-compatibility

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_BASE_URL=http://localhost:11434

可以设上述环境变量,或者 CC Switch 加自定义配置就行了。

DeepSeek Harness

dsh 配置模型: https://deepseek-harness.github.io/deepseek-harness/guide/providers

打开设置 → 模型 → 添加自定义提供方,

会话输入框上选择 qwen 模型,

结语

Let's Go Coding ~