10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI学习教程

NAS 本地部署 llama.cpp 教程:Vulkan 核显加速,流畅运行 Qwen3.5 模型

1小时前 AI学习教程 9 0

llama.cpp 是一款纯 C/C++ 开发的开源大模型离线推理引擎,所有 AI 计算都在本地完成。支持 Linux、Windows、macOS 及多种 GPU 后端(CUDA、HIP、SYCL、Vulkan、WebGPU),提供 1.5–8 bit 量化能力。GitHub 上已有十多万 Star。

图片 1

安装

Docker Compose(纯 CPU 推理)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server
    container_name: llama
    ports:
      - 8080:8080
    volumes:
      - ./models:/models
    command:
      - "-m"
      - "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
    restart: always

Docker Compose(GPU 加速)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-vulkan
    container_name: llama
    ports:
      - 8080:8080
    volumes:
      - ./models:/models
    devices:
      - /dev/dri:/dev/dri
    command:
      - "-m"
      - "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
    restart: always

参数说明:

  • /models:存放模型的挂载路径
  • /dev/dri:透传核显设备
  • Qwen3.5-0.8B-Q4_K_M.gguf:根据实际模型名称填写

Docker Compose(根据设备情况特调)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-vulkan
    container_name: llama
    devices:
      - /dev/dri:/dev/dri
    ports:
      - "8080:8080"
    volumes:
      - ./models:/models
    command:
      - "-m"
      - "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
      - "--chat-template-kwargs"
      - '{"enable_thinking": false}'
      - "--gpu-layers"
      - "99"
      - "--threads"
      - "4"
    restart: unless-stopped

准备模型文件

第一步是准备 GGUF 格式的模型文件。国内用户可通过魔搭社区(ModelScope)下载,速度快且无需科学上网。

图片 2

在 ModelScope 中筛选格式为 GGUF 的模型,根据需求选择合适的模型:

图片 3

本次测试用到的模型:

  • https://www.modelscope.cn/models/unsloth/Qwen3.5-0.8B-GGUF
  • https://www.modelscope.cn/models/unsloth/Qwen3.5-2B-GGUF
  • https://www.modelscope.cn/models/unsloth/Qwen3.5-4B-GGUF

图片 4

使用

浏览器访问 http://NAS的IP:8080 即可看到 Web UI 界面。

图片 5

界面支持深色模式切换,右下角可上传文件资料作为上下文:

图片 6

图片 7

右下角显示当前运行模型,点击可查看参数详情:

图片 8

日常聊天使用 0.8B 模型时,回复速度可达 33.21 t/s:

图片 9

底部圆点指示上下文长度,点击可查看输入输出速度:

图片 10

点击模型可查看具体参数设置:

图片 11

支持添加 MCP 服务扩展功能:

图片 12

图片 13

llama.cpp 兼容 OpenAI 协议,按要求填写 URL 即可调用,密钥可随意填写:

图片 14

模型可正常识别和加载:

图片 15

其他工具首次调用时可能会嵌入提示词,回复稍慢:

图片 16

性能测试

测试目的:对比纯 CPU 与核显加速的差距,以及不同模型大小的表现。所有测试使用默认参数,关闭思考模式。

图片 17

测试硬件:12th Gen Intel Core i5-1235U + 32GB DDR5 4800MHz

测试对象:llama.cpp:server(纯 CPU)vs llama.cpp:server-vulkan(GPU 加速)

测试模型:Qwen3.5-0.8B / 2B / 4B(均为 Q4_K_M 量化)

测试问题:我们为什么存在?

纯 CPU 推理结果

模型 CPU GPU 内存 耗时 速度
Qwen3.5-0.8B 16% 0% 3592MB 22s 27.87 t/s
Qwen3.5-2B 16%-17% 0% 4093MB 45s 14.11 t/s
Qwen3.5-4B 16%-17% 0% 10800MB 1min 46s 6.41 t/s

GPU 加速(Vulkan)结果

模型 CPU GPU 内存 耗时 速度
Qwen3.5-0.8B 6%-9% 29% 4569MB 17s 31.08 t/s
Qwen3.5-2B 5%-7% 99% 5906MB 40s 17.33 t/s
Qwen3.5-4B 4%-5% 100% 12563MB 1min 11s 8.57 t/s

GPU 加速(特调参数)结果

模型 CPU GPU 内存 耗时 速度
Qwen3.5-0.8B 6% 99% 4689MB 25s 31.59 t/s
Qwen3.5-2B 5%-7% 99% 5867MB 32s 17.37 t/s
Qwen3.5-4B 4%-8% 30% 12256MB 52s 8.74 t/s

总结

llama.cpp 是本地运行大模型最成熟的方案,纯 C/C++ 编写保证了推理运行效率。日常使用中多数设备的核显长期闲置,借助本地 AI 推理可充分利用闲置硬件性能。相较纯 CPU 运行,开启核显加速后推理速度有明显提升,同时大幅削减 CPU 负载。受限于硬件性能,可流畅运行轻量化小模型,适合数据脱敏、模型微调、离线私人助手等场景。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:NAS 本地部署 llama.cpp 教程:Vulkan 核显加速,流畅运行 Qwen3.5 模型
#llama.cpp #NAS部署 #本地AI #Qwen3.5 #核显加速 
收藏 1
SkillsGate 开源项目:AI Agent 技能的统一管理器,91000+ 技能一键安装到 18+ 款工具
Higgsfield 开源 AI 长视频制作全流程:95 分钟 AI 电影,50 万美金制作费全公开
推荐阅读
  • OpenClaw 配置备份与迁移完全指南,迁移到新电脑的完整流程
  • 抢不到GLM Coding Plan?试试 OpenCode Go 订阅方案
  • WorkBuddy实战案例:3 个真实工作流深度解析,从内容生产到投资研究
  • Ollama与LM Studio本地运行AI大模型完全指南
  • Hermes Agent 微信配置完整教程:个人微信与企业微信接入指南
评论 (0)
请登录后发表评论
分类精选
Cursor永久免费攻略:无限邮箱注册+重置机器码+Cursor试用期重置工具实现永久免费使用
50744 1年前
手把手教你如何使用扣子Coze搭建“文生图” AI Bot
21847 2年前
n8n新手入门指南:5 分钟本地部署 + 中文汉化 + 快速启动,玩转工作流(Docker版)
20273 1年前
安装字节Trae登录提示App Unavailable(应用程序不可用)解决办法,这份官方指南请收好!
19466 1年前
零基础上手 VSCode + Claude Code + GLM-4.6 保姆级安装配置教程
18167 9月前
Gemini CLI 装好了,登录异常怎么办?手把手教你解决 Gemini CLI 登录问题
17418 1年前
手把手教你用国内VISA信用卡直接订阅ChatGPT、Claude、Google Gemini等海外AI服务
17345 6月前
AI 概念篇:Token是什么?一文讲清楚Token分词、窗口、计费与常用计算工具
16639 7月前
一文搞懂什么是 Vibe Coding?Vibe Coding工具推荐及Cursor编程开发实践
16008 1年前
手把手教你使用 Gemini 2.5 Pro 免费 API搭建本地知识库,一键接入 Gemini!
15299 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Higgsfield 开源 AI 长视频制作全流程:95 分钟 AI 电影,50 万美金制作费全公开
2 NAS 本地部署 llama.cpp 教程:Vulkan 核显加速,流畅运行 Qwen3.5 模型
3 MiniMax H3 本地部署教程:RTX 3060 即可运行,0 成本制作 AI 漫剧
4 Cherry Studio V2 进阶玩法:Agent 自主执行、MCP 集成与 Skill 生态
5 Modal 每月免费 30 美元:轻松部署 Kimi K3 等开源模型
6 Claude Code 接入免费 Kimi K3,Modal 平台每月 30 美元额度教程
7 DeepSeek V4-Flash 接入 Codex:一行命令配置,性价比对标 GPT-5.6 Luna
8 Trae官方知识库开源:40万字场景化教程覆盖30+工作场景
9 用 TRAE Work 搭建科技媒体研究助理:规则+技能+自动化
10 Cline.bot 免费 API 接入指南:1M 超长上下文,三款模型任选
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联