按模型分类2026-08-092 分钟阅读

什么是 Llama.cpp?如何用 Llama.cpp 部署本地 AI 模型?

面向零基础用户的 Llama.cpp 入门教程:弄清它与 Ollama、LM Studio 的区别,下载 GGUF 模型,并在 Windows 上启动本地网页聊天服务。

很多人听说 DeepSeek、Qwen 已经开源,想下载到电脑上免费使用;但第一次下载模型时常会遇到一个问题:模型文件双击打不开。

这是因为模型文件只是训练好的参数数据——可以把它理解成 AI 的“大脑”。它没有界面,也不会自行运行;还需要一个工具把这颗“大脑”加载起来。Llama.cpp 就是这样的工具。

本文以 Windows + NVIDIA 显卡为例,部署一个 20 亿参数的 GGUF 模型。更大的模型流程相同,只是对内存和显存要求会更高。


Llama.cpp 是什么?

Llama.cpp 是一个模型运行工具,专业名称叫推理引擎。它由 C/C++ 编写,依赖很少,目标是让大模型能在尽可能多的硬件上运行。

它的优势包括:

  • 兼容面广: 老 CPU、NVIDIA 显卡、AMD 显卡、Intel 核显,以及 Apple Silicon 的 Mac,都有相应的运行后端。
  • 可调参数多: CPU 使用多少线程、多少模型层交给显卡、上下文长度开多大,都能自行控制。
  • 适合 GGUF 模型: 可以直接运行常见的 .gguf 模型文件。

相应地,它主要通过命令行操作,第一次看到一串参数可能会有些陌生。只想简单聊天的用户,LM Studio 或 Ollama 会更省事;但如果想调优性能、搭建本地 API,Llama.cpp 很值得学习。

Llama.cpp、Ollama、LM Studio:该选哪个?

工具可以理解成操作难度适合谁
Llama.cpp底层推理引擎中高想调参数、跑 GGUF、搭本地 API 的进阶用户
Ollama自动化程度更高的模型运行工具想一行命令下载并聊天的大多数用户
LM Studio带图形界面的本地模型软件最低不想碰命令行的纯小白

简单选择:

  1. 只想在电脑上和本地模型聊天,选 LM Studio
  2. 要给 Agent 或其他程序提供本地接口,选 Ollama 会更省心。
  3. 想深入调参、尽量榨干硬件性能,选 Llama.cpp

用 Llama.cpp 部署模型:三步完成

  1. 下载 Llama.cpp。
  2. 下载 GGUF 模型。
  3. 用命令启动模型。

第一步:下载 Llama.cpp

前往 llama.cpp Releases,下载与你电脑匹配的预编译包。

llama.cpp 下载页面

  • 纯 CPU 用户选择 Windows CPU 版本。
  • NVIDIA 显卡用户选择带 CUDA 的 Windows 版本。
  • AMD 显卡或其他硬件则选择对应的 Vulkan / ROCm 等后端版本。

下载并解压后,将文件夹重命名为 llama.cpp。为了方便后续操作,可以放在桌面,例如:

C:\Users\你的用户名\Desktop\llama.cpp

第二步:下载 GGUF 模型

Hugging Face 模型库 搜索要使用的模型。本文示例使用 Qwen3.5-2B 的 GGUF 量化版本。

下载时确认文件后缀为 .gguf。对于初次尝试,通常可以从 Q4_K_M 这类量化版本开始:文件较小、内存占用相对低,效果和速度也比较平衡。

在 Hugging Face 下载 GGUF 模型

下载完成后,在 llama.cpp 文件夹中新建或使用 models 文件夹,把模型放进去:

将模型放入 models 文件夹

llama.cpp
└── models
    └── Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf

第三步:启动模型

先打开 Windows PowerShell。按 Win 键,搜索并打开“Windows PowerShell”即可。

打开 Windows PowerShell

先进入 Llama.cpp 所在目录:

cd C:\Users\你的用户名\Desktop\llama.cpp

路径中的“你的用户名”需要换成自己的 Windows 用户名。如果不知道文件夹路径,打开该文件夹后点击资源管理器顶部地址栏,即可复制完整路径。

在 PowerShell 中进入 llama.cpp 文件夹

查看 llama.cpp 文件夹路径

然后执行启动命令:

输入模型启动命令

.\llama-server.exe -m models\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf -ngl 35 -c 4096

当终端显示服务已启动后,在浏览器打开:

模型服务启动成功

http://127.0.0.1:8080

就能看到本地网页聊天界面了。

Llama.cpp 本地网页聊天界面


常用参数是什么意思?

.\llama-server.exe -m models\模型文件.gguf -ngl 35 -c 4096
参数作用建议
-m指定本地 GGUF 模型路径路径有空格时,用英文双引号包起来
-ngl下放到 GPU 的模型层数有独显可先用 -ngl 99 测试
-c上下文长度日常从 40968192 开始

上面的命令表示:启动 llama-server,加载指定模型,将 35 层模型交给 GPU 运算,并把上下文长度设为 4096。

如果显存够用,-ngl 99 通常会让尽可能多的模型层使用显卡;如果启动失败、显存不足或运行不稳定,再逐步降低数值。

最常见的几个坑

1. 文件格式不对

先确认模型是否为 .gguf 文件。Llama.cpp 不能直接加载所有模型格式;本教程的命令对应 GGUF 模型。

2. 模型能下载,不代表电脑能稳定运行

硬盘只负责存储模型;实际运行主要看内存和显存。一个 8GB 的模型文件,并不意味着电脑只要有 8GB 内存就能稳定运行:操作系统、上下文和运行时都会额外占用空间。

3. 显卡没有加速

确认下载的是与硬件匹配的版本,例如 NVIDIA 显卡应使用 CUDA 版本;同时检查是否添加了 -ngl 参数。很多人运行了 CPU 版,才发现显卡没有参与计算。

4. 路径或文件名不匹配

命令里的模型名必须与 models 文件夹中的真实文件名完全一致。路径包含空格时,记得用英文双引号,例如:

.\llama-server.exe -m "models\my model.gguf" -ngl 99 -c 4096

最后

Llama.cpp 是本地部署中的进阶工具:参数自由度高,也能更细致地发挥硬件性能。它的门槛主要是命令行,但启动模型并不等于写代码,熟悉一次之后流程很简单。

如果你只想方便地和本地 AI 聊天,LM Studio 或 Ollama 更合适;如果准备研究本地部署、性能调优,或向 Agent 提供本地模型 API,Llama.cpp 是一项很有价值的基础工具。

想了解不同模型需要什么硬件,可继续阅读《本地部署大模型需要什么配置?》

免责声明:本文部分链接为联盟营销链接,通过链接购买不会产生额外费用,但可能会为我们带来一定佣金。推荐基于产品实际表现和性价比,不受商家影响。