什么是 Llama.cpp?如何用 Llama.cpp 部署本地 AI 模型?
面向零基础用户的 Llama.cpp 入门教程:弄清它与 Ollama、LM Studio 的区别,下载 GGUF 模型,并在 Windows 上启动本地网页聊天服务。
很多人听说 DeepSeek、Qwen 已经开源,想下载到电脑上免费使用;但第一次下载模型时常会遇到一个问题:模型文件双击打不开。
这是因为模型文件只是训练好的参数数据——可以把它理解成 AI 的“大脑”。它没有界面,也不会自行运行;还需要一个工具把这颗“大脑”加载起来。Llama.cpp 就是这样的工具。
本文以 Windows + NVIDIA 显卡为例,部署一个 20 亿参数的 GGUF 模型。更大的模型流程相同,只是对内存和显存要求会更高。
Llama.cpp 是什么?
Llama.cpp 是一个模型运行工具,专业名称叫推理引擎。它由 C/C++ 编写,依赖很少,目标是让大模型能在尽可能多的硬件上运行。
它的优势包括:
- 兼容面广: 老 CPU、NVIDIA 显卡、AMD 显卡、Intel 核显,以及 Apple Silicon 的 Mac,都有相应的运行后端。
- 可调参数多: CPU 使用多少线程、多少模型层交给显卡、上下文长度开多大,都能自行控制。
- 适合 GGUF 模型: 可以直接运行常见的
.gguf模型文件。
相应地,它主要通过命令行操作,第一次看到一串参数可能会有些陌生。只想简单聊天的用户,LM Studio 或 Ollama 会更省事;但如果想调优性能、搭建本地 API,Llama.cpp 很值得学习。
Llama.cpp、Ollama、LM Studio:该选哪个?
| 工具 | 可以理解成 | 操作难度 | 适合谁 |
|---|---|---|---|
| Llama.cpp | 底层推理引擎 | 中高 | 想调参数、跑 GGUF、搭本地 API 的进阶用户 |
| Ollama | 自动化程度更高的模型运行工具 | 低 | 想一行命令下载并聊天的大多数用户 |
| LM Studio | 带图形界面的本地模型软件 | 最低 | 不想碰命令行的纯小白 |
简单选择:
- 只想在电脑上和本地模型聊天,选 LM Studio。
- 要给 Agent 或其他程序提供本地接口,选 Ollama 会更省心。
- 想深入调参、尽量榨干硬件性能,选 Llama.cpp。
用 Llama.cpp 部署模型:三步完成
- 下载 Llama.cpp。
- 下载 GGUF 模型。
- 用命令启动模型。
第一步:下载 Llama.cpp
前往 llama.cpp Releases,下载与你电脑匹配的预编译包。

- 纯 CPU 用户选择 Windows CPU 版本。
- NVIDIA 显卡用户选择带 CUDA 的 Windows 版本。
- AMD 显卡或其他硬件则选择对应的 Vulkan / ROCm 等后端版本。
下载并解压后,将文件夹重命名为 llama.cpp。为了方便后续操作,可以放在桌面,例如:
C:\Users\你的用户名\Desktop\llama.cpp
第二步:下载 GGUF 模型
到 Hugging Face 模型库 搜索要使用的模型。本文示例使用 Qwen3.5-2B 的 GGUF 量化版本。
下载时确认文件后缀为 .gguf。对于初次尝试,通常可以从 Q4_K_M 这类量化版本开始:文件较小、内存占用相对低,效果和速度也比较平衡。

下载完成后,在 llama.cpp 文件夹中新建或使用 models 文件夹,把模型放进去:

llama.cpp
└── models
└── Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf
第三步:启动模型
先打开 Windows PowerShell。按 Win 键,搜索并打开“Windows PowerShell”即可。

先进入 Llama.cpp 所在目录:
cd C:\Users\你的用户名\Desktop\llama.cpp
路径中的“你的用户名”需要换成自己的 Windows 用户名。如果不知道文件夹路径,打开该文件夹后点击资源管理器顶部地址栏,即可复制完整路径。


然后执行启动命令:

.\llama-server.exe -m models\Qwen3.5-2B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf -ngl 35 -c 4096
当终端显示服务已启动后,在浏览器打开:

http://127.0.0.1:8080
就能看到本地网页聊天界面了。

常用参数是什么意思?
.\llama-server.exe -m models\模型文件.gguf -ngl 35 -c 4096
| 参数 | 作用 | 建议 |
|---|---|---|
-m | 指定本地 GGUF 模型路径 | 路径有空格时,用英文双引号包起来 |
-ngl | 下放到 GPU 的模型层数 | 有独显可先用 -ngl 99 测试 |
-c | 上下文长度 | 日常从 4096 或 8192 开始 |
上面的命令表示:启动 llama-server,加载指定模型,将 35 层模型交给 GPU 运算,并把上下文长度设为 4096。
如果显存够用,-ngl 99 通常会让尽可能多的模型层使用显卡;如果启动失败、显存不足或运行不稳定,再逐步降低数值。
最常见的几个坑
1. 文件格式不对
先确认模型是否为 .gguf 文件。Llama.cpp 不能直接加载所有模型格式;本教程的命令对应 GGUF 模型。
2. 模型能下载,不代表电脑能稳定运行
硬盘只负责存储模型;实际运行主要看内存和显存。一个 8GB 的模型文件,并不意味着电脑只要有 8GB 内存就能稳定运行:操作系统、上下文和运行时都会额外占用空间。
3. 显卡没有加速
确认下载的是与硬件匹配的版本,例如 NVIDIA 显卡应使用 CUDA 版本;同时检查是否添加了 -ngl 参数。很多人运行了 CPU 版,才发现显卡没有参与计算。
4. 路径或文件名不匹配
命令里的模型名必须与 models 文件夹中的真实文件名完全一致。路径包含空格时,记得用英文双引号,例如:
.\llama-server.exe -m "models\my model.gguf" -ngl 99 -c 4096
最后
Llama.cpp 是本地部署中的进阶工具:参数自由度高,也能更细致地发挥硬件性能。它的门槛主要是命令行,但启动模型并不等于写代码,熟悉一次之后流程很简单。
如果你只想方便地和本地 AI 聊天,LM Studio 或 Ollama 更合适;如果准备研究本地部署、性能调优,或向 Agent 提供本地模型 API,Llama.cpp 是一项很有价值的基础工具。
想了解不同模型需要什么硬件,可继续阅读《本地部署大模型需要什么配置?》。
免责声明:本文部分链接为联盟营销链接,通过链接购买不会产生额外费用,但可能会为我们带来一定佣金。推荐基于产品实际表现和性价比,不受商家影响。