本地大模型部署:用 Ollama 与 llama.cpp 把模型搬进你自己的机器

数据敏感、要离线、想省 API 账单?本地部署值得了解。

本地大模型部署:用 Ollama 与 llama.cpp 把模型搬进你自己的机器

把大模型搬到你自己的电脑、内网服务器甚至笔记本上跑,不依赖任何云服务——这件事在 2026 年已经相当成熟。无论是数据敏感、要离线、还是想省 API 账单,本地大模型部署都值得每个开发者了解。Ollama 和 llama.cpp 是这条路上最顺手的两件工具。

为什么要在本地跑

云端 API 方便,但有三类痛点它躲不开:数据要出网(合规敏感场景直接否决)、每次调用都计费、断网就歇菜。本地部署把模型权重放在你自己的机器上,请求不出内网、零边际成本、永远在线。代价是你要自己搞定硬件和推理环境。

两件核心工具

Ollama:把「下载模型、起服务、调接口」封装成几条命令,对开发者最友好,自带兼容 OpenAI 的接口。 llama.cpp:用 C++ 实现、支持量化与多后端(CPU/GPU/Metal),是把模型塞进低配机器的底层引擎,很多上层工具(包括 Ollama)都站在它肩上。

一个最小可运行的例子

用 Ollama 跑起一个模型并调用,比想象中简单:

ollama pull qwen2.5:7b     # 拉取一个 70 亿参数模型
ollama run qwen2.5:7b      # 命令行直接对话

在 Python 里,它可以像调云端一样用:

from ollama import chat
resp = chat(model="qwen2.5:7b", messages=[
    {"role": "user", "content": "用一句话解释什么是向量数据库"}
])
print(resp["message"]["content"])

取舍与边界

  • 硬件是硬门槛:7B 模型量化后约 4–5 GB 显存,能跑;70B 级别需要大显存或多卡,笔记本基本没戏。
  • 质量有差距:本地小模型(7B/14B)在复杂推理上仍明显弱于云端旗舰模型,适合内部工具、草稿、分类等场景。
  • 量化换速度:用 llama.cpp 的 INT4 量化能在 CPU 上跑起来,但精度会降,关键任务先评测。
  • 并发能力弱:本地单机吞吐远不及云厂商集群,不适合高并发公网服务。

Tips

  • 想试水,先 ollama pull 一个 7B 模型,五分钟跑通对话。
  • 应用层尽量走 OpenAI 兼容接口,本地/云端切换只改 base_url。
  • 数据敏感或要离线,本地部署是合规最优解。
  • 真要上生产高并发,把本地模型定位为「内网辅助」,重活仍交给云端旗舰。
  • 选模型时先想清楚硬件:显存不够就上量化版,别硬刚全精度。

KEEP READING