Ollama 本地部署指南

一、Ollama 是什么

Ollama 是一个本地运行大模型的工具,目标是把“下载模型、启动模型、管理模型”的过程做得尽量简单。

它可以理解为:一个专门用来简化大语言模型本地部署和运行过程的开源工具。

它的典型使用方式是:安装 Ollama -> 启动服务 -> 拉取模型 -> 运行模型

常见适用场景包括:

  • 本地体验开源模型
  • 搭建个人 AI 助手
  • 给 Python、Web 界面或内部工具提供本地推理能力

二、安装 Ollama

Windows 下最直接的方式是执行官方安装脚本:

irm https://ollama.com/install.ps1 | iex
ollama --version

如果能正常输出版本号,说明 Ollama 已经安装成功。

三、启动服务

安装完成后,可以先直接在终端里启动:

ollama serve

这种方式适合:临时调试、验证安装是否成功、观察日志输出。

如果日志里能看到服务监听成功、GPU 被识别等信息,通常说明环境没有大问题。

前台运行结束时,可以使用 Ctrl + C 直接退出当前服务进程。

四、下载并运行模型

服务准备好后,就可以正式拉模型并运行了。

1. 先拉取模型

例如下载 deepseek-r1:7bqwen2:7b

ollama pull deepseek-r1:7b
ollama pull qwen2:7b

首次拉取可能会比较慢,取决于你的网络和模型体积。

2. 再运行模型

ollama run deepseek-r1:7b

执行后会进入交互模式,你可以直接输入问题测试模型响应。

如果你第一次直接执行 ollama run deepseek-r1:7b,Ollama 也会先自动下载,再进入运行阶段。

五、交互模式常用命令

进入 ollama run 的交互界面后,除了直接提问,还可以使用一些内置命令管理当前会话。

需要注意:这里说的是交互模式里的命令,通常以 / 开头;它和终端里直接执行的 ollama showollama list 这类命令不是一个层级。

1. 基本指令

  • /?:查看当前交互模式支持的命令
  • /bye:退出当前对话,返回终端
  • /show:显示当前会话所用模型的信息
  • /? shortcuts:查看快捷键说明
  • """:进入多行输入模式,适合粘贴较长提示词或大段文本

2. 对话调整指令

  • /set:设置当前对话参数
  • /clear:清理当前上下文,重新开始一轮对话

3. 模型调整指令

  • /load:在当前交互过程中动态切换模型
  • /save:保存当前模型状态或会话结果,不同版本中的具体表现可能略有差异

这类命令更适合你已经进入交互模式、想临时调整当前会话时使用。

六、终端里常用的管理命令

如果你已经会下载和运行模型,下一步通常就是查看状态和做基础管理。

1. 查看本地模型列表

ollama list

用于查看当前机器上已经下载了哪些模型。

2. 查看当前运行中的模型

ollama ps

用于查看当前有哪些模型正在运行。

3. ollama show <model>

用于查看某个模型的详细信息,例如模型名称、参数规模、模板、许可证等。

ollama show deepseek-r1:7b

这个命令是在终端里直接执行的,和交互模式中的 /show 不同。前者查看的是本地模型详情,后者查看的是当前会话里的模型信息。

当你不确定某个模型的具体配置,或者想确认模型标签是否正确时,这个命令很实用。

4. ollama cp <source> <target>

用于复制一个已有模型,并生成一个新的模型标签。

ollama cp deepseek-r1:7b deepseek-r1:7b-backup

这个命令适合在你想保留一份备份、或者基于现有模型做新标签管理时使用。

5. ollama rm <model>

用于删除本地已经下载的模型。

ollama rm qwen2:7b

如果某个模型不再使用、或者磁盘空间紧张,可以通过这个命令把它移除。

小结

这篇文章的主线可以直接记成:

安装 -> 启动服务 -> pull 下载模型 -> run 运行模型 -> 用常用命令做查看和管理

先把这条链路跑通,后面再接 Python、Web 页面或本地 AI 应用就会顺很多。