一、Ollama 是什么
Ollama 是一个本地运行大模型的工具,目标是把“下载模型、启动模型、管理模型”的过程做得尽量简单。
它可以理解为:一个专门用来简化大语言模型本地部署和运行过程的开源工具。
它的典型使用方式是:安装 Ollama -> 启动服务 -> 拉取模型 -> 运行模型
常见适用场景包括:
- 本地体验开源模型
- 搭建个人 AI 助手
- 给 Python、Web 界面或内部工具提供本地推理能力
二、安装 Ollama
Windows 下最直接的方式是执行官方安装脚本:
irm https://ollama.com/install.ps1 | iex
ollama --version
如果能正常输出版本号,说明 Ollama 已经安装成功。
三、启动服务
安装完成后,可以先直接在终端里启动:
ollama serve
这种方式适合:临时调试、验证安装是否成功、观察日志输出。
如果日志里能看到服务监听成功、GPU 被识别等信息,通常说明环境没有大问题。
前台运行结束时,可以使用 Ctrl + C 直接退出当前服务进程。
四、下载并运行模型
服务准备好后,就可以正式拉模型并运行了。
1. 先拉取模型
例如下载 deepseek-r1:7b 和 qwen2:7b:
ollama pull deepseek-r1:7b
ollama pull qwen2:7b
首次拉取可能会比较慢,取决于你的网络和模型体积。
2. 再运行模型
ollama run deepseek-r1:7b
执行后会进入交互模式,你可以直接输入问题测试模型响应。
如果你第一次直接执行 ollama run deepseek-r1:7b,Ollama 也会先自动下载,再进入运行阶段。
五、交互模式常用命令
进入 ollama run 的交互界面后,除了直接提问,还可以使用一些内置命令管理当前会话。
需要注意:这里说的是交互模式里的命令,通常以 / 开头;它和终端里直接执行的 ollama show、ollama list 这类命令不是一个层级。
1. 基本指令
/?:查看当前交互模式支持的命令/bye:退出当前对话,返回终端/show:显示当前会话所用模型的信息/? shortcuts:查看快捷键说明""":进入多行输入模式,适合粘贴较长提示词或大段文本
2. 对话调整指令
/set:设置当前对话参数/clear:清理当前上下文,重新开始一轮对话
3. 模型调整指令
/load:在当前交互过程中动态切换模型/save:保存当前模型状态或会话结果,不同版本中的具体表现可能略有差异
这类命令更适合你已经进入交互模式、想临时调整当前会话时使用。
六、终端里常用的管理命令
如果你已经会下载和运行模型,下一步通常就是查看状态和做基础管理。
1. 查看本地模型列表
ollama list
用于查看当前机器上已经下载了哪些模型。
2. 查看当前运行中的模型
ollama ps
用于查看当前有哪些模型正在运行。
3. ollama show <model>
用于查看某个模型的详细信息,例如模型名称、参数规模、模板、许可证等。
ollama show deepseek-r1:7b
这个命令是在终端里直接执行的,和交互模式中的 /show 不同。前者查看的是本地模型详情,后者查看的是当前会话里的模型信息。
当你不确定某个模型的具体配置,或者想确认模型标签是否正确时,这个命令很实用。
4. ollama cp <source> <target>
用于复制一个已有模型,并生成一个新的模型标签。
ollama cp deepseek-r1:7b deepseek-r1:7b-backup
这个命令适合在你想保留一份备份、或者基于现有模型做新标签管理时使用。
5. ollama rm <model>
用于删除本地已经下载的模型。
ollama rm qwen2:7b
如果某个模型不再使用、或者磁盘空间紧张,可以通过这个命令把它移除。
小结
这篇文章的主线可以直接记成:
安装 -> 启动服务 -> pull 下载模型 -> run 运行模型 -> 用常用命令做查看和管理
先把这条链路跑通,后面再接 Python、Web 页面或本地 AI 应用就会顺很多。