ollama教程
本文是一份面向开发者的ollama教程,从本地部署大模型的痛点出发,讲解核心功能、安装步骤与实战技巧,帮助你快速上手,高效管理模型并集成到应用中。
详细介绍
为什么你需要一份靠谱的 ollama 教程?
很多人在本地运行大模型时,常常被复杂的依赖、GPU 配置和网络问题劝退。要么是 pip 装了一堆包仍然报错,要么是模型文件动辄几个 GB,下载到一半就断了。如果你也厌倦了和 Python 虚拟环境、CUDA 版本较劲,那么 ollama 会是你的解药。它把 Llama、Qwen、Mistral 等主流模型封装成一条命令就能运行,全程不需要手动写代码,更不用关心底层推理框架。下面这份 ollama 教程,就是为了让你少踩坑,从零到一跑通本地大模型。
核心功能:一条命令搞定模型生命周期
1. 模型拉取与切换
ollama 的核心用法就是 ollama pull <模型名>,比如 ollama pull qwen2.5:7b 就能下载量化后的 7B 模型,通常只有 4 到 5 GB。更贴心的是,它支持断点续传,网络不稳定也不用从头再来。想换模型?直接用 ollama run <模型名>,它会自动检查本地是否存在,不存在则先拉取,非常省心。
2. 自动加载与释放内存
当你运行 ollama run qwen2.5:7b 进入交互式对话后,模型会自动加载到显存中。如果长时间不操作,它会自动卸载,释放内存给其他程序。对于只有一块入门级显卡的开发者来说,这个特性避免了手动管理显存的痛苦。同时,ollama 还支持在对话中随时切换上下文长度,比如输入 /set parameter num_ctx 8192 就能扩大记忆窗口,让长文处理更流畅。
3. 内置 OpenAI 兼容接口
ollama 启动后在默认端口 11434 提供 REST API,且接口格式与 OpenAI 高度兼容。这意味着你可以用 requests 或任何 OpenAI SDK 来调用本地模型,只需把 base_url 改成 http://localhost:11434/v1。在写代码时,几乎不需要修改原有逻辑就能把模型切换到本地,对开发调试特别友好。
下载与安装步骤
Windows 用户直接去 ollama.com 下载安装包,双击后会自动安装并注册系统服务。macOS 则可用 Homebrew 安装:brew install ollama。Linux 用户执行官方脚本 curl -fsSL https://ollama.com/install.sh | sh。安装完成后,在终端输入 ollama -v 确认版本号。注意,Windows 安装包默认安装在 C 盘,如果空间紧张,可以设置环境变量 OLLAMA_MODELS 指向其他盘,记得先关闭运行中的 ollama 进程再修改。
使用方法:从拉取到实战调用
第一步,拉取模型:ollama pull llama3.2:3b(这是轻量版,适合入门)。第二步,启动交互式对话:ollama run llama3.2:3b,然后直接输入问题即可。第三步,如果想在代码里用,先另开终端执行 ollama serve 保持服务在后台,接着用 Python 验证:
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
resp = client.chat.completions.create(model='llama3.2:3b', messages=[{'role':'user','content':'你好'}]])
print(resp.choices[0].message.content)
如果嫌默认模型不够强,可以拉取更大的模型,但要注意显存容量,一般来说 8GB 显存跑 7B 模型问题不大,14B 及以上就需要 24GB 显存了。另外,你可以用 ollama list 查看本地模型列表,ollama rm 删除不需要的模型,保持磁盘整洁。
注意事项
- 拉取模型时建议使用稳定的网络,如果经常中断,可以配置镜像源,或者手动下载模型文件后放到
~/.ollama/models目录。 - 如果显存不足,会退回到 CPU 推理,速度会慢很多,建议关闭其他占用显存的程序,或在启动前设置环境变量
OLLAMA_NUM_PARALLEL=1减少并发。 - 默认的上下文长度是 2048,处理长文档时记得调大,否则会截断输入。
- 注意模型许可证,部分模型有商用限制,生产环境使用前要确认。
学会以上操作,你已经能熟练使用 ollama 了。更多高级玩法,比如多模型并行、自定义模型参数,可以查官方文档。这份 ollama 教程帮你省去大量试错时间,现在就打开终端,拉一个模型试试吧。
更新记录
最近更新:2026-08-19
下载
下载按优先级提供:国内网盘(第一优先,便于国内快速获取)→ 官方来源(官方正版背书)→ 源码地址(开源项目);网盘链接均经审核,如失效欢迎反馈。
怎么选(决策参考)
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
社区数据不足
暂无公开信号
暂无公开信号
暂无公开信号
常见问题
安装 ollama 后运行命令提示找不到命令怎么办?
多半是环境变量没配置。Windows 用户检查安装目录是否在 PATH 中;macOS/Linux 用户执行 source ~/.zshrc 或 ~/.bashrc。也可直接重启终端再试。
运行模型时显存不够用,内存却很高,如何解决?
模型默认分配了显存,如果不足会回退到 CPU。建议改用更小的模型(如 3B 或 7B 量化版),或设置 OLLAMA_NUM_PARALLEL=1 减少并发占用。
ollama 下载模型很慢,有什么加速方法?
可以设置全局代理环境变量,如 HTTP_PROXY 和 HTTPS_PROXY;或者直接用浏览器下载模型文件,再手动拷贝到 OLLAMA_MODELS 指定的目录下。