Ollama:本地运行大模型的一键工具
Ollama 是一款能在本地一键运行大语言模型的命令行工具,帮你免去配置环境的繁琐,轻松下载并管理 Llama、Qwen 等模型。本文将详解它的安装、使用技巧与注意事项,让你快速上手私有化部署。
详细介绍
为什么要用 Ollama?
想在本机跑大模型,过去你得先装 Python、CUDA、PyTorch,再手动下载权重文件,稍有不慎就报错。Ollama 把这些步骤全部封装好了:一条命令就能下载模型并启动服务,让你像使用 Docker 一样使用大模型。它尤其适合需要数据隐私、离线演示或想低成本试验不同模型的中文用户。
Ollama 的核心功能
1. 极致简单的模型管理
Ollama 自带模型仓库,你可以直接拉取社区精选的模型,比如 Llama 3、Qwen 2、Mistral 等。执行 ollama pull qwen2:7b 就能下载并自动量化,无需关心文件格式和推理框架。它还支持自定义模型参数,例如通过 temperature 调整输出随机性,满足了不同场景的调优需求。
2. 内置 REST API 与流式输出
启动 ollama serve 后,它会监听 localhost:11434,提供兼容 OpenAI 格式的接口。你只需一个 HTTP 请求就能调用本机模型,方便接入自己的应用或前端。这种设计让 Ollama 成为开发者的“本地模型引擎”,更可以配合 LangChain 等工具实现复杂工作流。
3. 跨平台与轻量级
Ollama 支持 macOS、Windows 和 Linux,并提供 Docker 镜像。它通过内存映射和层缓存技术,让多模型切换更快,同时减少磁盘占用。对于没有 GPU 的机器,它也能调用 CPU 推理,只是速度稍慢。
安装与使用步骤
- 安装:到官网下载对应系统安装包,或直接执行
curl -fsSL https://ollama.com/install.sh | sh(Linux/macOS)。 - 拉取模型:打开终端执行
ollama run qwen2.5:7b,首次会自动下载模型,之后即可进入交互式对话。 - 调用 API:另开终端执行
curl http://localhost:11434/api/generate -d '{"model": "qwen2.5:7b", "prompt": "你好"}'即可获得回复。 - 后台服务:常用
ollama serve常驻运行,也可以使用systemd或 Docker 管理。
注意事项与系统要求
Ollama 对硬件有一定要求:至少 8GB 内存,推荐 16GB 以上;若用 CPU 推理,7B 模型大约需要 8GB 内存,而 13B 模型建议 16GB。运行大模型时注意散热,并且不要同时打开过多模型。此外,Ollama 使用 MIT 许可证,可自由商用;但模型本身有各自的开源协议,使用前请确认。
系统要求
8G 内存以上
更新记录
最近更新:2026-08-18
下载
下载按优先级提供:国内网盘(第一优先,便于国内快速获取)→ 官方来源(官方正版背书)→ 源码地址(开源项目);网盘链接均经审核,如失效欢迎反馈。
怎么选(决策参考)
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
社区数据不足
暂无公开信号
暂无公开信号
暂无公开信号
常见问题
Ollama 会不会很占内存?
内存占用取决于模型大小。7B 量化模型约需 6-8GB,13B 需要 10-12GB。建议至少 16GB 内存,并关闭不用的模型以释放资源。
Ollama 能离线使用吗?
可以。首次拉取模型需联网,之后推理完全在本地。也可提前用 ollama pull 下载模型到目标机器,再断网使用。
如何用 Ollama 运行中文模型?
直接拉取如 qwen2.5、glm4 等中文友好模型。执行 ollama run qwen2.5:7b 即可对话,也可设置系统提示词提升中文输出质量。