能解决什么问题?
很多朋友想在自己电脑上跑大模型,但被复杂的配置、环境依赖和网络问题劝退。Ollama 就是为解决这些痛点而生的:它把模型下载、运行、管理都封装成一条简单命令,让你像安装 App 一样使用本地大模型。主要解决三类问题:
- 网络限制:国内直接访问国外模型仓库慢或不通,Ollama 支持从国内镜像加速下载。
- 隐私安全:数据不出本地,适合处理敏感文档。
- 成本可控:一次下载,无限次使用,无需按 token 付费。
无论你是开发者想快速测试模型,还是普通用户想体验 AI 对话,Ollama 都能让你在几分钟内跑起来。
准备工作
Ollama 本身是开源软件,官网可直接下载,国内网络也能访问。但下载模型时,默认从国外源拉取可能很慢,建议提前配置国内镜像。准备工作如下:
- 操作系统:Windows 10/11、macOS 12+ 或 Linux(Ubuntu 20.04+ 等)。建议内存 16GB 以上,运行 7B 模型约需 8GB 内存。
- 获取安装包:访问 Ollama 官网(ollama.com),点击“Download”按钮,根据系统选择对应版本。如果官网访问慢,也可在 GitHub 搜索“ollama”找到发布页下载。
- 配置国内镜像(可选但推荐):安装后,在系统环境变量中添加
OLLAMA_HOST=0.0.0.0和OLLAMA_MODELS指定模型存储路径。更关键的是设置镜像源,例如使用阿里云或清华源,具体命令见步骤 3。 - 终端工具:Windows 用 PowerShell 或 CMD,macOS/Linux 用 Terminal。后续操作都在终端进行。
分步骤实操
步骤 1:安装 Ollama
下载安装包后,双击运行。Windows 会自动安装并启动后台服务;macOS 拖入 Applications 即可;Linux 可执行 curl -fsSL https://ollama.com/install.sh | sh。安装完成后,在终端输入 ollama -v,若显示版本号(如 ollama version 0.5.7),说明安装成功。
步骤 2:启动 Ollama 服务
通常安装后服务会自动运行。如果没有,在终端输入 ollama serve 并回车。看到“Listening on 127.0.0.1:11434”表示服务已启动。这个窗口不要关闭,后续操作需保持运行。
步骤 3:配置国内镜像加速(关键)
为了快速下载模型,需要设置镜像。在终端执行以下命令(以 Linux/macOS 为例):
export OLLAMA_HOST=0.0.0.0export OLLAMA_MODELS=/your/pathexport OLLAMA_REGISTRY=https://registry.ollama.ai(默认,若慢可换国内镜像,如 https://mirror.ollama.ai,但需确认可用性)
Windows 用户可在“系统属性-环境变量”中添加。更简单的方法:直接使用 ollama pull 时指定国内镜像,例如 ollama pull --registry https://registry.cn-hangzhou.aliyuncs.com/ollama/library/llama3(阿里云镜像,需替换模型名)。具体镜像地址可搜索“Ollama 国内镜像”获取最新。
步骤 4:拉取并运行模型
在终端输入 ollama run llama3,回车。Ollama 会自动从镜像下载模型并运行。下载进度会显示在终端。完成后出现 >>> 提示符,即可输入问题对话。例如输入“你好,介绍一下你自己”,模型会流式回复。按 Ctrl+D 退出对话。
步骤 5:管理模型
常用命令:
ollama list:列出已下载模型。ollama pull 模型名:仅下载不运行。ollama rm 模型名:删除模型释放空间。ollama cp 源模型 新名字:复制模型。
模型文件默认保存在 ~/.ollama/models(Linux/macOS)或 C:\Users\用户名\.ollama\models(Windows)。
步骤 6:通过 API 调用
Ollama 提供本地 API,默认端口 11434。用 curl 测试:curl http://localhost:11434/api/generate -d '{"model":"llama3","prompt":"你好"}'。也可用 Python 的 requests 库调用,方便集成到自己的应用。
进阶技巧
| 技巧 | 说明 | 命令示例 |
|---|---|---|
| 自定义模型 | 通过 Modelfile 调整参数,如温度、系统提示 | ollama create 新模型 -f Modelfile |
| 多模型并行 | 同时运行多个模型,通过不同端口 | OLLAMA_HOST=0.0.0.0:11435 ollama serve |
| GPU 加速 | NVIDIA 显卡自动启用 CUDA,AMD 需 ROCm | 确保驱动安装,Ollama 自动检测 |
| 模型量化 | 下载 q4_0 等量化版本,降低内存占用 | ollama run llama3:7b-q4_0 |
| Web UI 集成 | 配合 Open WebUI 等界面,图形化对话 | 需 Docker 部署 Open WebUI,连接 Ollama API |
常见问题
Q1:下载模型速度太慢或失败怎么办?
A:首先检查是否配置了国内镜像。如果没有,可在终端设置环境变量 OLLAMA_REGISTRY 为国内镜像地址(如阿里云、腾讯云)。另外,可尝试在网络空闲时段下载,或手动下载模型文件放入 models 目录。如果仍失败,可先 ollama pull 小模型(如 tinyllama)测试网络。
Q2:运行模型时提示内存不足?
A:本地大模型对内存要求较高。7B 模型约需 8GB 内存,13B 需 16GB。如果内存不足,可下载量化版本(如 q4_0),或选择更小的模型(如 phi3、gemma:2b)。另外,关闭其他占用内存的程序,或增加虚拟内存。
Q3:如何让 Ollama 开机自启?
A:Windows 可将 Ollama 快捷方式放入启动文件夹;macOS 可在“系统设置-通用-登录项”中添加;Linux 使用 systemd 创建服务文件。具体方法可搜索“Ollama 开机自启”获取对应系统的教程。
智库妙影 AI数字人
智库创课 AI课件
智库GEO AI搜索优化
智库妙鉴 AI命理文化
Agent社区 智能体交流
智影新媒体OS 新媒体创作
辽公网安备21021102001760号