想在自己电脑上跑 AI 大模型?Ollama 让这件事变得异常简单。它是一个轻量级工具,让你一条命令就能下载并运行 Llama 3、Mistral、Gemma 等开源大模型,完全免费、完全私有。
什么是 Ollama?
Ollama 是一个开源项目,让你在本地运行大语言模型(LLM)。它类似于 Docker 但专门针对 AI 模型——你用一条命令就能"拉取"和"运行"模型。
- 完全免费:没有 API 费用,没有订阅费
- 完全私有:数据不离开你的电脑
- 一条命令:
ollama run llama3就能开始对话 - 多平台:支持 Windows、Mac、Linux
硬件要求
- 最低配置:8GB RAM,无 GPU 也能跑(慢)
- 推荐配置:16GB RAM + RTX 3060 12GB
- 理想配置:32GB RAM + RTX 4090 24GB
💡 不同模型大小不同:7B 参数模型需要约 4GB 显存,13B 需要约 8GB,70B 需要约 40GB。
安装步骤
Windows
访问 https://ollama.com,下载 Windows 安装包,双击安装。安装完成后打开终端(PowerShell 或 CMD)。
Mac
下载 Mac 版本(支持 Apple Silicon 和 Intel),安装后菜单栏会出现 Ollama 图标。
Linux
curl -fsSL https://ollama.com/install.sh | sh
运行第一个模型
安装完成后,在终端输入:
ollama run llama3
首次运行会自动下载模型(约 4GB),之后每次启动都是秒开。
推荐模型
- llama3:Meta 出品,综合能力最强的开源模型
- mistral:法国团队出品,代码能力强
- gemma2:Google 出品,中文理解好
- qwen2.5:阿里出品,中文最强开源模型
- phi3:微软出品,小体积高性能
常用命令
# 运行模型
ollama run llama3
# 列出已下载的模型
ollama list
# 下载模型但不运行
ollama pull llama3
# 删除模型
ollama rm llama3
# 查看运行中的模型
ollama ps
进阶:API 调用
Ollama 会在本地启动一个 API 服务器(默认端口 11434),你可以用任何支持 OpenAI 格式的工具调用:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "llama3", "messages": [{"role": "user", "content": "Hello!"}]}'
常见问题
Q: 模型回答质量不如 ChatGPT?
A: 开源模型确实不如 GPT-4,但 Llama 3 和 Qwen2.5 已经非常接近 GPT-3.5 水平,日常使用完全够用。
Q: 需要联网吗?
A: 只有首次下载模型需要联网,之后完全离线运行。
Q: 可以同时跑多个模型吗?
A: 可以,但每个模型都占用 RAM/显存,需要根据硬件决定。