想在自己电脑上跑 AI 大模型?Ollama 让这件事变得异常简单。它是一个轻量级工具,让你一条命令就能下载并运行 Llama 3、Mistral、Gemma 等开源大模型,完全免费、完全私有。

什么是 Ollama?

Ollama 是一个开源项目,让你在本地运行大语言模型(LLM)。它类似于 Docker 但专门针对 AI 模型——你用一条命令就能"拉取"和"运行"模型。

硬件要求

💡 不同模型大小不同:7B 参数模型需要约 4GB 显存,13B 需要约 8GB,70B 需要约 40GB。

安装步骤

Windows

访问 https://ollama.com,下载 Windows 安装包,双击安装。安装完成后打开终端(PowerShell 或 CMD)。

Mac

下载 Mac 版本(支持 Apple Silicon 和 Intel),安装后菜单栏会出现 Ollama 图标。

Linux

curl -fsSL https://ollama.com/install.sh | sh

运行第一个模型

安装完成后,在终端输入:

ollama run llama3

首次运行会自动下载模型(约 4GB),之后每次启动都是秒开。

推荐模型

常用命令

# 运行模型
ollama run llama3

# 列出已下载的模型
ollama list

# 下载模型但不运行
ollama pull llama3

# 删除模型
ollama rm llama3

# 查看运行中的模型
ollama ps

进阶:API 调用

Ollama 会在本地启动一个 API 服务器(默认端口 11434),你可以用任何支持 OpenAI 格式的工具调用:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "llama3", "messages": [{"role": "user", "content": "Hello!"}]}'

常见问题

Q: 模型回答质量不如 ChatGPT?

A: 开源模型确实不如 GPT-4,但 Llama 3 和 Qwen2.5 已经非常接近 GPT-3.5 水平,日常使用完全够用。

Q: 需要联网吗?

A: 只有首次下载模型需要联网,之后完全离线运行。

Q: 可以同时跑多个模型吗?

A: 可以,但每个模型都占用 RAM/显存,需要根据硬件决定。

探索更多 AI 工具

我们收录了 300+ 款 AI 工具,涵盖编程、写作、设计等多个领域。

浏览 AI 工具库 →