本地大模型
AutoGPT 自主智能体
自主 AI 智能体任务执行平台
Ollama 本地大模型
本地运行大语言模型
Transformers 模型库
NLP/视觉/音频领域最先进的机器学习模型库
Open WebUI 本地界面
适配 Ollama 的本地 LLM Web 界面
LangChain 链式框架
构建 LLM 应用的链式框架
llama.cpp 本地推理
C/C++ 实现的本地 LLM 高速推理
vLLM 高吞吐推理
基于 PagedAttention 的高吞吐 LLM 推理服务
LobeChat 聊天框架
现代化开源 LLM 聊天界面框架
GPT4All 本地助手
本地运行定制化大语言模型
Unsloth 极速微调
速度提升 2-5 倍、显存减少 70% 的 LLM 微调工具
LLaMA-Factory 微调框架
支持 100+ LLM 的统一微调框架,含 Web 界面
开放解释器
自然语言驱动本地代码执行
Mem0 AI 记忆层
AI 智能体记忆管理框架
PrivateGPT 私有问答
完全私有的文档问答 AI
LiteLLM 统一调用库
统一调用 100+ 大模型的轻量库
Whisper.cpp 高效识别
OpenAI Whisper 的 C/C++ 高速本地推理实现
LlamaIndex 数据框架
LLM 应用的数据索引框架
LocalAI 本地 API
本地运行的开源 OpenAI API 替代品
文本生成 WebUI
Gradio 驱动的本地 LLM Web 界面
Jan 本地 AI 助手
开源离线运行的 ChatGPT 替代品
DSPy 提示优化框架
编程式 LLM 提示优化框架
Open Assistant 开源助手
LAION 开源的 ChatGPT 替代品
LangFuse LLM 可观测
开源 LLM 工程可观测性平台
SillyTavern 角色扮演
AI 角色扮演和互动故事写作高级界面
SGLang 结构化生成
大语言和视觉模型的高速推理服务框架
Semantic Kernel 微软框架
微软 LLM 应用集成 SDK
MLX Apple 机器学习
Apple 针对 Apple Silicon 优化的机器学习框架
Llamafile 单文件 LLM
将 LLM 打包为单一跨平台可执行文件
Faster Whisper 加速识别
基于 CTranslate2 的 4 倍加速 Whisper 实现
MemGPT 虚拟内存 LLM
具有虚拟内存和持久上下文管理的 LLM OS
Guidance 提示控制框架
语言模型高效提示控制框架
ONNX Runtime 推理引擎
微软跨平台机器学习推理加速器
PEFT 参数高效微调
含 LoRA 的参数高效微调方法库
AISuite 多模型统一接口
吴恩达出品的多 AI 服务商统一接口
Outlines 约束生成框架
约束 LLM 结构化文本生成框架
GGML 机器学习张量库
面向边缘设备的机器学习张量库
RWKV 语言模型
性能媲美 Transformer 的 RNN 语言模型
TensorRT-LLM 推理加速
NVIDIA 大模型推理加速工具包
QAnything 网易 RAG
网易有道开源的本地知识库问答系统
Instructor 结构化输出
基于 Pydantic 的 LLM 结构化输出
LM 评估框架
NLP 任务上评估语言模型的标准框架
LitGPT LLM 训练库
在自有硬件上预训练/微调/部署 20+ LLM
OpenLLM 模型服务
用 BentoML 在生产环境运行 LLM
LLM 命令行工具
交互 LLM 的命令行工具和 Python 库
Axolotl 微调工具
简化 AI 模型微调流程的工具
h2oGPT 企业问答
企业级本地文档私有问答系统
KoboldCpp 多合一运行
一体化本地 LLM 推理运行工具
Piper 快速 TTS
快速本地神经网络文本转语音系统
Prompt Flow 工作流
构建和评估 LLM 工作流的工具
TGI 文本生成推理
HuggingFace 生产级 LLM 推理服务工具
Dolly 开源指令模型
Databricks 开源的指令跟随大语言模型
llama-cpp-python 绑定
llama.cpp 的 Python 绑定,支持 OpenAI 兼容 API
PowerInfer 低资源推理
面向消费级硬件的快速 LLM 推理引擎
BitsAndBytes 量化库
降低 LLM 显存占用的 8/4 位量化库
LMDeploy 模型部署
高效的 LLM 压缩、部署与服务工具包
Guardrails AI 输出验证
为 LLM 输出添加验证和纠正护栏
NeMo Guardrails NVIDIA 护栏
NVIDIA 为 LLM 添加可编程护栏的工具包
Marvin AI 函数库
构建自然语言接口的 AI 工具库
Enchanted iOS LLM 应用
使用本地 Ollama 模型的 iOS 私有 AI 聊天应用
TorchTune PyTorch 微调
PyTorch 原生 LLM 微调库
LLM 可视化工具
大语言模型内部结构 3D 可视化
LM Studio CLI
LM Studio 本地大模型桌面应用 CLI 工具
AutoGPTQ 模型量化
简便的 GPTQ 模型量化部署工具
文本嵌入推理服务
极速文本嵌入向量推理服务
ExLlamaV2 高效推理
量化 LLM 的高效推理库
LMQL LLM 查询语言
面向大语言模型的查询语言和运行时
Semantic Router 语义路由
LLM 超快速 AI 决策与语义路由层
Optimum 推理优化
HuggingFace 推理加速与优化工具
GPTScript LLM 脚本
像编程一样使用 LLM 的脚本语言
LLM Guard 安全防护
检测提示注入和 PII 的 LLM 安全工具包
Nitro 嵌入式推理
面向桌面和边缘设备的嵌入式 AI 推理库
FreedomGPT 本地无审查
本地运行无审查 LLM 的桌面应用
CTransformers Python 绑定
GGML/GGUF 量化模型的 Python 绑定
InstructLab 模型微调
Red Hat 社区驱动的 LLM 对齐与微调工具
本地大模型工具合集:74 个开源 LLM 本地运行工具:常见问题
本地大模型怎么运行?
最简单的方式是安装 Ollama 或 LM Studio,下载模型即可一键运行。对性能有更高要求可用 llama.cpp 进行量化推理,6GB 显存跑 7B 模型很常见。
本地运行大模型免费吗?
完全免费。所有列出的工具都是开源的,模型权重也来自开源社区(Llama/Qwen/DeepSeek 等),只要你有满足要求的硬件即可。