模型部署
vLLM 高吞吐推理
⭐ 90k+ GitHub Stars
基于 PagedAttention 的高吞吐 LLM 推理服务
Unsloth 极速微调
⭐ 75k+ GitHub Stars
速度提升 2-5 倍、显存减少 70% 的 LLM 微调工具
DeepSpeed 分布式训练
⭐ 43k+ GitHub Stars
微软深度学习大规模训练优化库
SGLang 结构化生成
⭐ 32k+ GitHub Stars
大语言和视觉模型的高速推理服务框架
Faster Whisper 加速识别
⭐ 25k+ GitHub Stars
基于 CTranslate2 的 4 倍加速 Whisper 实现
ONNX Runtime 推理引擎
⭐ 22k+ GitHub Stars
微软跨平台机器学习推理加速器
TensorRT-LLM 推理加速
⭐ 14k+ GitHub Stars
NVIDIA 大模型推理加速工具包
SD WebUI Forge 加速版
⭐ 13k+ GitHub Stars
更快速低显存占用的 SD WebUI 优化版
OpenLLM 模型服务
⭐ 13k+ GitHub Stars
用 BentoML 在生产环境运行 LLM
TGI 文本生成推理
⭐ 11k+ GitHub Stars
HuggingFace 生产级 LLM 推理服务工具
PowerInfer 低资源推理
⭐ 9.7k+ GitHub Stars
面向消费级硬件的快速 LLM 推理引擎
BentoML 模型服务
⭐ 8.8k+ GitHub Stars
构建、打包和运行 AI 应用的框架
LMDeploy 模型部署
⭐ 8.0k+ GitHub Stars
高效的 LLM 压缩、部署与服务工具包
文本嵌入推理服务
⭐ 5.0k+ GitHub Stars
极速文本嵌入向量推理服务
AI 模型推理部署工具:7 个开源引擎:常见问题
大模型推理引擎怎么选?
在线高并发场景选 vLLM,跨平台部署选 ONNX Runtime,语音识别选 Faster-Whisper。