工具 / Ollama

Ollama

  • cli
  • inference

本地跑开源模型的最简入口,一行命令拉取运行,支持 GGUF 导入与量化

Ollama 把 llama.cpp 封装成一条命令就能用的本地模型运行时。装好之后 ollama run gemma4 直接下载并启动模型,从 ollama.com/library 拉取预打包模型,`ollama create` 配合 Modelfile 里的 `FROM /path/to/model.gguf` 导入 HuggingFace 上任意 GGUF 文件,也支持 Safetensors 权重导入与内置量化(--quantize q4_K_M)。后台作为常驻服务运行,暴露 localhost:11434 的 REST API,Python 与 JS/TS 有官方 SDK。提供 Docker 镜像、GPU 加速(CUDA/ROCm)和 systemd 服务集成,也有云托管 Pro($20/月)用于需要更大模型或更高并发的场景。

社区实测

最容易上手的本地 LLM 工具,入门体验好,但进阶用户常因抽象层开销转向更底层方案

  • 降低本地 LLM 使用门槛,无需复杂配置即可运行模型
  • 易于集成到现有工作流中
  • API 生态开放,用户可自行构建反向代理等扩展工具
  • 底层依赖 llama.cpp,多了一层抽象,部分用户认为不如直接用 llama.cpp 贴近硬件
  • 当工作流变复杂后,抛光桌面体验、更精细控制性能或更快模型服务等需求可能推动用户转向替代方案
  • 复杂度持续增长,面临定位模糊的风险

截至 2026-08-05

curl -fsSL https://ollama.com/install.sh | sh

← 返回工具库