Ollama
本地跑开源模型的最简入口,一行命令拉取运行,支持 GGUF 导入与量化
Ollama 把 llama.cpp 封装成一条命令就能用的本地模型运行时。装好之后 ollama run gemma4 直接下载并启动模型,从 ollama.com/library 拉取预打包模型,`ollama create` 配合 Modelfile 里的 `FROM /path/to/model.gguf` 导入 HuggingFace 上任意 GGUF 文件,也支持 Safetensors 权重导入与内置量化(--quantize q4_K_M)。后台作为常驻服务运行,暴露 localhost:11434 的 REST API,Python 与 JS/TS 有官方 SDK。提供 Docker 镜像、GPU 加速(CUDA/ROCm)和 systemd 服务集成,也有云托管 Pro($20/月)用于需要更大模型或更高并发的场景。
社区实测
Ollama 是本地运行 LLM 的最简入口,社区广泛用于本地开发和实验;但云版本与本地版本的功能差距、安全漏洞和性能上限也引发了部分批评。
- 提供最低门槛的本地 LLM 运行方式,一行命令即可拉取并运行模型
- 支持 GGUF 导入与量化,可运行 HuggingFace 上下载的任意模型
- 为编码 agent(Claude Code、OpenCode、Codex 等)提供本地模型后端的一键集成(`ollama launch`)
- 云版模型列表包含本地 Ollama 不支持的模型,社区有混淆反馈
- 曾出现 GGUF 加载器越界读取漏洞(CVE-2026),需保持更新
- 性能与灵活性上限不如直接使用 llama.cpp 或 vLLM 等底层方案
What projects do you have planned for Ollama in 2025? | RedditBeen disappointed to see Ollama list models that are supported by the cloud product | Hacker NewsWhy You Should Completely Avoid Ollama in 2026 | GoPenAI
截至 2026-07-05
curl -fsSL https://ollama.com/install.sh | sh docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama pip install ollama npm i ollama