SummFlow 2026-07-05 tools

Ollama

  • cli
  • inference

本地跑开源模型的最简入口,一行命令拉取运行,支持 GGUF 导入与量化

Ollama 把 llama.cpp 封装成一条命令就能用的本地模型运行时。装好之后 ollama run gemma4 直接下载并启动模型,从 ollama.com/library 拉取预打包模型,`ollama create` 配合 Modelfile 里的 `FROM /path/to/model.gguf` 导入 HuggingFace 上任意 GGUF 文件,也支持 Safetensors 权重导入与内置量化(--quantize q4_K_M)。后台作为常驻服务运行,暴露 localhost:11434 的 REST API,Python 与 JS/TS 有官方 SDK。提供 Docker 镜像、GPU 加速(CUDA/ROCm)和 systemd 服务集成,也有云托管 Pro($20/月)用于需要更大模型或更高并发的场景。

社区实测

Ollama 是本地运行 LLM 的最简入口,社区广泛用于本地开发和实验;但云版本与本地版本的功能差距、安全漏洞和性能上限也引发了部分批评。

  • 提供最低门槛的本地 LLM 运行方式,一行命令即可拉取并运行模型
  • 支持 GGUF 导入与量化,可运行 HuggingFace 上下载的任意模型
  • 为编码 agent(Claude Code、OpenCode、Codex 等)提供本地模型后端的一键集成(`ollama launch`)
  • 云版模型列表包含本地 Ollama 不支持的模型,社区有混淆反馈
  • 曾出现 GGUF 加载器越界读取漏洞(CVE-2026),需保持更新
  • 性能与灵活性上限不如直接使用 llama.cpp 或 vLLM 等底层方案

截至 2026-07-05

curl -fsSL https://ollama.com/install.sh | sh