![]()
官方背景
Ollama 是 MIT 开源的本地大语言模型运行时,由前 Apple 工程师 Jeffrey Morgan 创办,底层基于 llama.cpp 推理引擎,包装成类似 Docker 的 CLI + REST API。2025 年 7 月推出跨 macOS / Windows / Linux 桌面 App,免去命令行门槛。截至 2026 Q1 月下载量 5,200 万次、GitHub 100,000 + stars,是”本地 AI 民主化”的代表项目。
核心能力
① 一行命令启动:`ollama run llama3.2` 自动下载 + 启动模型;② Modelfile:类似 Dockerfile 打包模型权重 / 配置 / 系统提示;③ 自动 GPU 检测:NVIDIA CUDA / AMD ROCm / Apple Metal 即插即用;④ OpenAI 兼容 REST API:`localhost:11434/v1/` 可直接替换 OpenAI endpoint 接入现有应用;⑤ 多模态:支持 Gemma 3、Llama 3.2 Vision、LLaVA;⑥ Thinking 推理模式:Qwen 3 / DeepSeek-R1 / GPT-OSS 可显式思考;⑦ Function Calling + JSON 结构化输出 + Embeddings;⑧ 并发模型管理:多模型同时加载,VRAM 溢出自动到 RAM。
应用场景
隐私敏感行业(医疗 / 法律 / 金融 / 政府)数据完全不出本地;离线 / 内网环境的 AI 助手;研究者本地横向对比开源模型;学生学习小模型;开发者用 Ollama API 给现有应用加 LLM 而无需云端计费;企业私有部署统一管控推理资源。
定价与可及性
完全免费开源,无任何订阅或调用费;下载客户端(macOS / Windows / Linux)即可使用;硬件门槛建议 8 GB RAM 起步(CPU 推理)、16 GB + VRAM 跑 13 B 级、24 GB + VRAM 跑 70 B;模型库免费:Llama 3.x、Mistral / Mixtral、Qwen 2.5 / 3、Gemma 2 / 3、Phi-3.5 / 4、DeepSeek-R1 / v3.1、GPT-OSS、CodeLlama 等;社区驱动 GitHub Issues + Discord 支持。
Ollama · Ollama 是 MIT 开源的本地大语言模型运行时,由前 App…
暂无评论内容