Ollama
Ollama本地跑模型的利器
Ollama 是 2023 年发布的开源本地大模型运行时,让用户在 macOS、Linux、Windows 上一键拉取并运行 Llama、Qwen、DeepSeek 等开放权重模型。它通过 llama.cpp 后端与 GGUF 量化格式,把「本地推理」从命令行极客场景带入普通开发者桌面,是边缘部署与隐私敏感场景的事实标准工具之一。
概述
Ollama 提供 CLI、本地 REST API(默认 11434 端口)与模型库管理,支持 pull/run/import。用户无需手写推理代码即可在本地对话、嵌入或对接应用。MIT 协议、Go 实现,与 Open WebUI 等前端常搭配使用。
技术架构
底层依赖 llama.cpp 做 C/C++ 高效推理;模型以 GGUF 存储,支持 INT4/INT8 等量化变体以适配不同显存。Ollama 将 Hugging Face 等来源的权重封装为统一 Modelfile,屏蔽各模型族配置差异。
应用场景
典型场景包括:离线开发调试、敏感数据不出域的 RAG、低成本原型验证、与 Cursor/Continue 等编码助手集成。局限是单卡吞吐不及专用推理集群,超大模型仍受本机显存约束。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「本地跑模型的利器」
- 「一行命令跑 LLaMA」
- 「比 llama.cpp 方便」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级场景查看详解 →
如何把开源大模型在本地 / 内网跑起来?
用 Ollama/llama.cpp/vLLM 加载开源权重,按显存选模型大小与量化,适合隐私离线场景。
- 初级概念高频查看详解 →
什么是 AI Agent?它与大语言模型(LLM)的本质区别是什么?
AI Agent 是以 LLM 为大脑、能感知环境并自主规划、调用工具、多步执行并按反馈迭代以达成目标的系统;LLM 只是无状态的文本输入到输出函数。
- 中级概念查看详解 →
什么是 GPTCache?它如何帮助降低 AI 应用成本?
GPTCache 是面向 LLM 的语义缓存层,把"问题→回答"缓存,新请求先做语义相似度匹配,命中即返回缓存答案,从而省 token、降延迟、扛并发。
- 中级场景查看详解 →
智能工单分类系统中,AI 可参与哪些环节?技术选型思路是什么?
AI 可参与工单的自动分类打标、意图情绪识别、智能路由、相似聚合去重、知识推荐、回复草稿与 SLA 预警等环节。选型上高频固定类别用轻量分类模型、复杂少样本用 LLM,并可混合编排,配人工复核闭环。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
认识 AI:从概念到实践的全景导览
全面介绍人工智能是什么、它能做什么、主流技术栈和工具生态,以及你应该如何系统学习 AI。这是你 AI 学习之旅的第一站。
- 2
AI Agent 平民化:从实验室到桌面的演进之路
AI Agent 正在从研究实验室和企业级产品走向普通消费者桌面。本文系统梳理 AI Agent 平民化的完整演进路径——从技术门槛的持续降低、架构范式的根本转变、开源生态的爆发式增长,到 Meta Hatch、OpenClaw 等消费级产品的路线对比。涵盖 Agent 平民化的核心驱动力、关键基础设施、典型架构模式、安全挑战与治理框架,以及未来 3-5 年的趋势预判。适合 AI 工程师、产品经理和对消费者 AI 趋势感兴趣的技术决策者。
- 3
AI 个人助手生态全景对比:从 OpenClaw 到 Google Remy 到 Meta Hatch 的完整解析
2026 年,AI 个人助手正在经历从「浏览器插件」到「全场景集成代理」的范式转移。Google 推出 Remy、Meta 发布 Hatch、OpenClaw 持续迭代、Google Gemini 全面升级——四大阵营各有不同的技术路线和产品定位。本文系统对比四大 AI 个人助手的技术架构、能力边界、生态策略和适用场景,帮助开发者和用户做出明智选择。
外部参考
维基百科:查看「Ollama」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
