端侧 Agent(On-Device Agent)
端侧 Agent替你跨应用干活的手机 AI
亦作、亦称:On-Device Agent · 端侧 Agent · On-device Agent · 设备端 Agent
端侧 Agent(On-Device Agent)以本地模型加 OS 系统级集成为底座,在设备端执行跨应用多步任务——Made by Google 2026 把 Agent 能力下沉到芯片与内存门槛,硬件规格表开始直接成为功能清单。
能力栈:从推理层到 Agent 系统层
端侧 AI 能力分两层:推理层(见 edge-inference)解决模型能在设备上跑——量化、压缩、端云协同;Agent 系统层解决 Agent 能替用户跨应用干活。
后者要求三个条件同时成立:本地模型常驻(权重与 KV cache)、多应用上下文读写(系统级接口)、任务规划与执行闭环。三者叠加的内存需求,正是内存容量成为能力门槛的原因。
硬件门槛:为什么 RAM 决定能力档位
端侧 Agent 的内存账本有三笔:模型权重常驻、KV cache 与多应用上下文、与 OS 和前台应用共存的剩余配额。
Google 把 12GB 划为 Gemini Intelligence 的门槛(Pixel 11 世代,部分上代机型不满足;多源交叉,provisional):低于门槛不是体验降级而是能力集缺失——硬件规格表直接成为功能清单,这是端侧 Agent 的第一个硬件化特征。
生态锁定:芯片+商店+助手闭环
端侧 Agent 天然是生态业务:自研芯片(Tensor G6)控制能力上限,自有商店控制应用集成接口,系统助手占据用户入口,三者构成闭环。
架构含义:闭环缺一环,架构就建在别人的地基上;第三方 Agent 拿到的权限面会随时间收窄,核心价值必须沉淀在自己可控的层。这一闭环结构是端侧 Agent 竞争从应用层下沉到硬件层的原因。
与相邻概念的边界
与 edge-inference(推理层)不同:本条目是 Agent 系统层,关注任务编排、权限与生态而非模型压缩。
与 rpa 不同:RPA 模拟人类 GUI 操作,端侧 Agent 经系统级集成获得结构化接口。与云端 Agent 不同:端侧 Agent 必须在离线、延迟与隐私边界约束下做端云卸载决策,这是内生设计变量而非可选项。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「替你跨应用干活的手机 AI」
- 「Agent 能力下沉到硬件层」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计查看详解 →
端侧 Agent 部署的硬件约束与系统设计:手机如何承载跨应用 Agent?
Made by Google 2026 把端侧 Agent 从应用层功能变成硬件全栈竞争:Pixel 11 以 12GB 内存门槛划定 Gemini Intelligence 的准入线,Tensor G6 提供算力底座,覆盖 40+ 应用的多步任务自动化(部分数字来自多源交叉,官方页未深读,属 provisional)。本题考察候选人能否从内存门槛的机制出发,完成芯片选型、端云卸载决策、权限/隐私边界、OEM 生态锁定四个维度的端侧 Agent 系统设计,并与纯端侧推理优化题划清边界。
- 中级系统设计查看详解 →
如何为 AI Agent 交易设计审计和权限控制?
考察候选人对 Agent 经济活动的审计和权限控制设计,特别是 Smart Tokens 等可编程支付工具的应用。
- 高级系统设计查看详解 →
Multi-Agent 系统中如何处理 Agent 遗忘/状态丢失?
考察候选人对 Multi-Agent 系统中状态管理和容错设计的理解,特别是 Agent 崩溃、重启或上下文丢失时的恢复策略。
- 高级系统设计查看详解 →
设计一个 Agent 长期记忆系统,支持可写外部记忆、过期策略和冲突解决
考察候选人对 Agent 记忆架构的理解,特别是从 RAG 只读到可写外部记忆的演进,以及过期、冲突解决等工程挑战。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「端侧 Agent」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
