fGPU(Fractional GPU,分数 GPU)
fGPU一张 GPU 切给多个租户
亦作、亦称:Fractional GPU,分数 GPU · fGPU · Fractional GPU · 分数 GPU · GPU 切分
fGPU 把单张 GPU 切分为多个分数实例供多租户共享。Lablup(Backend.AI)凭此能力成为 KOSDAQ 最快上市之一(poolId P018)——GPU 细粒度调度已从工程技巧变为商业基础设施。
动机与定义
推理负载碎片化是 fGPU 的直接动机:多数生产推理任务用不满一整张高端 GPU,独占分配导致利用率与成本双输。fGPU 把单张物理 GPU 切分为多个分数实例,按时间片、显存配额与算力配额在多租户/多任务间共享。
与 MIG 的取舍
与 NVIDIA MIG(硬件级切分)相比,fGPU 更偏软件层抽象:粒度更细、跨硬件更通用、可动态调整;代价是隔离性与性能干扰需要软件层管理。选型判据:强隔离合规场景偏 MIG,弹性成本优化场景偏 fGPU。
商业化信号
2026-07 Lablup(Backend.AI 开发商)成为 KOSDAQ 史上最快获批上市的公司之一(poolId P018),其平台核心能力之一即 GPU 细粒度分片调度。资本市场为 GPU 虚拟化买单,说明 fGPU 已从工程技巧变为 AI 基础设施的标准组件。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「一张 GPU 切给多个租户」
- 「GPU 虚拟化与细粒度调度」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级系统设计查看详解 →
如何处理系统设计面试题?
先澄清功能与非功能需求并估算 QPS/存储;再给高层架构;然后深入关键路径(数据模型、缓存、一致性);全程沟通 trade-off 与扩展方案。
- 中级概念查看详解 →
JetBrains KotlinLLM 的 Smart Macros 如何把「运行时 LLM 调用」变成「一次性代码生成」?适用与不适用的边界在哪?
KotlinLLM(2026-07-28 开源,Apache 2.0)用 Smart macros 把 LLM 从永久服务依赖重定位为一次性编译器:首次遇到新场景时生成 Kotlin 源码、持久化落盘、JDI 热重载,之后同场景执行纯 Kotlin,零模型调用。
- 中级场景高频查看详解 →
企业 AI 编码工具选型应考虑哪些维度?结合 Disney 弃用 Copilot 案例分析。
2026 年 7 月 Disney 弃用 GitHub Copilot 转投 OpenAI Codex,但内部仍高频使用 Claude。企业选型需考虑产品形态、执行环境、安全合规、总拥有成本四个维度,多工具组合是大型企业的务实策略。
- 中级概念查看详解 →
对比 S3 Vectors、SQL Server DiskANN 和 DynamoDB 原生向量搜索的架构差异与适用场景
考察候选人对「数据库原生向量搜索」这一 2026 年架构迁移趋势的理解:DiskANN 等磁盘级 ANN 算法如何让传统数据库内置向量检索,与独立向量库如何取舍,以及 S3 Vectors / SQL Server 2025 / DynamoDB 等方案的定位差异。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「fGPU」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
