Full-Duplex Model(全双工模型)
Full-Duplex Model亦作、亦称:全双工模型 · Full-Duplex Model · 实时交互模型
Full-Duplex Model 是同时处理输入流和输出流的模型架构——消除半双工系统的串行依赖,将端到端延迟从 800-1500ms 压缩到 200-400ms,跨过人类对话的自然阈值。
架构突破
同时处理输入流和输出流,消除半双工系统的串行依赖(ASR→LLM→TTS),将端到端延迟从 800-1500ms 压缩到 200-400ms,跨过人类对话 200ms 的自然轮流间隔阈值。
工程挑战
延迟预算分配、流式处理计算开销、打断处理(barge-in)、多模态时间同步、安全审核实时性——五项都是半双工架构不存在的工程问题。
三条技术路线
交互侧 SeedRealtime(音视频端到端统一)、生成侧 FLUX 3(统一 transformer 骨干覆盖图像/视频/音频/动作)、语音侧 MAI Realtime(原生实时语音)——共同指向「交互循环速度」成为多模态竞争新维度。
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级系统设计查看详解 →
如何设计全模态视频生成模型的评估基准?
全模态视频生成模型的评估需覆盖画面质量、音画一致性、时序连贯性、品牌保真度、成本效率五个维度,且需区分编辑与从零生成两类任务。
- 中级概念查看详解 →
端侧 VLM(如 460M 参数量级)如何在极小参数下保持多模态理解能力?
考察候选人对端侧小型视觉语言模型工程化的理解:在数亿参数量级下,如何通过架构设计、知识蒸馏、模态对齐、量化等技术在资源受限设备上保持多模态理解能力,以及端侧部署的权衡。
- 高级场景查看详解 →
多模态(图文)微调中如何确保文本和图像数据的对齐质量?
高质量图文配对、表征对比对齐、防模态坍塌,并用检索/VQA 指标验证对齐效果。
- 中级场景查看详解 →
如何用 AI 做票据 / 证件的 OCR 信息提取?
OCR 或多模态大模型读图拿文本,再用 LLM 按 schema 抽字段并校验,模糊手写需置信度和人工复核。
外部参考
维基百科:查看「Full-Duplex Model」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
