Alibaba 发布 Qwen3.8-Flash-Next:125B 参数 Qwen4 架构预览,6B 激活参数
Alibaba Qwen 团队 8 月 26 日发布 Qwen3.8-Flash-Next,这是 Qwen4 架构的首个公开预览。125B 总参数 MoE 架构,每 token 仅激活 6B 参数,另有 51B n-gram 嵌入表和 4B MTP 模块。原生 262K 上下文(YaRN 可扩展至 1M),原生多模态(文本/图像/视频)。权重在 Hugging Face 和 ModelScope 开放,Apache 2.0 许可。API 定价 $0.16/M 输入,$0.47/M 输出。
Alibaba 发布 Qwen3.8-Flash-Next
2026 年 8 月 26 日,Alibaba Qwen 团队发布 Qwen3.8-Flash-Next,这是 Qwen4 架构的首个公开预览。
关键事实
| 项目 | 详情 |
|---|---|
| 架构 | 125B 总参数 MoE,6B 激活参数 |
| 附加模块 | 51B n-gram 嵌入表 + 4B MTP |
| 上下文 | 262K 原生(YaRN 可扩展至 1M) |
| 多模态 | 文本/图像/视频输入,文本输出 |
| 许可 | Apache 2.0(待最终确认) |
| API 定价 | $0.16/M 输入,$0.47/M 输出 |
| 权重 | Hugging Face 和 ModelScope 开放 |
架构创新
Qwen3.8-Flash-Next 的核心创新是 n-gram 嵌入表设计:
- 51B n-gram 嵌入表:将部分计算从 Transformer 层转移到查找表,降低计算成本
- 6B 激活参数:每 token 仅激活 6B 参数,消费级硬件可运行
- 4B MTP 模块:Multi-Token Prediction 模块,提升生成效率
- 混合注意力:线性 + 稀疏注意力,降低 KV-cache 需求
生态准备
Alibaba 采用"生态先行"策略:
- 推理框架:Unsloth、llama.cpp、vLLM、MLX 已承诺 day-zero 支持
- 量化支持:GGUF、NVFP4 量化版本同步发布
- 硬件适配:AMD、NVIDIA、Apple Silicon 均支持
影响分析
| 维度 | 影响 |
|---|---|
| 架构创新 | n-gram 嵌入表降低计算成本 |
| 开源生态 | Apache 2.0 许可,商业友好 |
| 推理成本 | Flash 级定价,适合高吞吐场景 |
| 生态准备 | 推理框架 day-zero 支持 |
风险边界与后续观察
- 独立评测:社区需验证官方基准的可复现性
- 许可确认:最终许可条款待权重正式发布后确认
- 竞争格局:与 GLM-5.3-Flash、Qwen3.8-27B 的同级对比
AI Master 解读
核心事件
Alibaba 发布 Qwen3.8-Flash-Next,预览 Qwen4 架构。
行业影响
为什么重要: 这是 Qwen4 架构的首次公开亮相,采用创新的 n-gram 嵌入表设计(51B 参数),将部分计算从昂贵的 Transformer 层转移到更廉价的查找表。6B 激活参数意味着消费级硬件(16-17GB VRAM)可运行。Unsloth 等推理框架已承诺 day-zero 支持,为 Qwen4 正式铺路。
影响分析:
| 维度 | 影响 |
|---|---|
| 架构创新 | n-gram 嵌入表降低计算成本 |
| 开源生态 | Apache 2.0 许可,商业友好 |
| 推理成本 | Flash 级定价,适合高吞吐场景 |
| 生态准备 | 推理框架 day-zero 支持 |
AI Master 建议
评估 Qwen3.8-Flash-Next 在编码和 Agent 场景的实际表现;关注 n-gram 嵌入表的实际效果;对比 GLM-5.3-Flash 和 Qwen3.8-27B 的同级竞争。
