阿里通义发布Qwen3.8-Flash:125B多模态MoE模型,支持百万级上下文,训练成本降至前代九分之一
SmartHey8月26日消息,阿里通义千问团队今晚正式发布全新大模型 Qwen3.8-Flash。同步开源 Qwen3.8-Flash-Next 的权重,该架构作为下一代 Qwen4 系列的原型,标志着通义模型技术进入新阶段。

Qwen3.8-Flash 是一款原生多模态专家混合(MoE)模型,主干参数量达 1250 亿(125B),并额外集成 510 亿(51B)N-gram Embedding 模块;每 token 实际激活参数约 60 亿(6B)。模型原生支持长达 262,144 tokens 的上下文长度,并可通过 YaRN 技术无缝扩展至 100 万(1M)tokens。
本次升级围绕四大核心技术方向展开:
Attention 架构革新:采用 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)混合机制。GDN 高效压缩历史信息,QSA 则基于轻量级 Indexer,在 micro-block 粒度上动态筛选关键上下文,显著降低长序列计算开销。在 1M token 场景下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍与 4.9 倍加速。
Residual 结构升级:引入 Gated Residual(GR)机制,将残差路径拓展为 4 条并行分支,由动态 Gate 控制信息流向;残差状态支持 FP8 精度存储,大幅减少显存带宽压力。
Embedding 创新设计:新增 51B 参数的 N-gram Embedding 模块,利用局部上下文查表方式扩展模型表达能力。该模块可卸载至主机内存(Host Memory),通过异步 Prefetch 与主模型计算重叠执行,避免长期占用 GPU 显存。
优化器与训练策略迭代:采用自研 Muon Optimizer,并针对性优化正交化精度、参数分工逻辑及融合矩阵拆分策略;同时基于新架构重新拟合模型 Scaling Law,提升训练稳定性与泛化效率。
性能与成本优势
相比前代 Qwen3.7-Plus,Qwen3.8-Flash 训练成本仅为其约 1/9,却在编程、办公等关键任务上展现出更强综合能力。
在仅激活 6B 参数的前提下,Qwen3.8-Flash-Next-Base 已在 14 个主流基准测试中的 8 项取得 SOTA(最优)成绩,涵盖 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU 等高难度评测集。
模型表现对比
纯文本理解能力:

多模态理解能力:

整体模型结构示意:

Base 版本综合性能排名:

开放与商用支持
Qwen3.8-Flash 即将上线千问 AI 平台,面向开发者与企业开放 API 接入服务,定价为:输入每百万 tokens 1 元,输出每百万 tokens 3 元。
模型完整权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台正式开源,并同步提供高性能 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文长度,并预置官方工具链,开箱即用。
