Qwen3.8-Flash-Next是什么
Qwen3.8-Flash-Next 是阿里 Qwen 发布的开源权重多模态 MoE 模型,定位为 Qwen4 架构的先导预览:主模型 125B 参数,另配 51B N-gram Embedding,每 token 仅激活约 6B;原生支持 262K 上下文,可经 YaRN 扩至 1M。用 GDN+QSA 混合注意力、Gated Residual、N-gram Embedding 与 Muon 优化器压低长上下文与训练成本,官方称训练开销约为 Qwen3.7-Plus 的 1/9;生产 API 名为 qwen3.8-flash,主打编码、智能体、办公自动化等高并发性价比场景。

Qwen3.8-Flash-Next的功能特色
- 开放权重的多模态 MoE:主模型 125B 参数、每 token 激活约 6B,并额外带 51B N-gram Embedding,兼顾能力与推理成本。
- 超长上下文:原生 262,144 tokens,YaRN 可扩展到 1,000,000 tokens,面向长文档、长代码库和长链路任务。
- 长上下文效率架构:GDN 负责压缩记忆,QSA 在 micro-block 粒度筛选关键上下文,降低 1M 场景下的 attention 与 KV cache 开销。
- 更稳的深层信息传递:Gated Residual 把残差流扩成 4 条分支并动态门控读写,提升跨层传递与训练稳定性,残差状态还可 FP8 存储。
- 低成本扩容:N-gram Embedding 用局部上下文查表增加“局部模式记忆”,参数可放 Host Memory 并异步预取,几乎不增加每 token 计算。
- 面向编码与智能体:官方基准突出 agentic coding、工具调用、办公长任务与多模态操作,如 SWE-bench Pro、Toolathlon、CoWorkBench、AndroidWorld/OSWorld 等。
- 生态与接入:生产 API 以 qwen3.8-flash 提供,兼容 OpenAI/Anthropic 协议,可接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具。
Qwen3.8-Flash-Next的核心优势
- 极致性价比:125B 总参数但每次只激活约 6B,官方称训练成本约为 Qwen3.7-Plus 的 1/9;生产 API 每百万 tokens 输入 1 元、输出 3 元。
- 长上下文更便宜:GDN+QSA 把“记住”和“查找”分工,官方称 1M token 下 attention kernel prefill/decode 最高加速 7.6×/4.9×,90% prefix cache 场景 prefill 吞吐达 Qwen3.7-Plus 的 8.6 倍。
- 容量扩展几乎不增算力:51B N-gram Embedding 用局部上下文查表扩容,可卸载到 Host Memory 并异步预取,确定性寻址不计入每 token 矩阵乘预算。
- 训练稳定性与扩展效率更强:Gated Residual 四分支残差、Muon 优化器分工与重拟合 Scaling Law,官方还称可取消 Batch Size Warmup,减少约 18.8% optimizer steps。
- 偏实战的智能体/编码能力:官方基准中 SWE-bench Pro 62.5、Toolathlon Verified 73.5、CoWorkBench 73.9,多模态侧 AndroidWorld 84.5、MathVision 含 CI 95.7;但仍属官方自报口径。
- 落地路径完整:开放权重上 Hugging Face/ModelScope,托管 API 兼容 OpenAI 与 Anthropic 协议,可直接接 Claude Code、Codex、Qwen Code、OpenClaw 等主流编程/智能体工具。
Qwen3.8-Flash-Next官网是什么
- 项目官网:https://qwen.ai/blog?id=qwen3.8-flash-next
- HuggingFace模型库:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
- 技术论文:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
Qwen3.8-Flash-Next的操作步骤
- 先选使用方式:生产调用走千问 AI 平台的
qwen3.8-flash;研究/自部署用开放权重Qwen3.8-Flash-Next(Hugging Face / ModelScope)。 - 准备 API 凭证:在千问平台创建 Key,设置
DASHSCOPE_API_KEY,按需选北京、新加坡或美西 compatible-mode base URL。 - 发起最小调用:用 OpenAI 兼容客户端请求
model="qwen3.8-flash",可开enable_thinking=True,reasoning_effort选low/medium/xhigh,建议stream=True读取 reasoning 与 answer。 - 接入编程/智能体工具:Claude Code 设
ANTHROPIC_MODEL=qwen3.8-flash与 Anthropic base URL;Codex 在model-catalog.local.json配context_window: 1000000、reasoning levels后用 Responses 协议;Qwen Code/Qoder/OpenClaw 也有对应命令或 JSON 配置。 - 自部署时核对硬件:下载 FP8 权重,优先按官方生态用 vLLM/SGLang 类方案;注意 ultra-sparse MoE、MTP speculative、N-gram offload 目前仅 NVIDIA,量化块与 TP/TEP 配置不能随意组合。
- 灰度验证再上量:先用 32K–256K 常规上下文测延迟、命中率和工具调用成功率,再开 YaRN/1M 与 prefix cache;用自身任务做 A/B,别直接采信官方 benchmark。
- 控制成本与稳定性:按输入 1 元/输出 3 元每百万 tokens 估算,限制 max tokens、复用前缀、分流简单请求到更低 reasoning effort,并监控长上下文下的显存/内存与吞吐。
Qwen3.8-Flash-Next的适用人群
- 高并发、成本敏感的业务团队:客服、内容生产、批量办公自动化等,看重 6B 激活、1M 上下文与低价 API 的组合。
- 编程助手 / Agentic Coding 团队:要用 Claude Code、Codex、Qwen Code、OpenClaw 等做仓库级修复、工具调用和长链路开发任务。
- 长上下文场景用户:法律/金融/咨询/科研阅读、长合同、长财报、代码库理解,需要 262K 原生上下文并可扩展到 1M。
- 企业办公与知识工作流团队:千问办公、报表、文档、跨部门流程自动化等长周期 office/agent 任务较匹配。
- 多模态操作类产品:网页复刻、移动端/桌面端 GUI 操作、图表数学理解、视频理解等,可关注其 AndroidWorld、OSWorld、Vision2Web、MathVision 方向。
- 有 infra 能力的研究/平台团队:想提前验证 Qwen4 架构、做二次训练/评测/私有化部署;但自部署需接受 FP8、MoE、N-gram offload 与 NVIDIA 硬件约束。
Qwen3.8-Flash-Next的常见问题
Q:它和 qwen3.8-flash 是同一个吗?
A:严格说不是同一交付形态:Qwen3.8-Flash-Next 指开放权重/架构预览版;qwen3.8-flash 是千问平台生产 API 名称,官方称其默认 1M 上下文并内置官方工具。
A:严格说不是同一交付形态:Qwen3.8-Flash-Next 指开放权重/架构预览版;qwen3.8-flash 是千问平台生产 API 名称,官方称其默认 1M 上下文并内置官方工具。
Q:是否开源、从哪里下载?
A:官方称权重已在 Hugging Face 与 ModelScope 发布,GitHub 有技术报告与相关说明。
A:官方称权重已在 Hugging Face 与 ModelScope 发布,GitHub 有技术报告与相关说明。
Q:规模多大?推理贵不贵?
A:主模型 125B,另有 51B N-gram Embedding 与约 4B MTP;每 token 激活约 6B。N-gram Embedding 是确定性查表,不进入每 token 矩阵乘预算。
A:主模型 125B,另有 51B N-gram Embedding 与约 4B MTP;每 token 激活约 6B。N-gram Embedding 是确定性查表,不进入每 token 矩阵乘预算。
Q:上下文长度多少?
A:原生 262,144 tokens,可通过 YaRN 扩展到 1,000,000 tokens;生产 API 配置里也标称 1M context window。
A:原生 262,144 tokens,可通过 YaRN 扩展到 1,000,000 tokens;生产 API 配置里也标称 1M context window。
Q:核心架构升级有哪些?
A:四件事:GDN+QSA 混合注意力;Gated Residual 四分支残差;N-gram Embedding 查表扩容;Muon 优化器与针对新架构重拟合 Scaling Law。
A:四件事:GDN+QSA 混合注意力;Gated Residual 四分支残差;N-gram Embedding 查表扩容;Muon 优化器与针对新架构重拟合 Scaling Law。
Q:官方说的性能能直接信吗?
A:建议把 DeepSWE 58.7、SWE-bench Pro 62.5、LiveCodeBench 91.9 等当“官方自测参考”。发布初期第三方复现有限,关键业务应做自己的 A/B 与回归集验证。
A:建议把 DeepSWE 58.7、SWE-bench Pro 62.5、LiveCodeBench 91.9 等当“官方自测参考”。发布初期第三方复现有限,关键业务应做自己的 A/B 与回归集验证。
© 版权声明
文章版权归 AI分享圈 所有,未经允许请勿转载。
相关文章
暂无评论...




