如果你正在跟进 2026 年夏季的中国大模型发布潮,并需要判断 Qwen3.8-Max 是否值得接入生产 API、等待开源权重,还是继续观望 Kimi K3 与 DeepSeek V4,这篇文章按时间线、核心参数、横向对比与透明度争议四个维度展开——阿里巴巴于 8 月 3 日正式 GA 的旗舰模型总参数 2.4 万亿、激活 950 亿、1M token 上下文,Arena 文本竞技场初步排名第 5,但权重尚未开源,全部跑分目前均来自阿里自测。

时间线:从预览版到正式发布,两周内节奏很快

  • 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数量与跑分表,服务条款禁止自动化生产环境调用。
  • 7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源部分底层基础设施。
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变的前提下,智能体与代码类基准大幅超过自家 V4-Pro 预览版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线。阿里港股当日上涨约 7%,美股上涨约 4.5%。
  • 预计 8 月 10 日前后:Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,截至发稿具体日期与开源协议均未公布。

在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型——但排名标注为「初步(Preliminary)」,且所有跑分均为阿里自测,第三方权威平台尚未收录正式版复现结果。

核心数据一览:参数、定价与跑分

项目Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价输入 $2/百万 token,输出 $6/百万 token
Arena 文本竞技场(8 月 1 日快照)第 5 名,1496 分(初步)
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代提升 28.2 分)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

带「阿里自测」标注的数据均来自官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台的正式复现结果。价格与参数可能随时间变化,请以官方页面为准。

深度拆解:2.4 万亿参数背后,阿里想解决什么问题

为什么是 MoE + 混合注意力,而不是单纯堆参数? 稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到 $2/$6 每百万 token、明显低于 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)的原因。

reasoning_effort 三档设计解决成本可控问题。 模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

长程自主任务是核心卖点,但验证方式值得关注。 阿里案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench——模型在黑盒环境下仅凭交互和视觉反馈还原真实应用。部分过程记录在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但并非完整可复现的第三方审计。

  1. 确认 API 兼容层:OpenAI 与 Anthropic 双协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链。
  2. 按任务选择 reasoning_effort:简单路由用 low,复杂 Agent 用 xhigh,控制 token 成本。
  3. 等待 Qwen3.8-27B 开源权重:若需本地私有化部署,精简版比完整 2.4T 更现实。
  4. 在自有业务场景做 A/B 测试:第三方独立评测尚未覆盖 GA 正式版。
  5. 关注 Hugging Face / ModelScope 仓库上线时间与许可证条款。
  6. 对比已有开源方案:Kimi K3(7 月 27 日已开源)与 DeepSeek V4 系列可作为基准参照。

横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude

模型厂商总参数/激活上下文定价(输入/输出,每百万 token)权重开源独立第三方评测
Qwen3.8-Max阿里巴巴2.4T / 950 亿100 万$2 / $6未开源(承诺中)暂无
Kimi K3月之暗面2.8T / 约 500 亿约 104.8 万$3 / $15已开源(7 月 27 日)Artificial Analysis ≈ 57.11 分
DeepSeek V4-ProDeepSeek1.6T / 490 亿100 万未公开完整表已开源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek未变(较 V4-Pro)100 万未公开完整表已开源9 项智能体/代码基准超 V4-Pro
Claude Opus 5Anthropic未公开100 万$5 / $25闭源Arena 前列
Claude Fable 5Anthropic未公开100 万$10 / $50闭源Arena 文本第 1 名

唯一可比的独立盲测中(同一组 269 个文件的真实项目架构设计任务),Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于同档位互有胜负。Kimi K3 的优势是已开源并有第三方评测;Qwen3.8-Max 的优势是 API 价格更低、多模态更全面。更多定价背景可参考本站 GPT-5.6 降价与竞品 API 定价对比

可引用技术信息与数据来源

  • MoE 激活效率:总参数 2.4T、激活 950 亿——推理成本跟踪激活量而非总量,是 $2/$6 定价的基础(阿里官方发布材料)。
  • Arena 文本竞技场:2026 年 8 月 1 日快照排名第 5、1496 分,标注「Preliminary」,前 4 名与第 6–8 名均为 Anthropic 模型(Arena.ai 公开排行榜)。
  • 独立盲测:Kimi K3 83 分 vs Qwen3.8-Max 预览版 80 分(269 文件真实架构任务,第三方评测机构,非阿里自测)。
  • Apple Intelligence 中国版:经压缩的 Qwen 模型(约 27B 参数、4GB 以内)已在 iPhone 15 及以上机型本地运行——千问商业化半径已延伸至系统级 AI(公开报道)。

以下为可核验官方与第三方来源,发布前请以最新公告为准:

Arena.ai 文本与视觉竞技场公开排行榜

Hugging Face(权重上线状态以仓库实际存在为准)

Alibaba Cloud 官方公告与 Model Studio 定价页

争议点:「开源」标签挂得比权重早

  1. 官网已标注「Open-Source」,权重尚未发布。 qwen.ai 在 GA 当天即打上开源标签,但 Hugging Face 与 ModelScope 尚无对应仓库与许可证。
  2. 所有跑分均来自阿里自建测试框架,包括 PaperBench、QwenSWEBench、RecreationBench 等内部基准;中立平台截至发稿未对正式版给出独立复现。
  3. 跑分表脚注暗指竞品数据存疑——称「Fable 5 的结果可能涉及 fallback」,但阿里自身测试方法论同样未公开到可第三方复现程度。
  4. 预览阶段透明度不足:7 月 19 日预览版未公开激活参数、模型卡与安全评估,多家独立评测机构建议勿迁移生产系统。

FAQ

Qwen3.8-Max 现在能直接用吗?开源了没有?

API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 两种接口协议。权重尚未开源,预计 8 月 10 日前后公布 Hugging Face / ModelScope 仓库与协议条款,具体日期以官方公告为准。

Qwen3.8-Max 和 Kimi K3 到底谁更强?

目前没有权威统一评测。唯一独立盲测显示两者打分接近(83 vs 80),属于同档位互有胜负。Kimi K3 已开源并有第三方数据;Qwen3.8-Max API 价格更低、多模态更全面。

2.4 万亿参数是不是普通开发者根本用不了?

总参数与激活参数需区分:950 亿激活量通过 API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心级硬件;更现实的选择是等待 Qwen3.8-27B 开源权重。

阿里公布的跑分能信吗?

可作参考,不能当作定论。建议关注后续独立评测复测,或在自己的业务场景做 A/B 测试。Arena 排名目前标注为「初步」。

Qwen3.8-Max 的发布把 2026 年夏季的参数竞赛推到了新高度,但「全球第一梯队」的结论目前仍主要依赖厂商自测——在权重落地、第三方复现完成之前,若你需要在真实 Apple Silicon 硬件上验证 Qwen3.8-27B 或同类本地 Agent 工作流,一台整机独享、可随时重置环境的物理主机往往比共享 GPU 集群更可控。VMSPIN 按天起租的云端 Mac mini 提供 MDM 自动交付与 SSH + VNC 双通道接入,适合短期 benchmark 与多区域部署;若你还在对比 API 成本与本地推理方案,可结合 Mac mini M4 租赁全解析定价页 一起评估。