全站模型 85 折 🎉 相比 OpenRouter 标价再省 15%。浏览模型 →
博客
ApiFlux Team阅读时间 6 分钟

Qwen3.8-Max:2.4T 参数、零 benchmark — 哪些是真的,哪些还只是发表会上的话

阿里 Qwen3.8-Max 已开放预览:2.4T 参数、多模态,但截至目前没有任何公开 benchmark、没有 model card、开源时间已跳票。一个中立网关的核对:已确认 vs 声称 vs 缺失,以及怎么用一把 key 把 qwen3.8-max 和 Claude、GPT、Gemini、DeepSeek 放在一起自己测。

Qwen3.8-Max:2.4T 参数、零 benchmark — 哪些是真的,哪些还只是发表会上的话

一句话(截至 2026-08-01): 阿里 7 月 19 日在上海 WAIC 发表了 Qwen3.8-Max-Preview,2.4 兆参数、多模态,现在可以通过阿里 Token Plan 的 API 调用。但它目前没有任何公开 benchmark、没有 model card、没有揭露上下文规格,承诺的开源权重也还没放出来。我们把 Qwen 和一堆模型并排路由,不在乎谁赢 — 所以这篇只做一件事:把「公开事实」和「发表材料里的说法」分开,让你自己判断,而不是信一页简报。

Qwen3.8-Max 已确认 vs 声称 vs 缺失 — 把公开记录和发表材料逐条核对的三栏图 哪些真在记录上,哪些还只是说法。来源见文末。

已经确认的部分

以下是多家独立媒体从 7 月 19 日发表中报导的事实:

项目已确认
模型Qwen3.8-Max-Preview — 是预览版,不是正式版
参数2.4T 总参数(稀疏 MoE,启用参数量未公开)
模态多模态:文字、图片、视频、文件 — 首个参数量破 1T 还做多模态的 Qwen
可用性预览版 API,通过阿里 Token Plan(及 Qoder / QoderWork)
发表2026 年 7 月 19 日,上海 WAIC
自我定位阿里自评「仅次于 Claude Fable 5

诚实地说,确认的记录到这里为止。这条线之后,要么是发表材料里的说法,要么是空缺。

声称了、但无法验证的部分

发表 brief 和各种解读里有一堆亮眼的具体数字。作为网关,我们的工作是告诉你哪些能信 — 而下面这些,现在还不能:

  • 「1M token 上下文」。它出现在发表 brief 里,但阿里没有公布官方的上下文窗口规格。在进文档之前,把这个数字当宣传看。
  • 「16 天自主开发」(oh-my-cli)。brief 说 Qwen3.8-Max 自主搭了一个开源 agent 系统,还有公开的 GitHub trace(265 commits、127 PR、151 issues),代码仓库是 qwen-code-dev-bot/oh-my-cli我们没能找到这个代码仓库。 一个你打不开的「公开可验证 trace」不叫可验证 — 所以我们不计入。如果阿里放出真实链接,我们会更新本文。
  • 那些案例 — 500 轮迭代的晶片设计、365 天把 ¥10 万做到 ¥41.6 万的电商模拟、NVIDIA kernel 榜第一、重现论文还超越它。这些是厂商 demo,没有放出任何可重现的产物。当假设看可以,当证据不行。
  • 「全球第一梯队」。发表日的标准自评。下一节讲为什么它现在根本无法证伪。

这些不代表说法是假的。只代表它们未经证实,而一个全部卖点都是「相信我」的模型,在权重开源之前就该被保持距离。

最要紧的两件事:没有 benchmark,开源还跳了票

区分「有自信的发表」和「被证明的发表」,靠两样东西,而 Qwen3.8-Max 两样都缺。

零公开 benchmark。 阿里发表这个模型时没放 benchmark 分数、没 model card、没启用参数量、没架构或训练细节。「仅次于 Fable 5」是它自己给自己打分。现在没有任何东西可以独立核对 — 对一个按「接近前沿」来宣传的模型,这个空缺很显眼。

开源时间已经延期。 阿里说会放出完整权重,一个被广泛引用的时间点是 7 月 27 日前后,而截至目前仍未放出。开源权重是唯一能让外部研究者验证上面所有说法的东西。在它落地之前,这是一个你租用的托管预览,不是任何阿里以外的人验证过的模型。

这两点都不是无视 Qwen3.8-Max 的理由。它们都是先自己测、再信宣传的理由。

没有 benchmark,恰恰是网关的意义所在

当一家厂商放出完整 benchmark 和 model card,你至少还能就着数字争论。当它一个都不放,唯一有意义的数字,就是你自己的任务上跑出来的那个。

这才是「全球第一梯队」的诚实版本:把同一批 prompt 发给 qwen3.8-max-previewclaude-*gpt-*gemini-*deepseek-*,并排比延迟、比成本、比输出。通过网关,你用一把 key 就能做,不用新开供应商、不用改客户端:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIFLUX_KEY",
    base_url="https://apiflux.ai/v1",
)

prompt = "用单一 HTML 档案写一个能玩的浏览器俄罗斯方块。"

for model in ["qwen3.8-max-preview", "claude-opus-4-8", "gpt-5.6", "deepseek-v4-pro"]:
    r = client.chat.completions.create(
        model=model,                         # 确切 slug 见 apiflux.ai/models
        messages=[{"role": "user", "content": prompt}],
    )
    print(model, "→", len(r.choices[0].message.content), "字符")

这种发表下,网关给你的是:

  • 用一把 key 和现有模型对打 — 用你自己的数字,代替阿里那份缺席的 benchmark。
  • 自动 failover — 预览端点在发表周的高负载下一定会限流;绕过去,而不是把错误吞下。
  • 透明的按 token 计价 — Qwen3.8-Max 目前是打包在阿里 Token Plan 订阅里卖,而不是公开的按 token 单价。一旦有了按 token 价格,它会以精确数字出现在模型目录,不是加价的糊涂帐。在那之前:我们不编价格。

上线说明:qwen3.8-max-preview 会在上游稳定公开后进入 ApiFlux。关注模型目录 — 确切 slug 和实时定价会在它可路由的当天出现在那里。

时间线

  • 2026 年 7 月 19 日 — Qwen3.8-Max-Preview 于上海 WAIC 发表,托管预览上线。
  • 约 7 月 27 日 — 某个被引用的开源时间点;未如期放出
  • 2026 年 8 月 1 日(今天) — 预览版可经 API / Token Plan 调用;开源权重仍 pending;无公开 benchmark。

正式版和开源真正落地时我们会更新本文 — 是落地时更新,不是承诺时更新。

如果你在评估 Qwen3.8-Max

  • 别等 benchmark 了,没有。 现在就在预览版上、带 fallback 跑你自己的评测。
  • 对无法验证的说法打折(1M 上下文、oh-my-cli、那些案例),直到有文档或打得开的 trace。
  • 盯开源释出,别盯发表会。 那才是「仅次于 Fable 5」变得可核对的时刻。
  • 按 token 比价,别按标题比 — 而且要等真有价格了再比。

这个模型也许真的很强。重点是:从阿里目前公布的东西里,你无法知道这一点 — 你只能从自己测出来的东西里知道。

常见问题

Qwen3.8 发布了吗,还是只是预览? 截至 2026 年 8 月 1 日,只有 Qwen3.8-Max-Preview 可用,是经 API 的托管预览。正式版和开源权重都还没出。

开源了吗? 还没。阿里承诺过开源权重(一个被引用的时间点是约 7 月 27 日),目前仍 pending。在那之前,所有说法都是单一来源。

上下文窗口多大? 阿里没有公布官方上下文规格。「1M」来自发表材料,不是文档。

有 benchmark 吗? 没有。发表时没放任何 benchmark 分数、model card 或启用参数量。「仅次于 Fable 5」是阿里自评。

用我现有的 OpenAI 风格代码能调用吗? 通过 ApiFlux 是 OpenAI 兼容的:把模型字串改成 qwen3.8-max-preview,key 不变。确切 slug 见模型目录,base URL 见文档

来源

企业级 AI 网关,统一路由、保护并观测每一次模型调用。