全站模型 85 折 🎉 相對 OpenRouter 標價再省 15%。瀏覽模型 →
部落格
ApiFlux Team閱讀時間 6 分鐘

Qwen3.8-Max:2.4T 參數、零 benchmark — 哪些是真的,哪些還只是發表會上的話

阿里 Qwen3.8-Max 已開放預覽:2.4T 參數、多模態,但截至目前沒有任何公開 benchmark、沒有 model card、開源時間已跳票。一個中立閘道的核對:已確認 vs 聲稱 vs 缺失,以及怎麼用一把 key 把 qwen3.8-max 和 Claude、GPT、Gemini、DeepSeek 放在一起自己測。

Qwen3.8-Max:2.4T 參數、零 benchmark — 哪些是真的,哪些還只是發表會上的話

一句話(截至 2026-08-01): 阿里 7 月 19 日在上海 WAIC 發表了 Qwen3.8-Max-Preview,2.4 兆參數、多模態,現在可以透過阿里 Token Plan 的 API 呼叫。但它目前沒有任何公開 benchmark、沒有 model card、沒有揭露上下文規格,承諾的開源權重也還沒放出來。我們把 Qwen 和一堆模型並排路由,不在乎誰贏 — 所以這篇只做一件事:把「公開事實」和「發表材料裡的說法」分開,讓你自己判斷,而不是信一頁簡報。

Qwen3.8-Max 已確認 vs 聲稱 vs 缺失 — 把公開紀錄和發表材料逐條核對的三欄圖 哪些真在紀錄上,哪些還只是說法。來源見文末。

已經確認的部分

以下是多家獨立媒體從 7 月 19 日發表中報導的事實:

項目已確認
模型Qwen3.8-Max-Preview — 是預覽版,不是正式版
參數2.4T 總參數(稀疏 MoE,啟用參數量未公開)
模態多模態:文字、圖片、影片、文件 — 首個參數量破 1T 還做多模態的 Qwen
可用性預覽版 API,透過阿里 Token Plan(及 Qoder / QoderWork)
發表2026 年 7 月 19 日,上海 WAIC
自我定位阿里自評「僅次於 Claude Fable 5

誠實地說,確認的紀錄到這裡為止。這條線之後,要麼是發表材料裡的說法,要麼是空缺。

聲稱了、但無法驗證的部分

發表 brief 和各種解讀裡有一堆亮眼的具體數字。作為閘道,我們的工作是告訴你哪些能信 — 而下面這些,現在還不能:

  • 「1M token 上下文」。它出現在發表 brief 裡,但阿里沒有公布官方的上下文視窗規格。在進文件之前,把這個數字當宣傳看。
  • 「16 天自主開發」(oh-my-cli)。brief 說 Qwen3.8-Max 自主搭了一個開源 agent 系統,還有公開的 GitHub trace(265 commits、127 PR、151 issues),儲存庫是 qwen-code-dev-bot/oh-my-cli我們沒能找到這個儲存庫。 一個你打不開的「公開可驗證 trace」不叫可驗證 — 所以我們不計入。如果阿里放出真實連結,我們會更新本文。
  • 那些案例 — 500 輪迭代的晶片設計、365 天把 ¥10 萬做到 ¥41.6 萬的電商模擬、NVIDIA kernel 榜第一、重現論文還超越它。這些是廠商 demo,沒有放出任何可重現的產物。當假設看可以,當證據不行。
  • 「全球第一梯隊」。發表日的標準自評。下一節講為什麼它現在根本無法證偽。

這些不代表說法是假的。只代表它們未經證實,而一個全部賣點都是「相信我」的模型,在權重開源之前就該被保持距離。

最要緊的兩件事:沒有 benchmark,開源還跳了票

區分「有自信的發表」和「被證明的發表」,靠兩樣東西,而 Qwen3.8-Max 兩樣都缺。

零公開 benchmark。 阿里發表這個模型時沒放 benchmark 分數、沒 model card、沒啟用參數量、沒架構或訓練細節。「僅次於 Fable 5」是它自己給自己打分。現在沒有任何東西可以獨立核對 — 對一個按「接近前沿」來宣傳的模型,這個空缺很顯眼。

開源時間已經延期。 阿里說會放出完整權重,一個被廣泛引用的時間點是 7 月 27 日前後,而截至目前仍未放出。開源權重是唯一能讓外部研究者驗證上面所有說法的東西。在它落地之前,這是一個你租用的託管預覽,不是任何阿里以外的人驗證過的模型。

這兩點都不是無視 Qwen3.8-Max 的理由。它們都是先自己測、再信宣傳的理由。

沒有 benchmark,恰恰是閘道的意義所在

當一家廠商放出完整 benchmark 和 model card,你至少還能就著數字爭論。當它一個都不放,唯一有意義的數字,就是你自己的任務上跑出來的那個。

這才是「全球第一梯隊」的誠實版本:把同一批 prompt 發給 qwen3.8-max-previewclaude-*gpt-*gemini-*deepseek-*,並排比延遲、比成本、比輸出。透過閘道,你用一把 key 就能做,不用新開供應商、不用改客戶端:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIFLUX_KEY",
    base_url="https://apiflux.ai/v1",
)

prompt = "用單一 HTML 檔案寫一個能玩的瀏覽器俄羅斯方塊。"

for model in ["qwen3.8-max-preview", "claude-opus-4-8", "gpt-5.6", "deepseek-v4-pro"]:
    r = client.chat.completions.create(
        model=model,                         # 確切 slug 見 apiflux.ai/models
        messages=[{"role": "user", "content": prompt}],
    )
    print(model, "→", len(r.choices[0].message.content), "字元")

這種發表下,閘道給你的是:

  • 用一把 key 和現有模型對打 — 用你自己的數字,代替阿里那份缺席的 benchmark。
  • 自動 failover — 預覽端點在發表週的高負載下一定會限流;繞過去,而不是把錯誤吞下。
  • 透明的按 token 計價 — Qwen3.8-Max 目前是打包在阿里 Token Plan 訂閱裡賣,而不是公開的按 token 單價。一旦有了按 token 價格,它會以精確數字出現在模型目錄,不是加價的糊塗帳。在那之前:我們不編價格。

上線說明:qwen3.8-max-preview 會在上游穩定公開後進入 ApiFlux。關注模型目錄 — 確切 slug 和即時定價會在它可路由的當天出現在那裡。

時間線

  • 2026 年 7 月 19 日 — Qwen3.8-Max-Preview 於上海 WAIC 發表,託管預覽上線。
  • 約 7 月 27 日 — 某個被引用的開源時間點;未如期放出
  • 2026 年 8 月 1 日(今天) — 預覽版可經 API / Token Plan 呼叫;開源權重仍 pending;無公開 benchmark。

正式版和開源真正落地時我們會更新本文 — 是落地時更新,不是承諾時更新。

如果你在評估 Qwen3.8-Max

  • 別等 benchmark 了,沒有。 現在就在預覽版上、帶 fallback 跑你自己的評測。
  • 對無法驗證的說法打折(1M 上下文、oh-my-cli、那些案例),直到有文件或打得開的 trace。
  • 盯開源釋出,別盯發表會。 那才是「僅次於 Fable 5」變得可核對的時刻。
  • 按 token 比價,別按標題比 — 而且要等真有價格了再比。

這個模型也許真的很強。重點是:從阿里目前公布的東西裡,你無法知道這一點 — 你只能從自己測出來的東西裡知道。

常見問題

Qwen3.8 發布了嗎,還是只是預覽? 截至 2026 年 8 月 1 日,只有 Qwen3.8-Max-Preview 可用,是經 API 的託管預覽。正式版和開源權重都還沒出。

開源了嗎? 還沒。阿里承諾過開源權重(一個被引用的時間點是約 7 月 27 日),目前仍 pending。在那之前,所有說法都是單一來源。

上下文視窗多大? 阿里沒有公布官方上下文規格。「1M」來自發表材料,不是文件。

有 benchmark 嗎? 沒有。發表時沒放任何 benchmark 分數、model card 或啟用參數量。「僅次於 Fable 5」是阿里自評。

用我現有的 OpenAI 風格程式碼能呼叫嗎? 透過 ApiFlux 是 OpenAI 相容的:把模型字串改成 qwen3.8-max-preview,key 不變。確切 slug 見模型目錄,base URL 見文件

來源

企業級 AI 閘道,統一路由、保護並觀測每一次模型呼叫。