stealth/ox-alpha,無任何說明,1M context,免費這是一場精心策劃的 stealth launch,也是 AI 歷史上規模最大的匿名測試事件之一。讓我們一步步還原它如何發生:
OpenRouter 上悄然出現 stealth/ox-alpha。模型名稱無任何說明,無定價頁,無官方文件。Context window:1,000,000 tokens。費用:$0。開發者社群開始瘋傳截圖。
Reddit r/LocalLLaMA、Twitter/X AI 社群開始猜測身份。有人說是 Meta Llama 5 提前洩露,有人認為是 DeepSeek 新模型,也有人指向 Mistral 或 xAI。OpenCode 平台將 Ox Alpha 列為可選模型,使用量開始急速攀升。
短短 6 天,Ox Alpha 的 token 消耗量突破 20 trillion(20,000,000,000,000)。OpenRouter 官方數據顯示,這是平台史上單模型最高用量,是第二名的 2.3 倍。OpenCode 上的 Ox Alpha 用戶數達到 221,000,session 突破 5 百萬次。
Z.ai 創辦人在社群媒體確認:stealth/ox-alpha 就是 GLM-5.3-Flash,由智譜 AI(Zhipu AI)開發,Z.ai 平台負責商業化。架構為 320B MoE 總參數、18B 活躍參數,MIT 授權。stealth launch 是刻意選擇——在沒有行銷的情況下驗證真實需求。
Z.ai 宣布 GLM Coding Plan:$18/月,含大量 GLM-5.3-Flash API 額度,定位為 agentic coding 場景的主力模型。AAII(AI API Index)評分 60 分,在 186 個模型中排名前段,FrontierSWE coding 基準名列旗艦等級。促銷期持續至 2026 年 9 月 9 日。
Ox Alpha 的真身是 GLM-5.3-Flash,屬於智譜 AI 的 GLM(General Language Model)系列第五代旗艦。以下是目前已確認的技術細節:
| 項目 | GLM-5.3-Flash(Ox Alpha) |
|---|---|
| 開發方 | 智譜 AI(Zhipu AI)/ Z.ai 商業化 |
| 架構 | MoE(Mixture of Experts) |
| 總參數 | 320B |
| 活躍參數 | 18B(每次推理) |
| 授權 | MIT(開放商業使用) |
| Context Window | 1,000,000 tokens(1M) |
| 主打場景 | Agentic coding、長文本分析、FrontierSWE |
| AAII 評分 | 60 分 / 186 個模型(前段) |
| FrontierSWE | 旗艦 coding 等級 |
| 定價(Z.ai) | $0.15 input / $0.50 output(per 1M tokens) |
| GLM Coding Plan | $18/月(促銷至 9/9,後可能調整) |
| OpenRouter ID | stealth/ox-alpha(現 z-ai/glm-5.3-flash) |
MoE(Mixture of Experts)架構的關鍵在於:雖然模型總參數高達 320B,但每次推理只激活 18B 的專家子網路。這讓 GLM-5.3-Flash 能以接近 18B dense 模型的速度和成本運行,同時享有 320B 規模帶來的知識容量和任務多樣性。
這正是 DeepSeek V4 Pro、Mixtral、Grok 4.x 系列都採用 MoE 的原因——效能 / 成本比最優,也是為什麼 GLM-5.3-Flash 能以 $0.15/$0.50 per 1M tokens 提供旗艦等級的 coding 能力。
「20 兆 tokens」這個數字很容易讓人眼花,讓我們把它轉換成更直覺的理解:
更重要的是,這 20 兆 tokens 代表了真實的開發者需求:221,000 個工程師選擇在沒有任何行銷的情況下主動使用它。這比任何 benchmark 分數都更有說服力——因為沒有人強迫他們用,他們就是覺得好用。
ℹ️ OpenCode 平台的角色:OpenCode 是一個允許開發者測試和比較多個 LLM 的 coding 平台,整合了 OpenRouter。Ox Alpha 在 OpenCode 上成為 #2 最受歡迎的模型(僅次於一個已確立的旗艦),這意味著它在真實 coding 任務中擊敗了 GPT-5.6、Claude Fable 5 等商業模型。
同等價位或功能定位下,GLM-5.3-Flash 的競爭力如何?
| 模型 | Context | Input / 1M tokens | Output / 1M tokens | Coding 能力 | 授權 |
|---|---|---|---|---|---|
| GLM-5.3-Flash NEW | 1M | $0.15 | $0.50 | FrontierSWE 旗艦 | MIT |
| GPT-5.6 Luna | 128K | $0.20 | $1.20 | 強 | 商業 |
| GPT-5.6 Terra | 256K | $2.00 | $12.00 | 很強 | 商業 |
| Claude Fable 5 | 1M | $10.00 | $50.00 | 頂尖 | 商業 |
| Gemini 3.7 Flash | 1M | $0.75 | $3.00 | 強 | 商業 |
| DeepSeek V4 Pro | 128K | $0.27 | $1.10 | FrontierSWE 頂尖 | MIT |
| Grok 4.6 | 500K | $3.00 | $15.00 | DeepSWE 頂尖 | 商業 |
| Qwen3.8-27B | 128K | $0.10 | $0.30 | 強(開源) | Apache 2.0 |
從表格可以看出,GLM-5.3-Flash 是目前同時滿足「1M context + 旗艦 coding + 極低費率 + MIT 授權」四個條件的唯一選項。Claude Fable 5 雖然 coding 能力略強,但費率是 67 倍;Gemini 3.7 Flash 費率是 5 倍,context 相同但 coding 評級略遜。
這是官方建議的方式,穩定性最高,有 GLM Coding Plan 月費方案:
前往 z.ai 官網,使用 Email 或 GitHub 帳號註冊,完成手機驗證。新用戶有免費額度可直接試用。
登入後進入 API 頁面 → 建立新的 API Key → 複製保存。Key 格式為 z-xxxxxxxxxxxxxxxx。
GLM-5.3-Flash 支援 OpenAI SDK 格式,只需替換 base_url 和 model:
# Python 範例(使用 OpenAI SDK)
from openai import OpenAI
client = OpenAI(
api_key="z-你的API金鑰",
base_url="https://api.z.ai/v1"
)
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[
{"role": "user", "content": "幫我寫一個 FastAPI 的 JWT 認證中間件"}
],
max_tokens=2000
)
print(response.choices[0].message.content)
💡 台灣開發者提示:Z.ai 的 API endpoint 在亞洲有獨立節點,延遲約 80-120ms(vs Claude Fable 5 約 300-500ms)。對於需要低延遲的 agentic coding 場景,這個差距相當顯著。
如果你已經有 OpenRouter 帳號,可以直接使用,適合已整合 OpenRouter 的現有工作流程:
# 使用 OpenRouter(LangChain 範例)
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
openai_api_key="sk-or-你的OpenRouter金鑰",
openai_api_base="https://openrouter.ai/api/v1",
model_name="z-ai/glm-5.3-flash"
)
response = llm.invoke("解釋 React 18 Concurrent Mode 的工作原理")
print(response.content)
如果你使用 Claude Code 或剛學的 opencodex LLM Proxy,可以將 GLM-5.3-Flash 設為後端模型:
# opencodex Provider 設定(~/.opencodex/config.json)
{
"providers": {
"z-ai": {
"apiKey": "z-你的API金鑰",
"baseUrl": "https://api.z.ai/v1",
"models": {
"glm-5.3-flash": {
"maxTokens": 8192,
"contextWindow": 1000000
}
}
}
},
"defaultProvider": "z-ai",
"defaultModel": "glm-5.3-flash"
}
設定完成後,你的 Codex CLI 和 Claude Code 就能透過 opencodex proxy 使用 GLM-5.3-Flash,費率僅 $0.15/$0.50 per 1M tokens。
Z.ai 推出的 GLM Coding Plan 為開發者提供月費訂閱,包含固定的 API 額度。讓我們計算一個典型台灣開發者的使用場景:
| 使用場景 | 每日 tokens 估算 | 月費(GLM Coding) | 月費(Claude Fable 5) | 節省比例 |
|---|---|---|---|---|
| 輕度 AI 輔助(每日 5 次 code review) | ~500K tokens/月 | $18 訂閱 | $75 | 76% ↓ |
| 中度開發(每日 20 次輔助,長上下文) | ~2M tokens/月 | $18 訂閱 | $300 | 94% ↓ |
| 重度 agentic coding(CI/CD + 自動 PR) | ~8M tokens/月 | ~$40(超額) | $1,200 | 97% ↓ |
| 1M context 長文件分析(法律/報告) | ~3M tokens/月 | $18 訂閱 | $450 | 96% ↓ |
⚠️ 注意:GLM Coding Plan $18/月的促銷定價持續至 2026 年 9 月 9 日。Z.ai 尚未公布之後的正式定價,建議在促銷期內試用並確認是否符合需求。超出訂閱額度的部分按 $0.15/$0.50 計費。
DigitalOcean Droplets 從 $4/月起,支援 Ubuntu/Debian 環境,適合部署 opencodex proxy、n8n 自動化、或自架 API gateway 轉接 GLM-5.3-Flash 與其他模型。
免費試用 $200 額度 → 看 opencodex 教學Ox Alpha 事件絕非意外洩露,而是一場經過設計的 go-to-market 實驗。以下是 Z.ai 此舉可能的策略邏輯:
傳統 AI 模型發布通常會在正式 GA 前大肆預告,但萬一品質不如預期,就會面臨輿論反噬。Stealth launch 讓 Z.ai 在沒有任何承諾的情況下「讓數據說話」——20 兆 tokens 的自然使用量遠比任何 PR 稿更有說服力。
正式公告通常會觸發競爭對手的即時降價或對應文章。匿名測試期間,競爭對手無從反應,Z.ai 得以在最有利的條件下積累用戶基礎和口碑。
221,000 個用戶、5M sessions 的數據,讓 Z.ai 精準掌握了 GLM-5.3-Flash 在哪些任務表現最佳(coding、長文本分析),以便調整後續的行銷定位和 API 定價策略。
「神秘 AI 突然出現,6 天消耗史上最多 tokens,然後揭曉是 GLM-5.3-Flash」——這個故事本身就是無法用金錢購買的 PR。你現在正在讀的這篇文章,就是這個敘事效應的一部分。
DataCamp 提供「Developing AI Applications」、「Prompt Engineering」等實戰課程,從 API 呼叫到多模型路由策略,全部有動手實驗。
查看 DataCamp 課程 →從 Ox Alpha 事件來看,Z.ai 是一家具有清晰商業頭腦的 AI 公司。以下是值得持續觀察的幾個面向:
z.ai 註冊帳號(2 分鐘)pip install openai 安裝 SDK(1 分鐘)或者,如果你已有 OpenRouter 帳號,直接在 API 呼叫中把 model 換成 z-ai/glm-5.3-flash 即可。
💡 建議做法:建議先用免費額度跑 5-10 個真實工作任務,與你目前使用的模型(Claude Fable 5 或 GPT-5.6)做品質比較。在 coding 補全和長文本摘要兩個場景,大多數開發者反映 GLM-5.3-Flash 的品質差距在可接受範圍內,而費率節省超過 80%。
stealth/ox-alpha 是 Z.ai 在 OpenRouter 上的匿名 ID,8 月 26 日由 Z.ai 創辦人確認就是 GLM-5.3-Flash。現在 OpenRouter 上的模型 ID 已更新為 z-ai/glm-5.3-flash。我們整理了一套 Claude Code + opencodex + GLM-5.3-Flash 的完整 Prompt 模板包,包含 50+ 個針對 agentic coding 場景優化的提示詞。
查看 AI 工具包 → opencodex 教學AutoDev AI 致力於提供台灣開發者最即時的繁中 AI 工具評測與教學。本文所有外部連結均為聯盟行銷連結,不影響評測立場。如有任何問題或錯誤,歡迎透過 聯絡頁面 告知。