Claude 上下文長度多少?和 Gemini、GPT 對照(2026 年 7 月)
Claude 上下文長度目前多少?Fable 5、Opus 5、Sonnet 5 都是 1M、Haiku 4.5 停在 200K。這篇把 Anthropic、Google、OpenAI 三家官方文件的數字抓下來對照,告訴你哪個是 input、哪個是 output、你的任務該挑哪一家。
先講一個大家都碰過的畫面:
你打開 Claude、Gemini、GPT 三家的定價頁,把「上下文長度」抄下來準備比較——Claude Fable 5、Gemini 3.6 Flash、GPT-5.6 Sol 三家目前都寫 1M。看起來追平了、你選誰都一樣。但實際跑起來差別很明顯,差別不在那個 1M,在旁邊那一欄「一次能回你多長」,還有一條藏在文件註腳裡的「批次通道」——白話說,就是讓你把長任務丟給模型排隊處理的一個介面(API),稍後解釋。
所以這篇不是選誰比較強,是把三家官方原文抓下來對照,告訴你你的任務應該挑哪一家。 資料日期是 2026 年 7 月 31 日,每一格數字都有出處連結。
Claude 上下文長度:Fable 5 是 1M、Haiku 4.5 停在 200K
先看 Anthropic。四個目前主打的模型的規格,可以在 Models overview 那張表裡逐格核對:
| 模型 | Context (input) | Max output | 官方定位 |
|---|---|---|---|
| Claude Fable 5 | 1M | 128K | 目前最強、廣泛可用 |
| Claude Opus 5 | 1M | 128K | 複雜 agentic coding 與企業任務 |
| Claude Sonnet 5 | 1M | 128K | 速度與智慧的平衡 |
| Claude Haiku 4.5 | 200K | 64K | 最快、成本敏感任務 |
Haiku 那一列看起來像「省成本版」,實際上不是——Haiku 4.5 是 2025-10 的模型,另外三個都是 2026 年年中才陸續 GA 的 5 世代(Fable 5 在 6 月 9 日率先開放)。中間差了 8 個月起跳。
官方註 4 順便給了 Sonnet 5 一個限時定價的窗口:
Introductory pricing of $2 / $10 per MTok applies to Claude Sonnet 5 through August 31, 2026.
2026 年 8 月底之前 Sonnet 5 走 introductory pricing $2 / $10,之後回到標準價 $3 / $15。
Gemini 上下文長度:1M input、64K output 是全線通用
Google 官方 Models overview 頁不會直接列數字,要點進每一個模型頁的「Token limits」那一欄才看得到。抓起來會發現一件事:從 2.5 世代到 3.6 世代,輸入跟輸出上限通通一樣。
Google 這代的策略很清楚:輸入拉齊到 1M,輸出全線壓在 64K。這個 64K 是這篇要跟你講的重點——如果你的任務是「叫模型一次吐一份長文檔」,Gemini 會被截斷,而且它的定價概覽頁上沒寫這件事。
GPT 上下文長度:Sol / Terra / Luna 三張卡片都是 1.05M
OpenAI Models 頁預設展示三張 GPT-5.6 的 frontier 卡片,官方定位寫得很直白:
If you’re not sure where to start, use GPT-5.6 Sol, our flagship model for complex reasoning and coding. Choose GPT-5.6 Terra to balance intelligence and cost, or GPT-5.6 Luna for cost-sensitive, high-volume workloads.
三張卡片的規格是同一組:Context window 1.05M、Max output 128K。差別在成本定位,不在長度。
差別 1:輸出上限,Anthropic 與 OpenAI 是 Gemini 的 2 倍
三家都給你 1M 左右的輸入,輸出(模型一次能回你多長)的差距才是重點:
output 上限(一次可以吐多少)
Anthropic Claude Fable 5 / Opus 5 / Sonnet 5
128K tokens
- 寫一份 30 頁報告可以一次吐完
- Haiku 4.5 例外,只有 64K
要更長就走批次通道,見下一節
OpenAI GPT-5.6 Sol / Terra / Luna
128K tokens
- 三張卡片同一組規格
- 目前沒有更長 output 的公開通道
同 Claude 陣營的 128K
Google Gemini 2.5 / 3.5 / 3.6 全線
64K tokens
- input 給你 1M,output 卻只有一半
- 寫長文檔會被截斷,overview 頁不會告訴你
長輸出任務目前不適合 Gemini
如果你要模型整份翻譯一本書、產一份 30 頁報告,輸出這一欄才是真正的天花板。上下文拉到 1M 只是「你貼得進去」,輸出才是「你拿得回來多少」。
差別 2:Anthropic 藏了一條「批次通道」,一次能吐 300K
這個要仔細讀 Anthropic 文件的註腳才會看到。原文:
The Max output values in the table apply to the synchronous Messages API. On the Message Batches API, Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, and Sonnet 4.6 support up to 300k output tokens by using the
output-300k-2026-03-24beta header.
翻成白話:你正常呼叫(同步請求,一問一答),Claude 最多回你 128K。但如果你改用批次通道(叫做 Message Batches API,非即時、排隊處理),再加上一個實驗版標頭 output-300k-2026-03-24,Opus 系列跟 Sonnet 系列可以一次吐到 300K。
走 Anthropic 批次通道拿 300K 輸出 · 優缺點
- + 一次拿到完整長文檔,不用自己接續問答
- + 同業目前沒有對應的長輸出通道
- + 涵蓋 Opus / Sonnet 從 4.6 到 5 世代
- − 不即時,是排隊處理(不適合對話式應用)
- − 要加實驗版標頭,隨版本可能變動
- − Haiku 系列不在名單裡
適合什麼?大量文件處理、整本書翻譯、把整個 codebase 摘要成一份技術文件——那種你不在乎等幾分鐘、但要一次拿到完整結果的任務。
你的任務屬於哪一格
按任務挑模型
長程式碼專案分析
整個專案讀進來、要模型自己找依賴
- 輸入要吃得下 200K~1M 檔案
- 輸出要能一次吐出可執行的完整檔案
- Claude Opus 5 或 GPT-5.6 Sol 官方定位都是這格
Opus 5 官方定位「複雜的代理型程式碼工作」;Sol 官方定位「複雜推理與程式碼」
大量文件摘要 / 整本書翻譯
不即時、但要一次拿到完整長輸出
- 走 Anthropic 批次通道 + `output-300k-2026-03-24` 實驗版標頭
- 輸出上限 300K,同業目前沒有對應通道
- Opus / Sonnet 系列(包含 4.6 世代)都支援
要接受非即時(批次通道是排隊處理)
成本敏感的高頻呼叫
每天呼叫幾萬次、每次不需要長回答
- Gemini 2.5 Flash 或 GPT-5.6 Luna 都有低成本卡位
- Claude Haiku 4.5 只有 200K,長上下文任務不適合
- 這格三家差不多,看你已經接哪一家的服務
這格差別小到可以用「你已經接哪家」決定
怎麼自己驗證(不要相信第三方引用)
三家的定價頁數字會被抄成社群貼文、抄進部落格,中間常常出錯——例如網路上仍能查到「Gemini 2M」這類舊引用,跟現在的 2.5 / 3 世代規格無關。要驗證,只有一個辦法:直接讀當日官方頁面。
- 01📋
打開三家的官方模型文件頁
Anthropic:docs.anthropic.com/en/docs/about-claude/models/overview;Gemini:ai.google.dev/gemini-api/docs/models/<模型代號>;OpenAI:platform.openai.com/docs/models
- 02🔍
找「上下文長度」那一欄
Anthropic 叫 Context window、Gemini 叫 Input token limit、OpenAI 叫 Context window——名字不同、意思一樣
- 03📏
同時看「一次能回你多長」那一欄
這才是決定實際體驗的數字。三家的欄位名也不同:Max output / Output token limit / Max output
- 04🚪
看註腳有沒有批次或實驗版通道
Anthropic 有 300K 批次通道;Gemini 跟 OpenAI 目前沒有對應的長輸出通道;哪天看到了就記下網址跟日期
如果你只想拿某一家的完整清單,Anthropic 有一個查詢端點可以直接抓,官方文件說:
You can query model capabilities and token limits programmatically with the Models API. The response includes
max_input_tokens,max_tokens, and acapabilitiesobject for every available model.
這個比翻定價頁準,因為它就是模型本身的實際設定。Gemini 跟 OpenAI 目前也有類似的模型列表端點,但要不要相信最終還是要跟定價頁對一次。
最後說兩句
我整理這張對照表的時候,最意外的是三家最新旗艦收斂到「1M 輸入」這件事——過去兩年拉長上下文的競賽(Gemini 1.5 曾經到 2M)之後,共識大概是:超過 1M 之後,長上下文的答題品質衰退明顯,成本又快速上升。所以整個 2026 年的態勢是 1M 成為新的基準、200K 成為低配。
我另一個發現是:真正會決定你體驗的常常是輸出,不是上下文。下次看到某家秀「200 萬上下文」的時候,先翻到輸出那一欄——如果它還在 64K,那個 200 萬跟你其實沒什麼關係。
如果你發現本文哪一格數字對不上你當天讀到的官方頁面,來信告訴我,我會標日期更新。我打算每一季重新抓一次三家的原文,畢竟這種數字是每一季都在動的。
想要更多「複製就能用」的實戰工具?
這篇只是開始 —— Coocolab 會員的免費資源區,放了一整櫃可以直接複製到 AI 就開跑的實戰 prompt。
- 殘酷壓力測試你的創業點子、早點知道行不行
- 用 7 個問題逼出你早就有、卻沒發現的商業點子
- 30 分鐘做完個人財務體檢、生出專屬報告
- 一鍵幫你的 AI 裝上高速爬蟲、查資料不再過時
本文所有規格數字皆抓自 2026-07-31 當日的三家官方文件頁面,來源網址已列在對應段落。介面規格會隨版本更新,看到差異時以官方文件為準。
延伸閱讀:
延伸閱讀
AI 幻覺是什麼?三個真實案例+怎麼在它唬你的時候看出來
AI 每次都很自信地給你一個聽起來很專業的答案,但你怎麼知道那不是它憑空編出來的?這篇拆解三種最常見的 AI 幻覺類型:過時資訊、捏造細節、張冠李戴,附上一份可以立刻上手的檢查清單,教你在它唬你的時候當場看出來,不再被漂亮的胡說八道牽著鼻子走。
Claude Artifacts 接 MCP:發出去的網頁自己抓最新資料
Anthropic 2026 年 7 月 16 日開放 Claude Artifacts 呼叫 MCP connectors,分享出去的網頁在每個觀看者打開時,用他們自己的帳號去抓即時資料,不再是做完就凍結的靜態快照。這篇拆解怎麼運作、限制在哪、什麼時候該用、什麼時候別用。
MCP server 教學:自己寫一個要多久?我從空資料夾實測一次
網路上的 MCP server 教學都是寫給工程師看的。這篇不談原理,我從一個空資料夾實測一次:裝官方套件花 3 秒、能跑起來的檔案只有 19 行,工具真的把一行字寫進我的檔案。也誠實講清楚門檻在哪裡,還有哪些人其實根本不需要自己動手寫一個。
Fable 5 回來了,但只給你一半:與其狂用它,不如讓它留下遺產(判斷力保存 Prompt)
7/20 起 Claude Fable 5 回到 Max 與 Team Premium 方案,但上限是每週額度的 50% — 全家最強的大腦,限量供應。大部分人會把這一半拿去搬磚 — 錯了。這篇給你一個「判斷力保存 prompt」:讓 Fable 5 把它的判斷力寫成制度檔案,之後每一個較弱模型的 session 都因此變強。Coocolab 免費會員可拿完整 prompt。
想把這些變成你的實戰能力?
加入 免費會員 — 解鎖「加密貨幣新手 30 天」+「AI 工具 21 天」實戰課、免費 prompt 資源區,還有每天自動生息的放貸 Bot 可試用。email 一鍵註冊、不用密碼。