Coocolab

Claude Code 免費跑:Ollama 或 OpenRouter,帳單歸零兩種做法

我把 Claude Code 換上開源引擎——本地跑 Ollama 或走 OpenRouter 免費 tier,兩種把帳單歸零的做法都試過。附環境變數範例、Haiku 偷收費的陷阱,以及該用免費模型的時機。

Jimmy · · 更新於 · 約 6 分鐘
#Claude Code#Ollama#OpenRouter#AI 工具#開源模型

先算一筆帳。

我上個月 Claude Code 的帳單,比我心裡預估的高了一截。回頭翻使用紀錄——大部分不是花在真的難的題目,是花在「幫我開這個檔案看一下」「這個字在哪個檔案」「幫我跑一次 lint」這些用 Opus 或 Sonnet 有點浪費的雜活。

Claude Code 的計費邏輯是這樣:你付錢給 Anthropic 買 Opus/Sonnet/Haiku 的 token 額度,讓它們透過這個工具幫你寫程式。token 就是模型的計價單位——把你的字切成一小段一小段,一段算一次錢。順著這個邏輯想,好像除非戒掉 Claude Code,不然這筆錢就會一直繳下去。

其實可以不用。Claude Code 這個工具本身,跟裡面呼叫的模型是可以分開的——換成你自己電腦跑的開源模型,或走 OpenRouter 這種第三方 gateway 的免費 tier,都行。我兩種都試過一輪,把踩到的雷寫在這篇。

先講結論:兩種都能把每月付給 Anthropic 的錢壓到零,但都有隱藏成本。

Claude Code 為什麼會這麼貴?

很常被搞錯的一件事:Claude Code 本身不是 AI 模型。

Claude Code 是一個 harness——中文可以想成「操作 AI 的自動化底盤」,負責決定什麼時候該搜檔案、什麼時候該讀進來、什麼時候該叫工具、對話怎麼收尾。真正生答案的,是 Anthropic 的 Claude 模型(Opus、Sonnet、Haiku 三檔輪流用)。

換個比喻:Claude Code 是車體,Claude 這幾個模型是引擎。你每個月付的錢,全部是燃料錢(token 費用),不是車體錢。

那能不能把引擎換掉、車體照用?可以。就是一個環境變數的事。

方法一:讓 Claude Code 走本地 Ollama

先解釋 Ollama。它是一個管本地 AI 模型的工具,讓你在自己電腦上下載、跑各家的開源模型(Qwen、Gemma、Llama 這些),介面很像 Docker。官方網址 ollama.com,安裝就一行:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows 從 https://ollama.com/download 抓 OllamaSetup.exe 裝

裝完之後三步:

  1. 01
    📚

    選一個模型

    去 ollama.com/library 找 coding 用的模型;比較主流的是 Qwen 家族。

  2. 02
    ⬇️

    pull 下來

    例如 ollama pull qwen2.5-coder:7b,Ollama 會把約 4.7 GB 的模型下載到本機。

  3. 03
    🔌

    讓 Claude Code 指到它

    設 ANTHROPIC_BASE_URL 指向 Ollama 的本地端點(127.0.0.1:11434),Claude Code 就會呼叫本地模型而不是打到 Anthropic。

Ollama 桌面 app 有一個「Launch Claude Code with this model」的按鈕,會自動把環境變數帶好——這是最快的入口。想手動的話,把 Claude Code 的 base URL 環境變數指到本地端點、再指定要用的模型 tag,就跑起來了。

真正的限制在硬體。本地跑不是每台電腦都行——模型越大越聰明,也越吃 RAM 或 VRAM。這是 Ollama library 上主流 coding 模型的實際大小:

4.7 GB
qwen2.5-coder:7b —— 中階筆電勉強跑得動,速度普通
9.0 GB
qwen2.5-coder:14b —— 明顯聰明一階,但機器要夠力
19 GB
qwen3-coder:30b —— 進到桌上型 GPU 邊界,一般筆電就別想了

我自己在 M 系列筆電上跑 7b 版還算舒服,14b 就開始感覺喘。記憶體不夠硬跑更大的模型不是「慢」——會直接吃 swap、風扇狂轉、幾分鐘沒回應。這種時候 OpenRouter 那條路實在很多。

方法二:改把 Claude Code 指到 OpenRouter

如果你的電腦跑不動大模型,或你想要接近 Sonnet 的品質但不想直接付 Anthropic 錢,OpenRouter 是另一條路。

OpenRouter 是一個 model gateway——中文就是「模型代理」,把幾百個模型(Anthropic、OpenAI、Google、Qwen、DeepSeek、開源社群…)包在一個網址後面,統一計費。重點在於:很多模型有免費 tier,模型名字結尾會加「冒號 free」字樣。

原理跟 Ollama 那邊一樣。Claude Code 支援用環境變數換掉呼叫的網址;你把它改成 OpenRouter 的 endpoint,Claude Code 就會以為自己在跟 Anthropic 講話,其實是跟 OpenRouter 的閘道講話。

範例(Claude Code 的環境變數會隨版本演進,最終請以 Anthropic 官方 settings 文件 當日內容為準):

// .claude/settings.local.json
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://openrouter.ai/api/v1",
    "ANTHROPIC_AUTH_TOKEN": "sk-or-你的-OpenRouter-API-key",
    "ANTHROPIC_API_KEY": "",
    "ANTHROPIC_MODEL": "qwen/qwen-2.5-coder-32b-instruct:free",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "qwen/qwen-2.5-coder-32b-instruct:free"
  }
}

這裡有一個很容易漏的坑。Claude Code 內部有一個「小快模型」的角色,跑背景任務——工具分派、subagent 派工、對話摘要都靠它。這個角色預設綁著 Haiku。你如果只換了主要模型的環境變數、沒把小快模型那條也一起換掉,背景呼叫還是會打到 Anthropic 的 Haiku——你以為免費,帳單月底還是會來,而且很難解釋。

OpenRouter 的免費 tier 也有配額。免費模型的日呼叫上限預設是 50 requests/day;帳戶儲值後上限會提高(實際數字請對 openrouter.ai 當日 pricing 頁為準)。所以「免費」的入場費,是要先儲一次值,通常 $10 就夠。

誠實說:這樣真的免費嗎?

「免費」的定義要看你怎麼算。現金確實不用付了,成本會跑到別的地方去。

用免費模型跑 Claude Code · 優缺點

優點
  • + 不吃 Anthropic 的 token 額度,Sonnet/Opus 用量整體降下來
  • + 本地 Ollama 完全在本機=隱私、可離線
  • + 省下「查檔案/跑 lint/小重構」這種低價值 grind 的錢很有感
  • + 順便學到模型分工的概念,未來想自己寫 agent 用得到
缺點
  • 本地跑吃硬體:想跑得動 30B 級別的模型,起碼要 20 GB+ 的 VRAM
  • OpenRouter 免費 tier 要先儲值一次才有像樣的日配額
  • 開源模型對 tool 呼叫的紀律不如 Anthropic 的模型——常常掉工具、少參數
  • 真的難的重構、architecture 決策,還是要走回官方 Sonnet/Opus

什麼時候該用免費模型?

我實測後把 Claude Code 的任務分兩類(你的專案不一樣可以自己調):

任務類型建議走
讀檔/grep/找 symbol/找函式免費模型(本地或 OpenRouter)
跑 lint、跑測試、回報結果免費模型
簡單 scaffold(新檔骨架、樣板 code)免費模型
摘要一長串 log 或 error trace免費模型
跨檔案重構、資料表設計官方 Sonnet/Opus
生產環境 debug、上線前 review官方 Sonnet/Opus
有安全性、法遵風險的變更官方 Sonnet/Opus,錢別省

我後來的用法就是:雜活丟給便宜模型、硬活才叫 Sonnet 或 Opus。這樣分下來,每月 token 帳單會明顯往下一階。之前 Sonnet 常常被我叫去做「幫我打開一個檔案」這種事,那些 token 花得很可惜。

我的 takeaway

Claude Code 是殼、模型才是引擎——換引擎不會違反服務條款。Anthropic 自己的官方文件就有講怎麼把 endpoint 指到 AWS Bedrock 或 Google Vertex,這是官方立場,不是灰色地帶。

免費也不等於零成本。本地是硬體錢、OpenRouter 是儲值一次的錢,但這些都是一次性投入,換來的是每月 token 帳單不再是變數。

至於用哪一套:把雜活丟給便宜模型、硬活留給官方,是我目前省最多的方式。你的 AI 帳單怎麼壓,其實就看你願不願意把「每一個 token 花得值不值得」這件事想清楚。

接下來看什麼

想把這些變成你的實戰能力?

加入 免費會員 — 解鎖「加密貨幣新手 30 天」+「AI 工具 21 天」實戰課、免費 prompt 資源區,還有每天自動生息的放貸 Bot 可試用。email 一鍵註冊、不用密碼。