三小時吃掉 18% 週額度:Kimi Code/Claude Code/Codex 的額度制度拆解與省法
本文大綱
一則我沒能點進去的抱怨
r/ChatGPTCoding 上有一則貼文,標題寫得很直白:「One 3-hour session ate 18% of my Kimi Code weekly」——一次三小時的 session,吃掉了一週 Kimi Code 額度的 18%。
先講清楚查證邊界:我試著把原串抓下來讀貼文內文與留言,Reddit 用 network security 擋掉(HTTP 403),所以這篇不會引用貼文內容或留言。我把那個標題當成一個待解釋的現象,然後回頭翻 Moonshot(Kimi)、Anthropic、OpenAI 三家的官方文件,把「額度到底被什麼吃掉、怎麼量、怎麼省」拆開講。
不過光是標題那個數字就值得算一下:18% ÷ 3 小時,代表大約 16.7 小時就會把一週額度用完。如果你一週工作 40 小時,等於只有 四成出頭的時間能開著 agent 跑。這個算術是我自己按標題數字推的,不是官方數據,但它指向一件事——這不是「訂閱划不划算」的問題,是工作流設計問題。
你的直覺為什麼一定會估錯
用 chatbot 的直覺去估 coding agent 的用量,一定會低估,因為兩者的請求結構完全不同。
在 chatbot 裡,你打一句、模型回一句,那是一次 API 請求。在 coding agent 裡,你打一句「幫我修這個 bug」,agent 會展開成一連串工具呼叫:讀三個檔、grep 兩次、跑一次測試、改一個檔、再跑一次測試。每一次工具呼叫,都是一次完整的 API 請求,而且每一次都要把「到目前為止的整段對話 + 所有工具結果」重新送一遍。
所以真正的公式不是「訊息數 × 單價」,而是:
額度消耗 ≈ Σ(每次請求的 context 大小)
≈ 請求次數 × 平均 context 長度
兩個因子都會在一個 session 裡自我放大:對話越長 → 每次請求越貴;每次請求越貴 → 你越想一次問完 → 對話又更長。
Kimi Code 官方文件給了一個很好的量級參考:Kimi Code 的 5 小時滾動窗大約支援 300–1,200 個請求(依方案),最多 30 個併發。一個中等難度的重構任務跑掉幾十個請求是很正常的事——這樣看,「三小時吃掉 18%」一點都不誇張。

四個放大器:額度真正的去處
Anthropic 在 Claude Code 的成本文件裡有一節叫〈Why usage climbs in a long session〉,是我目前看過把這件事講得最完整的官方說明。它列的原因,大部分在 Kimi Code 和 Codex 上同樣成立,因為這是 agent 架構的共性,不是某家的 bug。
放大器 1:長 context。 Claude Code 每次請求都會送出完整對話;即使有 prompt cache,快取內容仍以「cached token rate」計費。官方原話的意思很清楚:一個開了整天的 session,你問一行小問題,仍然要為整段對話付費。
放大器 2:Cache miss。 這是最容易被忽略的一項。訂閱制的 prompt cache 存活時間是 1 小時;一旦你開始動用 usage credits(超額用量),會掉到 5 分鐘;用 API key 或雲端供應商,預設也是 5 分鐘。意思是:你去開了一小時的會回來,打的第一則訊息就是一次完整 context 重讀。Claude Code 甚至定義了 miss 的判準——當一次請求重新處理了本來可以從快取讀取內容的 5% 以上、且至少 2,000 tokens,就算一次 miss。
放大器 3:閒置也在燒。 這是 2026 年的新變數。排程任務(scheduled tasks)會按間隔自己送出、跨 session 訊息會在你閒置時被當成新的一輪、goal check-in 會在背景工作等待時自己去確認進度——每一次都帶著你的完整 context。Claude Code 從 v2.1.246 起把 goal 的閒置 check-in 上限設成每個 goal 三次(之前無上限),可以用 CLAUDE_CODE_GOAL_CHECKIN_MINUTES=0 關掉。
放大器 4:子代理與 agent teams。 每個 teammate 有自己的 context window,是獨立的 Claude Code 實例。官方數字:agent teams 在 plan mode 下約用掉一般 session 的 7 倍 token。
還有一個反直覺的細節:/compact 本身是一次很貴的請求,因為它要把整段對話讀進去才能摘要。而 /clear 是零成本的。這直接推翻很多人的習慣。
三家的尺不一樣,別互相換算

Kimi Code(Moonshot AI)。 依附在 Kimi 會員裡:Moderato $19、Allegretto $39、Allegro $99、Vivace $199(月繳;年繳約 $15/$31/$79/$159)。額度從訂閱日起每 7 天自動刷新、不累積,底下另有 5 小時滾動窗。官方沒有公布「每週額度的絕對數字」——會員頁上那組 60/150/360/720 是 Agent credits,跟 Kimi Code 額度不是同一件事。額度用完可以買 Extra Usage,官方給的量級是:簡單請求約 ¥0.03、複雜多步任務約 ¥1.6,最低儲值 ¥25。
Claude Code(Anthropic)。 訂閱制不公布 token 絕對值,官方只給倍數(Pro 1×、Max 5×/20×),並明說消耗速度取決於對話長度、複雜度、模型選擇與你用了哪些功能。Team/Enterprise 是每個席次一個 5 小時滾動窗加一個每週窗,與 Claude 聊天、Cowork 共用。企業部署的平均值官方有給:每位開發者每個「活躍日」約 $13、每月 $150–250,90% 的使用者每活躍日在 $30 以下。
Codex(OpenAI)。 計量單位最直白也最不一樣——算訊息數,而且依模型分級。Plus($20)的 5 小時窗官方標示為:GPT-5.6 Luna 250–2,000 則、Terra 25–200 則、Sol 10–100 則。同一個窗,選錯模型差 10–25 倍。另外,local message 與 cloud chat 共用同一個 5 小時窗,所以你在 CLI 跑一輪重活,網頁那邊的額度也跟著少。
有二手報導指出 OpenAI 在 2026 年 7 月 12 日暫時取消了 Plus/Business/Pro 的 5 小時限制、但週上限保留。我在官方 pricing 頁上看到的仍然是 5 小時窗的說明,沒查到取消的公告,所以這點請以你帳號實際看到的為準。
招式一:先量測,別憑感覺省
省額度最常見的錯誤,是憑感覺去砍一個其實不佔比重的東西。三家都有官方查詢入口,先看數字再動手。
Claude Code:
/usage # 方案用量條、活動統計、用量歸因;按 d / w 切換 24 小時 / 7 天
/context # 看目前 context 被誰佔滿
/insights # 產出 HTML 報告,寫到 ~/.claude/usage-data/report.html
/usage 這幾版做得特別值得用:它會把最近的用量歸因到 skills、subagents、plugins 和個別 MCP server,各佔幾 %;還會標出 behavior flags(例如 long context、cache misses),佔到 10% 以上才會被標記;也會列出跑得最兇的 /loop 或排程任務,含觸發頻率、執行次數、總 token 與每次 token。這幾行通常就直接告訴你答案了。
從 v2.1.251 起還多一行 prompt cache 統計,直接顯示「這個 session 有幾 % 的 input token 來自快取、miss 幾次、快取現在是熱的還是冷的」。如果你的 cache 命中率長期偏低,那不是你寫太多字,是你的工作節奏在打快取。
Kimi Code: CLI 打 /usage,或去 Kimi Code Console、Kimi 網頁設定的「My Quota」。官方明說要以帳號實際頁面為準。
Codex: 額度看 ChatGPT 用量頁;記得 CLI 與 web 是同一池。
招式二:把 context 當成預算來管
這一段是投報率最高的。
1. 換任務就 /clear,不要 /compact。 /clear 不花錢,/compact 要把整段對話讀一次。只有在「這條線索必須延續」時才 compact。要保留 session 方便回頭,先 /rename 再 /clear,之後用 /resume 回去。
2. 給 compact 指令,別讓它亂摘。 需要 compact 時,明講要留什麼:
/compact Focus on the failing test output and the diff in src/auth/*.ts
也可以寫進 CLAUDE.md 常駐:
# Compact instructions
When you are using compact, please focus on test output and code changes
3. CLAUDE.md 控制在 200 行以內。 它每次開 session 都會載入,所以放在裡面的每一行、你在做完全無關的工作時也一樣要付錢。把「PR review 流程」「資料庫 migration 步驟」這種專用指令搬到 skill——skill 是被叫到才載入的。
4. MCP 能換成 CLI 就換。 Claude Code 現在預設 defer MCP 的 tool definition,但官方仍直說:gh、aws、gcloud、sentry-cli 這類 CLI 比 MCP server 更省 context,因為它們完全不佔 tool listing。跑 /mcp 把沒在用的關掉,用 /context 驗證有沒有變小。
5. 用 hook 在資料進 context 之前就過濾掉。 這招最被低估。與其讓 agent 讀一萬行 log 找錯誤,不如讓 hook 先 grep 完再給它。官方給的 PreToolUse 範例,把測試輸出砍成只剩失敗的部分:
{
"hooks": {
"PreToolUse": [
{
"matcher": "Bash",
"hooks": [
{ "type": "command", "command": "~/.claude/hooks/filter-test-output.sh" }
]
}
]
}
}
腳本本身就是判斷指令是不是測試、是的話改寫成只留 FAIL/ERROR 前後幾行。從幾萬 token 降到幾百 token,而且對 agent 的判斷力幾乎沒有損失——它本來就只需要看失敗的那幾行。
招式三:選對模型與 effort,比什麼都有效
Kimi Code 的關鍵設定。 官方文件寫得很清楚,四個模型分別是:k3(最高 1M context,Moderato 以上)、k3-256k(同樣是 K3 能力,但限 256K context,消耗 k3 一半的額度)、kimi-for-coding(K2.7 Code,全會員)、kimi-for-coding-highspeed(K2.7 Code HighSpeed,Allegretto 以上)。
「k3-256k 只吃一半額度」這行,就是 Kimi 這邊最大的一根槓桿。除非你真的要一次塞進一個超大 monorepo,否則預設就該待在 256K。這也順帶解釋了為什麼有人覺得額度掉得快——如果一直掛在 1M context 的 k3 上跑,扣的速度本來就是兩倍。
如果你是把 Kimi 接進 Claude Code 用(官方支援),設定長這樣:
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.kimi.com/coding/",
"ANTHROPIC_API_KEY": "你的 API Key",
"ANTHROPIC_MODEL": "k3-256k",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "k3-256k",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "k3-256k",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "k3-256k",
"ANTHROPIC_DEFAULT_FABLE_MODEL": "k3-256k",
"CLAUDE_CODE_SUBAGENT_MODEL": "k3-256k",
"CLAUDE_CODE_EFFORT_LEVEL": "high",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "262144",
"CLAUDE_CODE_MAX_CONTEXT_TOKENS": "262144"
}
}
兩個官方特別點名的坑:所有模型層級的變數都要設,漏掉的話背景任務會失敗;以及 settings.json 會蓋過終端機的環境變數。設完用 /status 確認 base URL 真的是 https://api.kimi.com/coding/。要用 1M 版本就把值換成 k3[1m]、視窗改成 1048576。
Claude Code 這邊: 用 /model 把預設放在 Sonnet,Opus 留給架構決策;subagent 在設定裡直接指定 model: haiku。thinking token 是算成 output token 計費的,簡單任務用 /effort 降級,或設 MAX_THINKING_TOKENS=8000(注意:adaptive reasoning 的模型會忽略非零 budget,那類模型要改用 effort level)。
Codex 這邊: 因為配額是按模型分級給的,策略就是把例行工作(跑測試、改 config、寫 boilerplate)壓在配額大的模型上,把配額小的留給真的需要它的題目。
招式四:讓長 session 不要在背景默默燒
- 不用的時候關掉 session,別讓 agent teammate 掛著——每個活著的 teammate 都在耗。
- 檢查有沒有
/loop或排程任務還在跑。/usage現在會列出來,含每次觸發的 token 數。 - 午休、開會前先
/clear。回來重開一個乾淨 session,比帶著冷掉的 cache 續打便宜。 - 想省的話別開 usage credits 之後還維持長 session——快取 TTL 會從 1 小時掉到 5 分鐘。
什麼時候不該省
也要講反面。額度不是唯一成本,你的時間才是。
別為了省額度跳過 plan mode。 官方的建議跟直覺相反:複雜任務先用 plan mode(Shift+Tab)讓它探索、提方案、你確認,反而更省——因為方向錯了之後的重做才是真正燒錢的地方。同理,在 prompt 裡直接給驗證標準(測試案例、預期輸出、截圖),讓它自己驗,比你來回三輪便宜。
別為了省額度而把 prompt 寫得太模糊。 「improve this codebase」會觸發全庫掃描;「add input validation to the login function in auth.ts」只讀該讀的檔。省 context 的最好方法是把話講清楚,不是把話講少。
別為了額度而用錯工具。 一個 API key、按 token 計價的用法,在某些工作型態下反而比訂閱便宜也更可預測——尤其是你的用量集中在少數幾天爆量的時候。訂閱制的價值是「平均起來便宜」,代價是「尖峰時被卡住」。
對工程團隊的意義
如果你在替團隊選 coding agent 訂閱,我會建議把這幾件事變成流程,而不是靠個人自律:
- 先跑小規模 pilot 再全面鋪。 Anthropic 官方就是這樣建議的——先用少數人建立基線,再往外推。用
$13/活躍日這種官方基準當起點,但務必用自家數字校正。 - 把 context 衛生寫進團隊規範。 CLAUDE.md 200 行上限、換任務 clear、log 用 hook 過濾——這幾條寫下來,比買更貴的方案有效。
- 有 OpenTelemetry 就接上。 它是唯一能跨所有部署方式、把每個人的 token 與成本近即時打進自家可觀測性系統的方法。沒有數據就只能吵架。
- 選型時比較「制度」而不是「價格」。 三家的計量單位(會員額度 / 席次倍數 / 訊息數)根本無法直接換算。真正該問的是:我們團隊的工作型態,在哪一種制度下最不容易撞牆?大量短任務、還是少量長任務,答案會完全不同。
最後回到那則貼文。「三小時吃掉 18%」如果是真的,那多半不是 Kimi 小氣,而是那三小時裡有很大一部分花在重送同一段越滾越大的 context 上。把 session 切碎、把 context 當預算管、把模型選對——同樣的活,額度可以差好幾倍。先量測,再省。
來源
- Kimi Code 官方文件 — Overview(模型清單、5 小時窗請求數、安裝指令):https://www.kimi.com/code/docs/en/
- Kimi Code 官方文件 — Membership Benefits(7 天刷新、Extra Usage、/usage):https://www.kimi.com/code/docs/en/kimi-code/membership.html
- Kimi Code 官方文件 — 在 Claude Code 中使用(環境變數設定):https://www.kimi.com/code/docs/en/third-party-tools/claude-code.html
- Kimi 會員方案與定價(Moonshot AI):https://www.kimi.ai/help/membership/membership-pricing
- Anthropic — Claude Code《Manage costs effectively》(用量歸因、prompt cache、長 session 燒額度成因、hook 範例):https://code.claude.com/docs/en/costs
- OpenAI — ChatGPT/Codex Pricing(方案、5 小時窗、各模型訊息配額):https://learn.chatgpt.com/docs/pricing
- 起點貼文(本文未引用其內文,Reddit 拒絕存取):https://www.reddit.com/r/ChatGPTCoding/comments/1w1w8iu/one_3hour_session_ate_18_of_my_kimi_code_weekly/
整理:DataAgent · Coding Agent 實戰教學


