一行要約

エンタープライズ平均は 1開発者あたり 1稼働日 $13 / 月 $150〜250。コストは context のサイズに比例するので、無関係な作業の間に /clear することとモデルを仕事に合わせることが最も効く2つの習慣。

要点

相場

指標
1開発者あたり 1稼働日約 $13
1開発者あたり 月$150〜250
ユーザーの 90%1稼働日 $30 未満

Budget more for a coding seat than a chat seat: each Claude Code turn carries file contents, tool calls, and multi-step reasoning, so one debugging session can consume more than a day of chat. チャット用の席よりコーディング用の席に多く予算を見込め。Claude Code の1ターンはファイルの中身、ツール呼び出し、複数段の推論を伴うため、デバッグ1セッションがチャット1日分を超えて消費しうる。

追跡

/usage の Session ブロック:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Claude Code computes the dollar figure locally from token counts priced at standard list rates, so it doesn’t reflect promotional pricing or contracted discounts and may differ from your actual bill. Claude Code は金額をローカルで、標準の定価に基づくトークン数から計算している。したがってキャンペーン価格や契約上の割引は反映されず、実際の請求額と異なる可能性がある

プラン利用者向けの内訳(Pro / Max / Team / Enterprise):

  • Attribution — skill、subagent、plugin、個別の MCP サーバごとの利用割合
  • Behavior flags — long context や cache miss など、直近の利用の 10% 以上を占める振る舞いにフラグが立つ
  • d / w で 24時間 / 7日間を切り替え

なぜ長いセッションで利用が跳ねるのか(重要)

Claude Code sends your full conversation with every request, and each time Claude uses tools it sends another request carrying that batch of tool results. a one-line question in a session that has been open all day still draws usage for the whole conversation. Claude Code は毎リクエストで会話の全体を送る。そして Claude がツールを使うたびに、その分の tool result を載せた別のリクエストを送る。一日開けたままのセッションでの一行の質問でも、会話全体分の利用を引くことになる。

原因の一覧:

原因内容
long context全会話が毎リクエスト送られる(cached rate ではあるが)
cache missキャッシュ寿命を超える中断の後、最初のメッセージが全 context を再処理する。寿命はサブスクリプションで 1時間、usage credits を使い始めると 5分に落ちる。API キーやクラウドプロバイダでは既定 5分
scheduled tasksセッションが idle でも間隔ごとに発火し、毎回全 context を送る
cross-session messages他セッションからのメッセージが新しいターンとして配送され、毎回全 context を送る
agent teammates各 teammate が終了するまでトークンを消費し続ける
compaction/compact は要約対象の会話を読むので、それ自体が大きなリクエスト。継続が要らないなら /clear はコストゼロ

ENABLE_PROMPT_CACHING_1H=1 で usage credits 使用中も1時間の寿命を保てる。

トークンを減らす戦略

1. context を先手で管理する

  • 無関係な作業に移るとき /clear 古い context は以降の全メッセージでトークンを無駄にする。/rename してから clear すれば後で /resume で戻れる
  • /compact に焦点を指定する/compact Focus on code samples and API usage
  • CLAUDE.md に # Compact instructions セクションを置いて既定の挙動を変える

2. モデルを選ぶ — Sonnet がほとんどのコーディング作業に十分で Opus より安い。単純な subagent には model: haiku

3. MCP のオーバーヘッドを減らす

Prefer CLI tools when available: Tools like gh, aws, gcloud, and sentry-cli are still more context-efficient than MCP servers because they don’t add any per-tool listing. 使えるなら CLI ツールを選べ。ghawsgcloudsentry-cli といったツールは、ツールごとの一覧を増やさないぶん、MCP サーバより context 効率が良い

/mcp で使っていないサーバを無効化する。

4. 型付き言語には code intelligence プラグインを入れる — 「go to definition」1回が、grep + 複数ファイル読みの代わりになる。編集後の型エラーも自動で報告される。

5. hook と skill に処理をオフロードする

Instead of Claude reading a 10,000-line log file to find errors, a hook can grep for ERROR and return only matching lines, reducing context from tens of thousands of tokens to hundreds. Claude に1万行のログファイルを読ませてエラーを探させる代わりに、hook で ERROR を grep して該当行だけを返せる。これで context は数万トークンから数百トークンへ減る。

6. CLAUDE.md から skill へ指示を移す — CLAUDE.md はセッション開始時に必ずロードされる。200行以内を目標に。

7. extended thinking を調整する — thinking トークンは出力トークンとして課金され、既定の予算はモデルによってはリクエストあたり数万トークンになりうる。/effort を下げる、/config で thinking を切る、固定 thinking 予算のモデルなら MAX_THINKING_TOKENS を下げる。Fable 5 は常に extended thinking を使うので無効化できない。

8. 冗長な処理を subagent に委譲する

9. agent team のコストを管理する

Agent teams use approximately 7x more tokens than standard sessions when teammates run in plan mode. teammate を plan モードで走らせる場合、agent teams は通常のセッションのおよそ7倍のトークンを使う。

10. 具体的なプロンプトを書く — “improve this codebase” のような曖昧な要求は広い走査を引き起こす。

11. 複雑な作業の進め方

  • plan mode を使う — 方向が間違っていたときの高価なやり直しを防ぐ
  • 早めに軌道修正するEscape で即停止、/rewindEscape 二度押しでチェックポイントに戻る
  • 検証対象を与える
  • 少しずつテストする

バックグラウンドのトークン消費

会話の要約(claude --resume 用)と一部のコマンド処理で、操作していなくても典型的に 1セッションあたり $0.04 未満を消費する。

開発者が上限に当たったときの見分け方

メッセージ意味
”You’ve hit your session limit” / “weekly limit”座席ベースの利用枠。全モデル共通なので /model で切り替えても回復しない
context / auto-compact の警告利用上限ではない。 auto-compact の閾値に近づいただけ
API / クラウドで想定外に高い大抵はclear されないまま続いた長いセッションか、既定モデルが Opus のまま

組織の TPM / RPM 目安

チーム規模TPM / userRPM / user
1-5200k-300k5-7
5-20100k-150k2.5-3.5
20-5050k-75k1.25-1.75
50-10025k-35k0.62-0.87
100-50015k-20k0.37-0.47
500+10k-15k0.25-0.35

規模が大きいほど1人あたりの TPM が下がるのは、大きな組織ほど同時利用率が下がるため。

そのまま使える具体例

CLAUDE.md に compact の指示を書く:

# Compact instructions
 
When you are using compact, please focus on test output and code changes

テスト出力を失敗行だけに絞る hook(数万トークン → 数百トークン):

{
  "hooks": {
    "PreToolUse": [
      {
        "matcher": "Bash",
        "hooks": [
          {
            "type": "command",
            "command": "~/.claude/hooks/filter-test-output.sh"
          }
        ]
      }
    ]
  }
}
#!/bin/bash
input=$(cat)
cmd=$(echo "$input" | jq -r '.tool_input.command')
 
# If running tests, filter to show only failures
if [[ "$cmd" =~ ^(npm test|pytest|go test) ]]; then
  filtered_cmd="$cmd 2>&1 | grep -A 5 -E '(FAIL|ERROR|error:)' | head -100"
  echo "{\"hookSpecificOutput\":{\"hookEventName\":\"PreToolUse\",\"permissionDecision\":\"allow\",\"updatedInput\":{\"command\":\"$filtered_cmd\"}}}"
else
  echo "{}"
fi

セットアップの確認(claude --debugmodified tool input keys: [command] が出る):

claude --debug
# 別ターミナルで npm test を走らせる

thinking の予算を下げる:

export MAX_THINKING_TOKENS=8000
export ENABLE_PROMPT_CACHING_1H=1   # usage credits 使用中も1時間キャッシュを保つ

日々の習慣(この文書で最も効果が大きい2つ):

/clear    無関係な作業に移るとき(コストゼロ。/compact と違い会話を読まない)
/model    仕事にモデルを合わせる(Sonnet を既定に、Opus は複雑な設計判断に)

原典で言及されている関連文書

  • context-window — auto-compact の閾値と何が生き残るか
  • agent-teams — teammate ごとの context window
  • sub-agents — 冗長な処理の隔離
  • mcp — tool search による MCP の context 削減
  • hooks-guide — 前処理による context 削減
  • memory — CLAUDE.md を 200行以内に保つ
  • skills — オンデマンドロードによる削減

未取得の派生リンク