Claude Code のモデル比較をテレメトリ×LLM-as-a-Judge で客観化してみた
2026.07.22 11:54
Classmethod.jp
Claude Code の3モデル(fable / opus / sonnet)を3タスク×2試行のヘッドレス実験で比較し、テレメトリの効率指標と LLM-as-a-Judge による品質採点を掛け合わせて評価しました。最安・最少手数だったモデルが品質採点では最下位になった実例から、「効率指標単独ではモデル評価を誤る」ことを実証します。