Claude Code のモデル比較をテレメトリ×LLM-as-a-Judge で客観化してみた

2026.07.22 11:54
Classmethod.jp

Claude Code の3モデル(fable / opus / sonnet)を3タスク×2試行のヘッドレス実験で比較し、テレメトリの効率指標と LLM-as-a-Judge による品質採点を掛け合わせて評価しました。最安・最少手数だったモデルが品質採点では最下位になった実例から、「効率指標単独ではモデル評価を誤る」ことを実証します。

検索

人気記事

2026.05.05 11:04
2026.07.24 23:51
2026.07.24 20:14
2026.07.24 18:19
2026.07.24 20:28

コメント一覧

まだコメントはありません。

コメント