Claude Sonnet 5.5 が Opus 5.5 に大きく負けたベンチマークは1つだけ

Anthropic が出した8つのベンチマークで、Claude Sonnet 5.5 が Opus 5.5 に大きく離されたのは FrontierCode の8.2ポイントだけで、ほかは僅差か Sonnet 5.5 が上回っている。その FrontierCode は、Sonnet 5 からの伸びも3.8ポイントと一番小さかった。
FrontierCode というテストで、Claude Sonnet 5.5 は46.2%、Opus 5.5 は54.4%でした。AI に自分で手順を進めさせてプログラムを書かせるテストで、Anthropic が Sonnet 5.5 の発表に載せた8項目のうち、両者が8ポイント以上離れたのはここだけです。ほかの%で比べる項目は1.7〜3.2ポイントの差に収まるか、Terminal-Bench 4.0 のように Sonnet 5.5 のほうが上でした。開発者が使う API の単価は Sonnet 5.5 が Opus 5.5 の半分で、claude.ai の無料プランでも Sonnet 5.5 を使えます。
| ベンチマーク(分野) | Sonnet 5.5 | Opus 5.5 | Sonnet 5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(エージェントのコーディング) | 70.6% | 66.4% | 10.3% | — |
| FrontierCode 1.1 Main(エージェントのコーディング) | 46.2% | 54.4% | 42.4% | 49.3% |
| CursorBench 4.0(エージェントのコーディング) | 55.5% | 57.8% | 34.1% | — |
| GDPval-AA v2.1(知識労働) | 1844 | 1846 | 1449 | 1487 |
| AA-Briefcase v1.1(知識労働) | 1811 | 1822 | 1359 | 1483 |
| Humanity’s Last Exam(多分野、ツールあり) | 64.5% | 67.7% | 54.9% | — |
| OSWorld 2.1(パソコン操作) | 80.1% | 81.8% | 57.0% | — |
| Chartography(グラフの読み取り、ツールなし) | 61.6% | 64.4% | 15.6% | 53.6% |
数字はどれも Anthropic の発表にあるものです。Opus 5.5 の Terminal-Bench 4.0 は effort(どれだけ考えさせるかの設定)を Xhigh にしたときの値で、Sonnet 5.5 の FrontierCode には Max の注記が付いています。知識労働の2項目は Artificial Analysis が発売前の版で測った点数で、%ではありません。
FrontierCode だけ伸びが小さい
FrontierCode では GPT-6 Sol も49.3%(effort を Xhigh にすると52.1%)で、Sonnet 5.5 を上回っています。Sonnet 5 の42.4%からの伸びも3.8ポイントしかなく、%で比べるほかの項目が少なくても9.6ポイント伸びているのと比べると、ここだけ伸び方が違います。Anthropic 自身も発表の中で、長く判断を続ける必要がある、答えの決まっていない込み入った作業では、Opus 5.5 のほうがはっきり強いと書いています。開発者向けの資料でも、どのモデルにするか迷ったら、たいていの用途は Opus 5.5 から始めるよう案内しています。
Sonnet 5 から伸びたのはターミナルとグラフ
Sonnet 5 から大きく伸びたのは、Terminal-Bench 4.0 の10.3%→70.6%と、Chartography の15.6%→61.6%です。Terminal-Bench はターミナルでコマンドを打って作業を進めるテスト、Chartography はグラフを読み取るテストで、Sonnet 5 はどちらも1〜2割しか取れていませんでした。画面を見てパソコンを操作する OSWorld 2.1 も57.0%から80.1%に上がり、Opus 5.5 の81.8%との差は1.7ポイントです。
知識労働の2項目では、Sonnet 5.5 は1844点と1811点で、Opus 5.5 との差は2点と11点でした。GPT-6 Sol の1487点と1483点とは、どちらも300点以上離れています。
速さと、表の数字の条件
出力の速さは、Anthropic によると Sonnet 5 より30%以上上がりました。開発者向けの資料の比較表では、Sonnet 5.5 は「Fast」、Opus 5.5 は「Moderate」の区分で、Artificial Analysis の測定では出力は1秒あたり139.1トークン(トークンは AI が文章を扱う単位)でした。タスクあたりの料金が Sonnet 5 より最大30%安くなるのも、同じ作業を少ないトークンで終えられるようになったからだと説明されています。
ただ、表には effort を上げて測った数字が混ざっています。Claude Code と Claude のアプリの既定は Medium、API は High なので、ふだんの設定のままでは表と同じ結果にならないことがあります。Artificial Analysis は Sonnet 5.5 を Max で測って総合の指数を56点としていますが、そのとき出力したトークンは4億1,000万で、ページに載っている中央値8,100万の約5倍でした。effort を上げて使うなら、出力が増えるぶん、待ち時間と料金もそれだけ増えます。
セキュリティの依頼は Sonnet 5 が答える
危険度の高いサイバーセキュリティの依頼では、Sonnet 5.5 ではなく Sonnet 5 が答えます。切り替わったことは利用者に分かる形で示され、その分野を仕事にしている人向けには、Anthropic の Cyber Verification Program に申し込むと段階的に使える仕組みがあります。
出典
- Claude Sonnet(Anthropic 公式)
- Introducing Claude Sonnet 5.5(Anthropic 公式)
- Models overview - Claude Platform Docs
- Claude Sonnet 5.5 - Intelligence, Performance & Price Analysis - Artificial Analysis
- Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task - The Decoder
- サムネイル写真: Photo by Google DeepMind on Pexels