Claude Sonnet 5.5 が Opus 5.5 に大きく負けたベンチマークは1つだけ

Colorful 3D render showcasing AI and programming with reflective abstract visuals.

Anthropic が出した8つのベンチマークで、Claude Sonnet 5.5 が Opus 5.5 に大きく離されたのは FrontierCode の8.2ポイントだけで、ほかは僅差か Sonnet 5.5 が上回っている。その FrontierCode は、Sonnet 5 からの伸びも3.8ポイントと一番小さかった。

FrontierCode というテストで、Claude Sonnet 5.5 は46.2%、Opus 5.5 は54.4%でした。AI に自分で手順を進めさせてプログラムを書かせるテストで、Anthropic が Sonnet 5.5 の発表に載せた8項目のうち、両者が8ポイント以上離れたのはここだけです。ほかの%で比べる項目は1.7〜3.2ポイントの差に収まるか、Terminal-Bench 4.0 のように Sonnet 5.5 のほうが上でした。開発者が使う API の単価は Sonnet 5.5 が Opus 5.5 の半分で、claude.ai の無料プランでも Sonnet 5.5 を使えます。

ベンチマーク(分野)Sonnet 5.5Opus 5.5Sonnet 5GPT-6 Sol
Terminal-Bench 4.0(エージェントのコーディング)70.6%66.4%10.3%—
FrontierCode 1.1 Main(エージェントのコーディング)46.2%54.4%42.4%49.3%
CursorBench 4.0(エージェントのコーディング)55.5%57.8%34.1%—
GDPval-AA v2.1(知識労働)1844184614491487
AA-Briefcase v1.1(知識労働)1811182213591483
Humanity’s Last Exam(多分野、ツールあり)64.5%67.7%54.9%—
OSWorld 2.1(パソコン操作)80.1%81.8%57.0%—
Chartography(グラフの読み取り、ツールなし)61.6%64.4%15.6%53.6%

数字はどれも Anthropic の発表にあるものです。Opus 5.5 の Terminal-Bench 4.0 は effort(どれだけ考えさせるかの設定)を Xhigh にしたときの値で、Sonnet 5.5 の FrontierCode には Max の注記が付いています。知識労働の2項目は Artificial Analysis が発売前の版で測った点数で、%ではありません。

FrontierCode だけ伸びが小さい

FrontierCode では GPT-6 Sol も49.3%(effort を Xhigh にすると52.1%)で、Sonnet 5.5 を上回っています。Sonnet 5 の42.4%からの伸びも3.8ポイントしかなく、%で比べるほかの項目が少なくても9.6ポイント伸びているのと比べると、ここだけ伸び方が違います。Anthropic 自身も発表の中で、長く判断を続ける必要がある、答えの決まっていない込み入った作業では、Opus 5.5 のほうがはっきり強いと書いています。開発者向けの資料でも、どのモデルにするか迷ったら、たいていの用途は Opus 5.5 から始めるよう案内しています。

Sonnet 5 から伸びたのはターミナルとグラフ

Sonnet 5 から大きく伸びたのは、Terminal-Bench 4.0 の10.3%→70.6%と、Chartography の15.6%→61.6%です。Terminal-Bench はターミナルでコマンドを打って作業を進めるテスト、Chartography はグラフを読み取るテストで、Sonnet 5 はどちらも1〜2割しか取れていませんでした。画面を見てパソコンを操作する OSWorld 2.1 も57.0%から80.1%に上がり、Opus 5.5 の81.8%との差は1.7ポイントです。

知識労働の2項目では、Sonnet 5.5 は1844点と1811点で、Opus 5.5 との差は2点と11点でした。GPT-6 Sol の1487点と1483点とは、どちらも300点以上離れています。

速さと、表の数字の条件

出力の速さは、Anthropic によると Sonnet 5 より30%以上上がりました。開発者向けの資料の比較表では、Sonnet 5.5 は「Fast」、Opus 5.5 は「Moderate」の区分で、Artificial Analysis の測定では出力は1秒あたり139.1トークン(トークンは AI が文章を扱う単位)でした。タスクあたりの料金が Sonnet 5 より最大30%安くなるのも、同じ作業を少ないトークンで終えられるようになったからだと説明されています。

ただ、表には effort を上げて測った数字が混ざっています。Claude Code と Claude のアプリの既定は Medium、API は High なので、ふだんの設定のままでは表と同じ結果にならないことがあります。Artificial Analysis は Sonnet 5.5 を Max で測って総合の指数を56点としていますが、そのとき出力したトークンは4億1,000万で、ページに載っている中央値8,100万の約5倍でした。effort を上げて使うなら、出力が増えるぶん、待ち時間と料金もそれだけ増えます。

セキュリティの依頼は Sonnet 5 が答える

危険度の高いサイバーセキュリティの依頼では、Sonnet 5.5 ではなく Sonnet 5 が答えます。切り替わったことは利用者に分かる形で示され、その分野を仕事にしている人向けには、Anthropic の Cyber Verification Program に申し込むと段階的に使える仕組みがあります。

出典

  1. Claude Sonnet(Anthropic 公式)
  2. Introducing Claude Sonnet 5.5(Anthropic 公式)
  3. Models overview - Claude Platform Docs
  4. Claude Sonnet 5.5 - Intelligence, Performance & Price Analysis - Artificial Analysis
  5. Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task - The Decoder
  6. サムネイル写真: Photo by Google DeepMind on Pexels