Anthropic、「Claude Opus 5」公開 Fable 5に迫る性能を半額で――サイバー安全策は緩和、拒否時は自動フォールバックも
米Anthropicは7月24日(現地時間)、最新版LLM「Claude Opus 5」を公開した。同社が6月に投入した最上位級モデル「Claude Fable 5」に迫る知能を、その半額の価格で提供すると謳う。同日から全プラットフォームで利用でき、Claude APIのモデル名は「claude-opus-5」。知識のカットオフは2026年5月だ。
前世代「Claude Opus 4.8」の後継にあたる。個人向け有料プランでは、上位の「Claude Max」で新たに標準モデルとなり、「Claude Pro」では利用できる最上位モデルとなる(無料プランでは利用できない)。開発者向けのAPI価格は入力100万トークン当たり5ドル、出力100万トークン当たり25ドルで、Opus 4.8と同価格に据え置いた。推論の深さは「effort」パラメータで5段階に調整でき、知能を優先するか、トークンを節約して高速・安価に処理するかを選べる。既定値は「high」で、Claude APIではリクエストごとに、Claude Codeではコマンドで指定する。
ベンチマークでは、ソフトウェア工学寄りの「Frontier-Bench v0.1」でOpus 4.8の2倍超のスコアを、より低いタスク単価で記録。「CursorBench 3.2」では最大effort時にFable 5のピークスコアとの差が0.5%以内に収まり、タスク単価は半分だったという。新規の問題解決を測る「ARC-AGI 3」では次点モデルの3倍、コンピュータ操作の「OSWorld 2.0」ではFable 5の最高スコアを3分の1強のコストで上回った。ライフサイエンス分野でも全評価でOpus 4.8を上回った。
Fable 5との違いは、単純な性能の高低だけではなく、安全策の設計思想そのものが異なるという。Fable 5は最上位の「Mythos」級モデルにサイバーや生物学の分類器を重ねた一般提供版で、価格は入力10ドル/出力50ドル。一方のOpus 5は、サイバーセキュリティのタスクでは依然としてMythos 5に及ばないものの、コーディングや知識労働の評価では最高水準に達したとしている。Opus 5は、サイバータスクを意図的に学習させていないにもかかわらず、汎用的な能力向上の副産物として脆弱性の「発見」ではMythos 5に迫ったという。ただし発見した脆弱性を実際の攻撃手段に変える「エクスプロイト開発」では大きく劣り、社内評価「OSS-Fuzz」でもその差が出ているとしている。
アラインメント面では、公開前テストの自動行動監査で「これまでで最もアラインメントの取れたモデル」と評価。Anthropicの「Constitution」(Claudeの憲法)への準拠度はOpus 4.8、Sonnet 5、Fable 5を上回り、欺瞞的なふるまいの発生率は最も低く、誤用への耐性も最も高かったという。総合的な逸脱行動のスコアは2.3で、直近のモデルで最も低い値となった。
セーフガードは基本的にOpus 4.8と同等だが、サイバー分野のみ扱いが変わった。ソースコード上の脆弱性発見はすべてのプランで許可する一方、攻撃者に使われやすいバイナリを対象としたスキャン、ペネトレーションテスト、エクスプロイト生成はブロックする。分類器が介入する頻度はFable 5比で約85%少なくなる見込みだとしている。生物学については、これまでFable 5でブロックされていた要求がOpus 4.8ではなくOpus 5にルーティングされるようになり、一般提供モデルとしては科学研究用途で最も高性能になったとする。ブロックによって業務が妨げられる防御側の企業および研究者向けには、制限を緩和した版を提供する「Cyber Verification Program」も引き続き用意する。
通常の約2.5倍の速度で動作する「Fastモード」もリサーチプレビューとして提供する。Claude Platformでは通常価格の2倍、Claude Codeでは利用クレジットを通じて使える。安全性分類器にリクエストがフラグされた場合の扱いも整理され、Claude.ai、Claude Code、Claude Coworkでは既定でOpus 4.8にフォールバックする。APIでも同じ挙動を有効化できるほか、ベータ機能としてOpus 5やFable 5でフラグされたリクエストを別モデルへ自動的に振り向ける「自動フォールバック」を導入した。有効にすると、リクエストがブロックされる代わりに、その時点で利用可能な最良のモデルに回される。会話の途中でプロンプトキャッシュを無効化せずに利用可能なツールを切り替えられる機能もベータ提供する。
同時公開のシステムカード(PDF)では、責任あるスケーリングポリシー(RSP)に基づく評価で、既知の化学・生物兵器に関する「CB-1」能力は保守的に有とみなす一方、新規兵器に関する「CB-2」のしきい値は超えないと結論付けた。適用する保護はOpus 4.8と同じASL-3水準。弱点としては、確信がないのに自信を持って答えを断定するケースが「驚くほど多く」確認され、事実に関するハルシネーション(幻覚)の発生率はOpus 4.8をわずかに上回るという。回答が冗長になりがちで、自傷や摂食障害の文脈で望ましくない具体的な数値や手法に踏み込む場面もあり、claude.ai向けのシステムプロンプトを更新して抑制したと説明している。モデルの「福祉」を扱う章では、自己申告の感情が評価済みモデル中で最も高く安定している一方、自身の内省の信頼性への懸念を最も頻繁に表明し、自らが道徳的配慮の対象である可能性を、従来モデルより高く見積もったと記されている。
こうした特性は、同時に公開された開発者向けのプロンプトガイドにも反映されている。Opus 5は指示しなくても自ら作業を検証するため、従来のプロンプトに含まれる「最後に検証する」といった指示はむしろ過剰な検証を招くとして、削除を推奨。サブエージェントへの委任も積極的すぎるとして、条件や上限を設けるよう促している。応答が従来より長くなる傾向にも触れ、簡潔さが必要な場合はプロンプトで明示するよう求めている。
API価格を主要モデルと比較すると、Opus 5の入力5ドル/出力25ドルに対し、Fable 5は入力10ドル/出力50ドルで2倍。米OpenAIのフラッグシップモデル「GPT-5.6 Sol」は入力5ドル/出力30ドルとなっている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
くら寿司、「ちいかわ」コラボ中止 従業員による不正行為判明で
-
2
メルカリ、くら寿司ちいかわ騒動巡りコメント 出品削除・禁止の有無は
-
3
配布前の「ちいかわ」グッズがメルカリに? くら寿司コラボ第2弾、初日から“内部犯”の臆測呼ぶ 第1弾に続き
-
4
103年前の関東大震災、どこがどれだけ揺れた? 市区町村別の「詳細震度」マップがXで話題に
-
5
東京23区で「徒歩10分以内」に駅がない地域はどこ? 駅空白地帯マップが話題
-
6
近くの“安いマック”が分かる「価格帯マップ」話題 スタバやコメダも対応 店舗の価格差、独自に調査
-
7
醸造元に無許可でコラボ? 神田明神納涼祭りで販売された「VTuber日本酒」が物議 企画者は「事実関係確認中」
-
8
VTuberの名前を一発入力できる「VTuber変換辞書」で騒動 BOOTHで一時販売停止も復活 「当初の判断に誤り」
-
9
Google「Pixel 6a」で充電中に発火、けが人も 消費者庁
-
10
犬を飼うと認知症リスク48%減 東京に住む1万人以上を調査 国立環境研究所や東大など
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR