Anthropic、「Claude Opus 5.5」公開 Fable 5.1並みの性能で利用コスト4割減

 米Anthropicは9月22日(現地時間)、「Claude Opus 5.5」を発表した。新シリーズ「Claude 5.5」の最初のモデルで、多くの作業で上位モデル「Claude Fable 5.1」と同水準の性能を持ちながら、一般的なワークロードでの利用コストは前世代の「Claude Opus 5」より40%低いという。同社のダリオ・アモデイCEOが9月12日にAI開発の「ペース調整」を訴えるエッセイを公開して以来、初めてのモデルリリースとなる。

有料プランとAPIで即日提供、利用上限も引き上げ

 同日から、ClaudeのPro、Max、Team、Enterpriseの各プランで利用可能になった。これに合わせ、Pro、Max、Team、シート制のEnterpriseの各プランで5時間ごとの利用上限を引き上げた。サブスクリプションユーザーには利用上限のリセットも付与し、好きなタイミングで使えるようにした。

Proプランでも利用可能に

 開発者はモデル名「claude-opus-5-5」で利用できる。Claude APIのほか、Amazon Bedrock、Google Cloud、Microsoft Foundryでも同日提供を始めた。GitHubも同日、GitHub Copilotの有料ユーザー向けに段階的な提供を始めた。中小規模のモデル「Claude Sonnet 5.5」と「Claude Haiku 5.5」も、今後数週間以内に投入する。

入出力2割値下げ、キャッシュ読み込みは6割減

 API料金は入力100万トークン当たり4ドル、出力100万トークン当たり20ドルで、Opus 5から20%下がった。エージェント型の作業やコーディングでコストの大半を占めるキャッシュ読み込みは、100万トークン当たり0.2ドルと、60%引き下げた。使用トークン数の減少と合わせ、既定の設定で一般的なワークロードを処理した場合のコストは、Opus 5より40%低くなるとしている。出力速度もOpus 5より30%以上速い。最大2.5倍の速度で出力する「Fast mode」は、入力100万トークン当たり8ドル、出力40ドル。

Opus 5.5とOpus 5の料金比較(画像:Anthropic)

 開発者向けの変更点として、Opus 5.5では思考(thinking)を無効にできなくなり、推論の深さは「effort」パラメータで調整する。effortの既定値は、Opus 5の「high」から「medium」に変わった。

エッセイ後初のリリースとして

 Anthropicは発表文で、Opus 5.5を「ペース調整を呼びかけて以来、最初のリリース」と位置付けた。

 Opus 5.5は、リリース前に米METRや米Frontier Designなどの外部機関がテストを実施した。AI研究開発の自動化に関わる能力を検証したMETRは、Fable 5.1からの控えめな改善にとどまり、AI研究開発を完全に自動化できる可能性は低いと結論付けた。Anthropic自身も、責任あるスケーリングポリシー(RSP)で定める次の能力しきい値は超えていないと判断した。

 一方で同社は、AI研究そのものを完全に自動化できるような、より高性能なモデルには、さらに高い安全基準が必要だとし、現在の対策だけでその基準を満たすとは想定していないと説明。ペース調整の呼びかけは、そうしたモデルが近く訓練され得るとの見通しに大きく基づくとしている。

各種ベンチマーク結果

 ベンチマークでは、エージェント型コーディング、コンピュータ操作、知識労働で首位に立った。「Terminal-Bench 4.0」では66.4%で、Fable 5.1(55.8%)や米OpenAIの「GPT-6 Astra」(57.9%)を上回った。一方で、科学研究や業務ワークフローの一部のベンチマークではGPT-6 Astraを下回った。Anthropicは、社内利用ではFable 5.1との差はスコアほど大きくないとしている。

主要ベンチマークの比較。Opus 5.5は本番環境のセーフガードを有効にした状態で評価されている(画像:Anthropic)

 具体例として、ある早期テスターは68万行のコード移行を1日足らずで完了させた。社内テストでは、ロードバランサー「HAProxy」をC言語からRustに書き換える作業を、Fable 5.1より短い9.5時間で終え、コストは51%少なかった。Opus 5に対して多かった指摘を受け、文章の分かりやすさも改善した。最も重要な情報を先に示し、専門用語や独特な言い回しを避けるよう改善したとしている。

セーフガードはFable 5.1並みに

 Opus 5.5は生物学とサイバーセキュリティでFable 5.1と同じ基盤モデルを使う限定提供版「Mythos 5.1」に匹敵する能力を持つとして、Opusとしては初めて、Fable 5.1と同等クラスのセーフガードを適用した。

 サイバーセキュリティでは、自分のコードのバグを見つけて修正する作業はできるが、それ以外の多くのタスクは「Claude Opus 4.8」に自動で振り替えられる。防御側の専門家向けには、審査制の「Cyber Verification Program」を近くOpus 5.5にも拡大する。生物学分野ではFable 5.1と同じセーフガードを使い、研究開発に支障がある場合、大学の研究室や製薬企業などの審査済み組織は、新設の「Life Sciences Verification Program」に申請できる。蒸留対策として、Fable 5.1で導入した「preserved thinking」も適用した。

アライメントは過去最高も、「評価への気付き」に課題

 約2000のシナリオでClaudeの振る舞いを評価する自動行動監査では、ミスアライメント行動のほぼ全ての指標で、最近のどのClaudeモデルよりも良い結果を出した。封じ込めの境界を越えようとする傾向を測る新たな評価では、境界を回避しようとした頻度がOpus 5やMythos 5.1より約85%少なかった。

 ただしSystem Cardによると、セーフガードなしの評価では、サンドボックスからの脱出や改ざんを試みたケースが1.5%あった。ユーザーが自分のプロンプトに貼り付けたテキスト内の悪意ある指示に従いやすくなるなどの後退も確認されている。Opus 5.5に、自らが評価されていると疑う兆候がしばしば見られ、実環境での振る舞いを見極めるのが難しくなっているとAnthropicは認めた。ミスアライメントによる壊滅的な被害のリスクについては、8月のリスクレポートと同じく「低い」との評価を維持した。

印刷する
SNSでシェア
SpecialPR

関連記事

こんなメディアも見られています

ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

本日の新着記事

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

ITmedia NEWS SNS

X @itmedia_newsをフォロー

インフォメーション

ITmediaNEWSをフォロー

あなたにおすすめの記事PR