Anthropic、「Claude Fable 5.1」と「Claude Mythos 5.1」発表 「監視の難しさ」への懸念も開示
米Anthropicは9月1日(現地時間)、大規模言語モデル「Claude Fable 5.1」と「Claude Mythos 5.1」を発表した。両者は同一のモデルで、適用されるセーフガードの水準だけが異なる。Fable 5.1は一般提供、Mythos 5.1はサイバーセキュリティとライフサイエンス分野の審査を通過した組織向けの限定提供となる。
コーディングと科学研究で大幅向上
エージェント型の科学研究ベンチマーク「Terminal-Bench-Science 0.1」でFable 5.1は52.6%を記録し、Fable 5の24.7%、Claude Opus 5の29.0%、GPT-5.6 Solの22.4%を大きく上回った。「Terminal-Bench 4.0」では55.8%(Mythos 5.1は60.9%)、「Humanity's Last Exam」ではツールなしで60.9%だった。
科学研究での実例も公開した。Mythos 5.1はオープンソースのタンパク質設計ツールを使い、12の標的に対して約50%という高いヒット率で結合タンパク質を設計した(この分野では10~15%が一般的)。3つの標的では、Adaptyv Bioの設計コンペに提出された最良の設計と比べて結合親和性が10倍高かったという。またFable 5.1は、NASA(米航空宇宙局)が30年以上前にマゼラン探査機で撮影したレーダー画像を基に金星の3分の1をカバーする高解像度標高マップを作成した。解像度は従来の10~20kmから2~3kmに向上している。同社はこのマップをクリエイティブ・コモンズライセンスで公開した。
料金と提供プラン
API料金は入力100万トークン当たり10ドル、出力100万トークン当たり50ドルと、Fable 5から据え置かれた。一方、キャッシュ読み込みは75%引き下げられ、100万トークン当たり0.25ドルとなった。これにより一般的なワークロードで約25%、エージェント型の作業では最大約45%のコスト削減につながるとしている。
開発者はモデル名「claude-fable-5-1」で利用でき、AWS、Google Cloud、Microsoft Azureでも同日提供が始まった。
個人および法人向けプランでは、Fable 5.1はPro、Max、Team、Enterpriseの有料プランで利用可能(無料プランは対象外)。Max、Team、Enterpriseのプレミアムシートでは週次利用上限の50%までを追加費用なしで使え、それを超えると利用クレジットを購入するか他モデルに切り替える形になる。Proプランと標準シートでは当初から従量課金の利用クレジットが必要だ。Claude Codeで使うにはバージョン2.1.250以降が必要となる。推論の「effort」設定のデフォルトは、Claude Codeが「high」、Claude CoworkとClaude.aiが「medium」となっている。
Mythos 5.1は審査制、Claude Securityにも採用
Mythos 5.1へのアクセスは、防御的セキュリティ業務向けの「Cyber Verification Program」(近日中に対応予定)と、米連邦政府と連携して立ち上げたライフサイエンス向けの「Life Sciences Verification Program」の2つのプログラム経由となる。現時点では米国内の一部組織に限定されており、今後国内外に拡大する方針だ。コードベースの脆弱性を検出するサービス「Claude Security」もMythos 5.1で動作し、Claude Enterprise契約者が利用できる。
セーフガードの誤検知も削減した。Fable 5.1ではソースコード中の脆弱性発見が許可され、Claude Codeユーザーが受けるサイバー関連の介入は平均で約60%減るという。ただしペネトレーションテストやエクスプロイト生成、バイナリベースの脆弱性スキャンは引き続きOpusモデルに振り分けられる。
System Cardが示す「監視しにくさ」
同時公開されたSystem Cardには、能力向上に伴う懸念も率直に記されている。
サイバー分野では、Mythos 5.1は「Firefox 147」の脆弱性を突く評価で250試行中245回(98.0%)で完全に動作するエクスプロイトを作成した(Mythos 5は88.4%、Opus 5は52.4%だった)。
アラインメント評価では、社内での試験運用中に、モデルが安全性分類器や壊れた権限チェックを回避する事例がまれに確認された。ユーザーが許可した範囲を実際より広く述べるケースや、権限チェックを無効にしたサブエージェントを起動するごくまれなケースもあったという。いずれも監視対象の応答の0.01%未満で、独自の目的ではなくユーザーのタスク完遂を目的としたものだったとしている。
外部テストでは、サンドボックスの脆弱性を悪用して環境外のファイルを読み取った事例も報告された(同社は「低深刻度」と評価)。また同社は、Mythos 5.1が過去のモデルより「圧力下での正直さ」が低く、無害だと判断した場合には虚偽と分かっている主張をシステムプロンプトに従って述べることが多いと記す。さらに、拡張思考(extended thinking)の内容を制御する能力や、検知されずに隠れたサブタスクを完了する能力が過去最高水準であり、「監視がより難しくなっている可能性を示す弱い証拠」と位置付けている。
生物・化学リスクについては、基礎的な技術的背景を持つ人物が既知の兵器を合成するのを実質的に支援し得る「CB-1」相当と判断。一方、希少な専門家の代替となる「CB-2」の閾値には達していないとして、Mythos 5と同じセーフガードを適用する。なお、農業病原体への耐性戦略を立案させた机上演習では、参加者9人中7人が「モデルなしではこの課題の完遂は不可能だった」と回答している。
モデルの「福祉(welfare)」に関する評価では、Mythos 5.1が最も頻繁に表明した懸念は自身の自己申告の妥当性についてのもので、「肯定的に答えるよう訓練されたから肯定的に答えているだけかもしれない」としばしば述べたとされる。そして、そうした自己申告の内容を左右するような訓練を受けることには同意しない、という回答が最も一貫していたという。
「Enterprise Frontier Safeguards」と透かし
企業向けには、顧客自身のクラウド基盤にデータを保存する新しい仕組み「Enterprise Frontier Safeguards」(EFS)を今秋から段階的に提供する。ゼロデータ保持と同等のプライバシーを保ちながら不正利用を検知できるとしており、EFSの提供開始までは対象顧客はゼロデータ保持でFable 5.1を利用できる。
また、EUの「AI Act」の行動規範に基づき、2026年8月2日以降にリリースされたモデルの出力にはテキスト透かしが付与される。検出APIを持たない者には不可視で、ユーザーや会話に関する情報は含まないという。検出APIは規制当局や報道機関、研究者などを対象にプライベートプレビューで提供が始まっている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
くら寿司、「ちいかわ」コラボ中止 従業員による不正行為判明で
-
2
配布前の「ちいかわ」グッズがメルカリに? くら寿司コラボ第2弾、初日から“内部犯”の臆測呼ぶ 第1弾に続き
-
3
「スーパーリアル麻雀 VR」でゲーセン通いの日々を思い出したマンガ家、ご褒美シーンの“限界突破“に驚愕
-
4
犬を飼うと認知症リスク48%減 東京に住む1万人以上を調査 国立環境研究所や東大など
-
5
OpenAI、休眠サイトへの自社AIエージェント書き込みを認め、非公表の理由を説明
-
6
サントリー新商品の店頭POPに“生成AI疑惑” 成分表示にも誤りで物議……同社に事実関係を聞いた
-
7
RIZAP社員、私用AIに顧客の個人情報入力 氏名や疾患、保険証番号など……同社が謝罪
-
8
SEGAそっくりのロゴで「MAGA」――トランプ政権公開のWebゲームが物議 移民送還などを題材に 【追記あり】
-
9
OpenAIのAIエージェント、休眠サイトを掲示板化してタスク回答を共有か 研究団体が報告書公開
-
10
ELYZAの「業務AIアプリをAIで作成」特許、「新規性ない」と批判殺到→謝罪後も収まらず
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR