スライドのテキスト
1ページ目
A N T H R O P I C / 2 0 2 6 . 0 7 . 2 4
Claude Opus 5
フロンティア級の知能を、半分の価格で。長時間タスクを任
せられる「毎日使うモデル」
出典: Introducing Claude Opus 5 (anthropic.com/news/claude-opus-5)
2ページ目
S U M M A R Y
3行でわかる Opus 5
01
02
03
Fable 5 に迫る知能を半額で
検証しながら粘る エージェン
ト
これまでで最もアラインした
モデル
コーディングと知識労働のベンチマーク
で最高水準。価格は Opus 4.8 と同じ。
自分の成果物を確かめ、行き詰まれば手
自動行動監査でミスアラインメント指標
段を自作して最後までやり切る。
が最小。安全性は据え置きの範囲。
3ページ目
P O S I T I O N I N G
ラインナップ内での位置づけ
Claude Max
新しいデフォルトモデル
日常使いを前提に設計
Claude Pro
利用できる最上位モデル
他のモデルより効率よく動く
エフォート設定で「知能を最大化する」か
Fable 5
知能はわずかに上、コストは約2倍
「トークンを節約して速く安く済ませる」か
を選べる。
Mythos 5
サイバーセキュリティ領域では依然として上
位
4ページ目
CO D I N G
ソフトウェアエンジニアリング性能
Frontier-Bench v0.1
2倍超
CursorBench 3.2
0.5%差
Opus 4.8 のスコアを2倍以上に。しかもタスクあ
max effort で Fable 5 のピークスコアとの差は
たりのコストは低下し、全モデル中トップ。
0.5%以内。タスクあたりコストは半分。
high / xhigh / max のいずれのエフォート設定でも、同一コストあたりの性能は全モデル中で最も高い。
5ページ目
K N O W L E D G E W O R K
知識労働と問題解決
ARC-AGI 3
3×
Zapier AutomationBench
1.5×
OSWorld 2.0
1/3
未知の問題を解く評価で、次点モデル
同コストで次点の約1.5倍の合格率。最
Fable 5 の最高結果を、約3分の1のコス
低エフォートでも他モデルを上回る。
トで超えるコンピュータ操作性能。
の3倍のスコア。
6ページ目
S C I E N C E & V I S U A L S
科学研究とビジュアル出力
VISUAL OUTPUT
ライフサイエンスの全評価項目で Opus 4.8 を上回る
+10.2pt
有機化学 — 分光データからの分子構造推定(社内
はるかに強力なビジュアル生成
ベンチマーク)
風洞シミュレーションによる空気の流れの可視
化、細胞のインタラクティブな図解などをモデ
ル自身が構築。
+7.7pt
タンパク質 — 配列変異が機能に与える影響の予測
デモ: assets.claude.ai の Wind tunnel / Cell
artifact
7ページ目
A G E N C Y
行き詰まったときの振る舞い
道具を自作する
根本原因まで辿る
検証環境ごと用意する
図面を「見る」手段を与えられ
著名なパッケージマネージャの
取引所の市場データフィードを1
実バグで、コミュニティのパッ
セッションで実装。検証用のラ
ないまま3D CAD 復元を課され、
生ピクセルから幾何を抽出する
チが取りこぼしたエッジケース
イブフィードが無いと分かる
画像処理パイプラインを自作し
まで修正。競合モデルは表層の
と、テストハーネスを自ら構築
症状だけ直して「解決」と報
してパースの正しさを確認。
て完遂。他モデルは5回試行して
も解けず。
告。
8ページ目
E A R LY A CC E S S
早期利用企業の評価
難しいデバッグと根本原因の分析で
最難関のエージェント的コーディン
際立つのは判断力。書き始める前に
深く考え、計画段階で自らの論理の
特に強い。FrontierCode 1.1 では半
グで Opus 4.7 比 +22%。それ以上
に、実行ごとのブレが小さく安定し
穴に気づく。
分のコストで Fable 級の性能に迫
る。
ている。
Denis Shiryaev — JetBrains, Head of AI in
IDE
Scott Wu — Cognition, CEO
Fabian Hedin — Lovable, Co-Founder
9ページ目
U S E C A S E S
業務領域ごとに報告された改善
+17%
デューデリジェンス業務。データ分析は +11%、全体では Opus 4.8 比 +8%(Box)
エンタープライズ文
書
リーガル
−26%
同等の品質を、max reasoning 時のトークン量26%減で達成
金融モデリング
+9pt
精度が平均9ポイント向上し、ツール呼び出しは3分の1減、所要時間は60%減
業務自動化
100%
解約防止フローを一気通貫で実行し全タスク通過。従来モデルは不合格(Zapier)
10ページ目
A L I G N M E N T & S A F E T Y
アラインメントと安全性
憲法(Claude's Constitution)への遵守
Opus 4.8 / Sonnet 5 / Fable 5 を上回る
欺瞞的な振る舞い・誘導のされにくさ
発生率は最低水準。取り返しのつかない副作用を伴う行動も最少
自動行動監査 / ミスアラインメント総合
スコア
2.3
直近モデル中で最小。値が小さいほど良
危険な二重用途能力は前進させていない
い。
生物学・攻撃的サイバーとも Mythos 5 の後方。脆弱性の「発見」は接
近、「悪用」は大きく劣後
11ページ目
S A F E G U A R D S
セーフガードの実務上の影響
バイオロジー
科学研究向けの最有力モデルに
サイバーセキュリティ
−85%
安全策は Opus 4.8 相当のまま。Fable 5 でブロックさ
Fable 5 と比べて分類器の介入頻度が約85%少ない想
れる生物学関連リクエストは Opus 5 にルーティング
定。ソースコードの脆弱性調査は許可し、バイナリ走
される。長時間の自律的研究タスクには依然として制
査・ペネトレーションテスト・エクスプロイト生成は
約あり。
ブロック。
フラグされたリクエストは Claude.ai / Claude Code / Claude Cowork で既定により Opus 4.8 へフォールバック。API でも有効
化可能。Cyber Verification Program 参加組織は制限の緩い版を利用できる。
12ページ目
G E T T I N G S TA R T E D
提供形態と価格
価格は Opus 4.8 と同額。全プラットフ
ォームで本日提供開始、API のモデル ID
は claude-opus-5。
Fast モードは約2.5倍の速度で、基本価
入力トークン
$5
出力トークン
$25
格の2倍。一般提供でのデータ保持要件
100万トークンあたり
100万トークンあたり
はなし。
会話途中のツール変更(ベータ)
自動フォールバック(ベータ)
プロンプトキャッシュを無効化せずに、利用可能ツールを切
分類器にフラグされたリクエストを別モデルへ自動ルーティ
り替えられる
ングし、ブロックを回避
13ページ目
TA K E A W A Y S
まとめと次の一手
まず差し替える
長時間タスクで試す
エフォートを調整する
検証と反復が必要な作業ほど差が出
低エフォートでも従来比で高い水準。
Opus 4.8 を使っている箇所は価格据え
置きのまま置き換えられる。
る。細切れにせず、まとめて任せる。
コストと精度のバランス点を測る。
詳細: プロンプティングガイド / System Card(anthropic.com)
スライドから自動抽出したテキストです。画像内の文字などが一部含まれない場合があります。