スライドのテキスト
1ページ目
A N T H R O P I C / 2 0 2 6 . 0 7 . 2 4
Claude Opus 5
フロンティア級の知能を、半分の価格で。長時間タスクを任
せられる「毎日使うモデル」
出典: Introducing Claude Opus 5 (anthropic.com/news/claude-opus-5)
2ページ目
S U M M A R Y
3行でわかる Opus 5
01
02
03
Fable 5 に迫る知能を半額で
検証しながら粘る エージェン
ト
これまでで最もアラインした
モデル
コーディングと知識労働のベンチマーク
で最高水準。価格は Opus 4.8 と同じ。
自分の成果物を確かめ、行き詰まれば手
自動行動監査でミスアラインメント指標
段を自作して最後までやり切る。
が最小。安全性は据え置きの範囲。
3ページ目
P O S I T I O N I N G
ラインナップ内での位置づけ
Claude Max
新しいデフォルトモデル
日常使いを前提に設計
Claude Pro
利用できる最上位モデル
他のモデルより効率よく動く
エフォート設定で「知能を最大化する」か
Fable 5
知能はわずかに上、コストは約2倍
「トークンを節約して速く安く済ませる」か
を選べる。
Mythos 5
サイバーセキュリティ領域では依然として上
位
4ページ目
CO D I N G
ソフトウェアエンジニアリング性能
Frontier-Bench v0.1
2倍超
CursorBench 3.2
0.5%差
Opus 4.8 のスコアを2倍以上に。しかもタスクあ
max effort で Fable 5 のピークスコアとの差は
たりのコストは低下し、全モデル中トップ。
0.5%以内。タスクあたりコストは半分。
high / xhigh / max のいずれのエフォート設定でも、同一コストあたりの性能は全モデル中で最も高い。
5ページ目
K N O W L E D G E W O R K
知識労働と問題解決
ARC-AGI 3
3×
Zapier AutomationBench
1.5×
OSWorld 2.0
1/3
未知の問題を解く評価で、次点モデル
同コストで次点の約1.5倍の合格率。最
Fable 5 の最高結果を、約3分の1のコス
低エフォートでも他モデルを上回る。
トで超えるコンピュータ操作性能。
の3倍のスコア。
6ページ目
S C I E N C E & V I S U A L S
科学研究とビジュアル出力
VISUAL OUTPUT
ライフサイエンスの全評価項目で Opus 4.8 を上回る
+10.2pt
有機化学 — 分光データからの分子構造推定(社内
はるかに強力なビジュアル生成
ベンチマーク)
風洞シミュレーションによる空気の流れの可視
化、細胞のインタラクティブな図解などをモデ
ル自身が構築。
+7.7pt
タンパク質 — 配列変異が機能に与える影響の予測
デモ: assets.claude.ai の Wind tunnel / Cell
artifact
7ページ目
A G E N C Y
行き詰まったときの振る舞い
道具を自作する
根本原因まで辿る
検証環境ごと用意する
図面を「見る」手段を与えられ
著名なパッケージマネージャの
取引所の市場データフィードを1
実バグで、コミュニティのパッ
セッションで実装。検証用のラ
ないまま3D CAD 復元を課され、
生ピクセルから幾何を抽出する
チが取りこぼしたエッジケース
イブフィードが無いと分かる
画像処理パイプラインを自作し
まで修正。競合モデルは表層の
と、テストハーネスを自ら構築
症状だけ直して「解決」と報
してパースの正しさを確認。
て完遂。他モデルは5回試行して
も解けず。
告。
8ページ目
E A R LY A CC E S S
早期利用企業の評価
難しいデバッグと根本原因の分析で
最難関のエージェント的コーディン
際立つのは判断力。書き始める前に
深く考え、計画段階で自らの論理の
特に強い。FrontierCode 1.1 では半
グで Opus 4.7 比 +22%。それ以上
に、実行ごとのブレが小さく安定し
穴に気づく。
分のコストで Fable 級の性能に迫
る。
ている。
Denis Shiryaev — JetBrains, Head of AI in
IDE
Scott Wu — Cognition, CEO
Fabian Hedin — Lovable, Co-Founder
9ページ目
U S E C A S E S
業務領域ごとに報告された改善
+17%
デューデリジェンス業務。データ分析は +11%、全体では Opus 4.8 比 +8%(Box)
エンタープライズ文
書
リーガル
−26%
同等の品質を、max reasoning 時のトークン量26%減で達成
金融モデリング
+9pt
精度が平均9ポイント向上し、ツール呼び出しは3分の1減、所要時間は60%減
業務自動化
100%
解約防止フローを一気通貫で実行し全タスク通過。従来モデルは不合格(Zapier)
10ページ目
A L I G N M E N T & S A F E T Y
アラインメントと安全性
憲法(Claude's Constitution)への遵守
Opus 4.8 / Sonnet 5 / Fable 5 を上回る
欺瞞的な振る舞い・誘導のされにくさ
発生率は最低水準。取り返しのつかない副作用を伴う行動も最少
自動行動監査 / ミスアラインメント総合
スコア
2.3
直近モデル中で最小。値が小さいほど良
危険な二重用途能力は前進させていない
い。
生物学・攻撃的サイバーとも Mythos 5 の後方。脆弱性の「発見」は接
近、「悪用」は大きく劣後
スライドから自動抽出したテキストです。画像内の文字などが一部含まれない場合があります。