Claude Opus 5紹介

ゴック・フイ
カテゴリー: テクノロジー
関連トピック:
スライド一覧 テクノロジー Claude Opus 5紹介

スライドのテキスト

1ページ目

A N T H R O P I C / 2 0 2 6 . 0 7 . 2 4

Claude Opus 5

フロンティア級の知能を、半分の価格で。長時間タスクを任

せられる「毎日使うモデル」

出典: Introducing Claude Opus 5 (anthropic.com/news/claude-opus-5)

2ページ目

S U M M A R Y

3行でわかる Opus 5

01

02

03

Fable 5 に迫る知能を半額で

検証しながら粘る エージェン

これまでで最もアラインした
モデル

コーディングと知識労働のベンチマーク

で最高水準。価格は Opus 4.8 と同じ。

自分の成果物を確かめ、行き詰まれば手

自動行動監査でミスアラインメント指標

段を自作して最後までやり切る。

が最小。安全性は据え置きの範囲。

3ページ目

P O S I T I O N I N G

ラインナップ内での位置づけ

Claude Max
新しいデフォルトモデル

日常使いを前提に設計

Claude Pro
利用できる最上位モデル

他のモデルより効率よく動く

エフォート設定で「知能を最大化する」か

Fable 5
知能はわずかに上、コストは約2倍

「トークンを節約して速く安く済ませる」か

を選べる。

Mythos 5
サイバーセキュリティ領域では依然として上

4ページ目

CO D I N G

ソフトウェアエンジニアリング性能

Frontier-Bench v0.1
2倍超

CursorBench 3.2
0.5%差

Opus 4.8 のスコアを2倍以上に。しかもタスクあ

max effort で Fable 5 のピークスコアとの差は

たりのコストは低下し、全モデル中トップ。

0.5%以内。タスクあたりコストは半分。

high / xhigh / max のいずれのエフォート設定でも、同一コストあたりの性能は全モデル中で最も高い。

5ページ目

K N O W L E D G E W O R K

知識労働と問題解決

ARC-AGI 3

Zapier AutomationBench
1.5×

OSWorld 2.0
1/3

未知の問題を解く評価で、次点モデル

同コストで次点の約1.5倍の合格率。最

Fable 5 の最高結果を、約3分の1のコス

低エフォートでも他モデルを上回る。

トで超えるコンピュータ操作性能。

の3倍のスコア。

6ページ目

S C I E N C E & V I S U A L S

科学研究とビジュアル出力

VISUAL OUTPUT

ライフサイエンスの全評価項目で Opus 4.8 を上回る
+10.2pt
有機化学 — 分光データからの分子構造推定(社内

はるかに強力なビジュアル生成

ベンチマーク)

風洞シミュレーションによる空気の流れの可視

化、細胞のインタラクティブな図解などをモデ

ル自身が構築。

+7.7pt
タンパク質 — 配列変異が機能に与える影響の予測

デモ: assets.claude.ai の Wind tunnel / Cell

artifact

7ページ目

A G E N C Y

行き詰まったときの振る舞い

道具を自作する

根本原因まで辿る

検証環境ごと用意する

図面を「見る」手段を与えられ

著名なパッケージマネージャの

取引所の市場データフィードを1

実バグで、コミュニティのパッ

セッションで実装。検証用のラ

ないまま3D CAD 復元を課され、

生ピクセルから幾何を抽出する

チが取りこぼしたエッジケース

イブフィードが無いと分かる

画像処理パイプラインを自作し

まで修正。競合モデルは表層の

と、テストハーネスを自ら構築

症状だけ直して「解決」と報

してパースの正しさを確認。

て完遂。他モデルは5回試行して

も解けず。

告。

8ページ目

E A R LY A CC E S S

早期利用企業の評価

難しいデバッグと根本原因の分析で

最難関のエージェント的コーディン

際立つのは判断力。書き始める前に

深く考え、計画段階で自らの論理の

特に強い。FrontierCode 1.1 では半

グで Opus 4.7 比 +22%。それ以上

に、実行ごとのブレが小さく安定し

穴に気づく。

分のコストで Fable 級の性能に迫

る。

ている。

Denis Shiryaev — JetBrains, Head of AI in
IDE

Scott Wu — Cognition, CEO

Fabian Hedin — Lovable, Co-Founder

9ページ目

U S E C A S E S

業務領域ごとに報告された改善

+17%
デューデリジェンス業務。データ分析は +11%、全体では Opus 4.8 比 +8%(Box)

エンタープライズ文

リーガル
−26%
同等の品質を、max reasoning 時のトークン量26%減で達成

金融モデリング
+9pt
精度が平均9ポイント向上し、ツール呼び出しは3分の1減、所要時間は60%減

業務自動化
100%
解約防止フローを一気通貫で実行し全タスク通過。従来モデルは不合格(Zapier)

10ページ目

A L I G N M E N T & S A F E T Y

アラインメントと安全性

憲法(Claude's Constitution)への遵守

Opus 4.8 / Sonnet 5 / Fable 5 を上回る

欺瞞的な振る舞い・誘導のされにくさ

発生率は最低水準。取り返しのつかない副作用を伴う行動も最少

自動行動監査 / ミスアラインメント総合
スコア
2.3

直近モデル中で最小。値が小さいほど良

危険な二重用途能力は前進させていない

い。

生物学・攻撃的サイバーとも Mythos 5 の後方。脆弱性の「発見」は接

近、「悪用」は大きく劣後

スライドから自動抽出したテキストです。画像内の文字などが一部含まれない場合があります。