GPT-6 Sol・LunaとClaude Opus 5.5を比較。同じ日に出た新モデルはどちらが上?

矢野 哲平

こんにちは、AIニュースアプリ Morning AI 開発者の矢野哲平です。この記事では、OpenAIの「GPT-6 Sol」「GPT-6 Luna」と、Anthropicの「Claude Opus 5.5」について触れます。

以前、GPT-6 AstraとClaude Fable 5.1の比較記事 で各社の最上位モデルを取り上げました。今回発表されたのは、その一つ下のクラスのモデルです。

AstraやFableは最上位モデルなので、そのぶんコストも高くなります。普段使いという意味では、今回のモデルのほうが私たちの仕事に直結しやすいと思います。

この記事で解説するポイントは、主に次の3つです。

  1. GPT-6 Sol・LunaとClaude Opus 5.5を、各社の公式情報をベースに紹介
  2. 外部の評価サイト Artificial Analysis と Arena のランキングでは、どちらが上なのか
  3. Anthropicが紹介した、タスクに応じたモデルの選び方
Morning AI アプリアイコン

Morning AI

AI専門のニュースアプリ。毎朝、世界のAIトレンドを日本語で。

4.7・App Store — 無料

9月22日に何が起きたのか

まずは直近の出来事を整理します。9月22日、OpenAIとAnthropicが同じ日に新しいモデルを発表しました。

会社 発表されたモデル
OpenAI GPT-6 Sol、GPT-6 Luna
Anthropic Claude Opus 5.5

後で詳しく触れますが、両社とも価格を下げてきています。性能競争の側面もありつつ、コスト競争の色も強い発表だったと感じました。

GPT-6 SolとLunaとは

まずはOpenAIから見ていきます。

モデル名は天体にちなんでいる

OpenAIは、モデルに天体にちなんだ名前を付けています。小さい順に並べると次のとおりです。

名前 意味 位置づけ
Luna 月 いちばん小さいモデル
Terra 地球 その次
Sol 太陽 Astraの一つ下
Astra 星 最上位モデル

GPT-6では、9月の頭にまずAstraが公開され、今回SolとLunaが続いたという流れです。

Astraの強みを、速く安いモデルへ

OpenAIの公式の説明によると、GPT-6 SolとLunaは、GPT-6 Astraの成果を土台にして、その強みの多くをより速く、より安いモデルに持ち込んだものだとされています。

役割分担は次のようなイメージです。

  • Sol: 日常の中でも要求の高い仕事向け。コーディングや、複数ステップをこなすエージェントのような使い方
  • Luna: 大量処理向け。文書の要約、情報の抽出、分類、質問応答といった、比較的軽量なタスクを大量にさばく用途

一番のニュースは価格

今回いちばん大きなニュースは価格です。Solは以前のモデルに比べて、ちょうど半分の金額になりました。Lunaも、GPT-5.6 のときと比べて半額以下になっています。

精度面では、OpenAIの内部評価で、GPT-6 Solは前世代のGPT-5.6 Solに比べてAIの間違いがおよそ半分に減ったとのことです。Astraレベルの信頼性に、はるかに低いコストで近づいていると説明されています。

ベンチマークの比較相手に注意

OpenAIはベンチマークも公開していて、GPT-6 SolはClaude Opus 5やClaude Fable 5.1を上回ったと紹介しています。

ただし、ここは一つ注意が必要です。比較相手はOpus 5とFable 5.1で、同じ日に発表されたOpus 5.5は含まれていません。

使えるプラン

GPT-6 SolとLunaは、ChatGPTの有料プランと API から利用できます。補足すると、GPT-6 Lunaは無料プランでもChatGPTのデスクトップアプリから利用できます。

Claude Opus 5.5とは

続いて Anthropic 側です。

Anthropicは詩と歌から名前をとる

Anthropicのモデルもおさらいしておきます。小さい順にHaiku(俳句)、Sonnet(ソネット)、Opus(オーパス)、そして最上位のFable(フェイブル)。歌や詩にちなんだ名前が付けられています。

今回はこのOpusが5から5.5にバージョンアップしました。Anthropicによると、Claude 5.5ファミリーの第一弾という位置づけです。

Fable並みの性能を、安く速く

公式の説明から主なポイントを引用すると、次のとおりです。

  • ほとんどの仕事で、Claude Fable 5.1と同等の性能を発揮する
  • Opus 5と比べて、典型的なワークロードで 40%コストが下がる
  • デフォルト設定での出力速度は、Opus 5より 30%以上速い

先行テスターからは、同じタスクをOpus 5の約半分のターン数、半分の時間、半分の出力トークンで完了したという報告も出ています。

つまり、最上位の Fable 並みの性能を、安く、速く使えるようになったという発表です。

ベンチマークでは最上位のFableを上回る

コーディング作業をAIエージェントに処理させるベンチマークでは、Opus 5.5が 66.4%、Fable 5.1が 55.8% という結果でした。ひとつ下のクラスであるOpus 5.5が、最上位モデルのFableより良い結果を出しているという報告です。

話し方も変わった

性能以外の変化として、Opus 5.5は話し方が変わったとされています。専門用語を使いにくくなり、重要な情報をメッセージの冒頭に置くようになりました。冗長さも減ったと説明されています。

使えるプラン

Claude Opus 5.5 は、Claudeの有料プランとAPI経由で利用できます。残念ながら、無料プランでは使えません。

ちなみに、Sonnet 5.5とHaiku 5.5も数週間以内に公開すると予告されています。

外部の評価では、どちらが上なのか

ここまでは各社の公式発表を見てきました。ただ、公式の発表はどうしても自社に有利な数字が並びます。先ほどのOpenAIの発表も、比較相手はOpus 5.5ではなくOpus 5でした。

そこで、外部の評価も見ていきます。今回参照するのは、AIモデルの比較ランキングを公開している次の2つのサイトです。

Artificial Analysis:Opus 5.5が1位

結論から言うと、Artificial AnalysisではClaude Opus 5.5が1位になっています。

興味深いのは、Opus 5.5がOpenAIの最上位モデルであるAstra、そしてAnthropic自身の最上位モデルであるFable 5.1の両方を上回ったことです。ここはかなりインパクトがありました。

一方、GPT-6 SolとLunaについて、Artificial Analysisは「Intelligence Indexのベンチマークでは、GPT-5.6世代と同じ水準にとどまっている」とコメントしています。その代わり価格が半分になったので、コスト効率の面では評価されています。

OpenAIの今回の発表は、「賢さは横ばい、だけど安さで勝負」とも読み取れます。

Arena:こちらもOpus 5.5が1位

Arenaは、人間が2つのAIの回答を見比べて、どちらが良いかを投票する形式のランキングです。

9月25日更新のテキスト部門のランキングでは、1位はClaude Opus 5.5でした。GPT-6 SolとLunaは、Opus 5.5より下位にとどまっています。

ただし、ここにも注意点があります。Opus 5.5、Sol、Lunaは9月25日にランキングへ追加されたばかりで、投票数がまだ少なく、スコアの誤差が大きい状態です。今後、順位が動く可能性は十分にあります。

外部評価のまとめ

評価サイト 結果
Artificial Analysis Opus 5.5が1位。Astra、Fable 5.1も上回る。Sol・Lunaは賢さ横ばいでコスト効率が評価
Arena(テキスト部門・9月25日更新) Opus 5.5が1位。Sol・Lunaはそれより下位。ただし投票数はまだ少ない

現時点では、どちらの評価サイトでもClaude Opus 5.5がランキングの上位にいます。

実際に試してみた感想

私も Claude Code と Codex の環境で、それぞれのモデルを試してみました。

端的にまとめると、そこまで大きな違いは感じませんでした。結局はタスク次第、というのが正直な感想です。

タスク 結果
レポートの内容に誤りがないかのファクトチェック GPT-6 Solのほうが誤りを拾ってくれる回数が多かった
200ほどのファイルから特定の情報を抽出 精度は同じ。GPT-6 Solのほうがタスク完了までの時間がやや早かった
プロジェクトの概要を読んで改善案を出す 両者変わらず。どちらも同じ内容を提案
モーショングラフィックスの作成 Claude Opus 5.5のほうが好ましい結果

あるタスクではGPTのほうが良く、別のタスクではClaudeのほうが良い。「すべてのタスクでChatGPTが上」「すべてのタスクでClaudeが上」とは感じませんでした。

外部の評価ではOpus 5.5が上位にランクインしていますが、実際に自分が使う環境では、すべてのタスクでOpus 5.5が上ということにはならないと思います。

なお、最後のモーショングラフィックスの作成については、AIでモーショングラフィックスを作る方法 で詳しく紹介しています。

モデルを上げる前に「思考の深さ」を上げる

次に、Anthropicが紹介したモデルの使い方のベストプラクティスを見ていきます。Claude Codeの公式ブログ「What a task costs on Opus 5.5」で公開された内容で、かなり実践的でした。

上位モデルに切り替える前にできること

ポイントの一つが、モデルを変える前に、思考の深さを調整するのがおすすめという話です。

たとえば、Claude Codeや Claude Cowork でAIエージェントを使って作業を進めていたとします。アプリ開発中にバグに遭遇し、Opusに修正を依頼したものの、解決できなかった。

こうしたとき、私はこれまで、Opusより上のFableにモデルを切り替えて「バグを解決してください」と頼んでいました。

しかしAnthropicは、上位のモデルに変えるのではなく、その前に思考の深さをより深く設定することを推奨しています。たとえば思考の深さがミディアムだったなら、ハイやエキストラハイに上げてみる、ということです。これは私も実践していなかったので、面白いと感じました。

思考の深さ(effortレベル)の考え方については、Claude Opus 4.7のベストプラクティス でも触れています。

バグ修正以外にも使える考え方

アプリ開発のバグを例にしましたが、この考え方は他のタスクにも使えます。

たとえば、数十〜数百の書類から特定の情報を抽出したい、情報を横断的に検索したい。でも、Sonnetではなかなか達成できなかった。

そんなときも、安易にモデルを上げるのではなく、まず思考の深さを上げて対応してみる。こうした順番で試すのがよさそうです。

Anthropicが勧めるモデルの使い分け

同じブログでは、モデルの使い分けについても言及されていました。

モデル 使いどころ
Opus 普段のコーディングやレビュー、デバッグなど、直接監視するメイン作業
Fable Opus+high設定でも解決しない高難度の問題や、放置型のタスク
Sonnet / Haiku 検索やログ解析、ファイル特定などのサブエージェント用(コード記述以外)

メインのコーディングや編集作業は、SonnetやHaikuではなくOpusで進めていく。そのため、コーディング系の作業はOpusをメインに進めるのが良さそうだと感じました。

そして、サブエージェントが担う周辺の細かいタスクは、SonnetやHaikuで拾っていく。こうした役割分担が勧められています。

まとめ

  1. 9月22日、OpenAIからGPT-6 SolとLuna、AnthropicからClaude Opus 5.5が同じ日に発表されました。SolとLunaは前世代から半分のコストに、Opus 5.5はFable 5.1並みの性能をより安く使えるようになりました。
  2. 外部の評価では、Artificial AnalysisとArenaの両方でClaude Opus 5.5が1位でした。ただし、私が実際に試した感触では、どちらが上かはタスクによりけりです。
  3. 特定のモデルで対応できないタスクは、一つ上のモデルに切り替える前に、思考の深さを上げて対応するのが望ましいとAnthropicは説明しています。

AnthropicはSonnet 5.5とHaiku 5.5も数週間以内に公開すると予告しています。GoogleのGemini 4の噂もあり、年末に向けてAI業界はまだまだ盛り上がりそうです。

普段のタスクでも、まずは思考の深さを変えてみるところから、ぜひ試してみてください。


Morning AI アプリアイコン

Morning AI

AI専門のニュースアプリ。毎朝、世界のAIトレンドを日本語で。

4.7・App Store — 無料

→ AIニュースの最新情報を毎日チェック


関連記事