こんにちは、AIニュースアプリ Morning AI 開発者の矢野哲平です。この記事では、OpenAIの「GPT-6 Sol」「GPT-6 Luna」と、Anthropicの「Claude Opus 5.5」について触れます。
以前、GPT-6 AstraとClaude Fable 5.1の比較記事 で各社の最上位モデルを取り上げました。今回発表されたのは、その一つ下のクラスのモデルです。
AstraやFableは最上位モデルなので、そのぶんコストも高くなります。普段使いという意味では、今回のモデルのほうが私たちの仕事に直結しやすいと思います。
この記事で解説するポイントは、主に次の3つです。
- GPT-6 Sol・LunaとClaude Opus 5.5を、各社の公式情報をベースに紹介
- 外部の評価サイト Artificial Analysis と Arena のランキングでは、どちらが上なのか
- Anthropicが紹介した、タスクに応じたモデルの選び方
9月22日に何が起きたのか
まずは直近の出来事を整理します。9月22日、OpenAIとAnthropicが同じ日に新しいモデルを発表しました。
| 会社 |
発表されたモデル |
| OpenAI |
GPT-6 Sol、GPT-6 Luna |
| Anthropic |
Claude Opus 5.5 |
後で詳しく触れますが、両社とも価格を下げてきています。性能競争の側面もありつつ、コスト競争の色も強い発表だったと感じました。
GPT-6 SolとLunaとは
まずはOpenAIから見ていきます。
モデル名は天体にちなんでいる
OpenAIは、モデルに天体にちなんだ名前を付けています。小さい順に並べると次のとおりです。
| 名前 |
意味 |
位置づけ |
| Luna |
月 |
いちばん小さいモデル |
| Terra |
地球 |
その次 |
| Sol |
太陽 |
Astraの一つ下 |
| Astra |
星 |
最上位モデル |
GPT-6では、9月の頭にまずAstraが公開され、今回SolとLunaが続いたという流れです。
Astraの強みを、速く安いモデルへ
OpenAIの公式の説明によると、GPT-6 SolとLunaは、GPT-6 Astraの成果を土台にして、その強みの多くをより速く、より安いモデルに持ち込んだものだとされています。
役割分担は次のようなイメージです。
- Sol: 日常の中でも要求の高い仕事向け。コーディングや、複数ステップをこなすエージェントのような使い方
- Luna: 大量処理向け。文書の要約、情報の抽出、分類、質問応答といった、比較的軽量なタスクを大量にさばく用途
一番のニュースは価格
今回いちばん大きなニュースは価格です。Solは以前のモデルに比べて、ちょうど半分の金額になりました。Lunaも、GPT-5.6 のときと比べて半額以下になっています。
精度面では、OpenAIの内部評価で、GPT-6 Solは前世代のGPT-5.6 Solに比べてAIの間違いがおよそ半分に減ったとのことです。Astraレベルの信頼性に、はるかに低いコストで近づいていると説明されています。
ベンチマークの比較相手に注意
OpenAIはベンチマークも公開していて、GPT-6 SolはClaude Opus 5やClaude Fable 5.1を上回ったと紹介しています。
ただし、ここは一つ注意が必要です。比較相手はOpus 5とFable 5.1で、同じ日に発表されたOpus 5.5は含まれていません。
使えるプラン
GPT-6 SolとLunaは、ChatGPTの有料プランと API から利用できます。補足すると、GPT-6 Lunaは無料プランでもChatGPTのデスクトップアプリから利用できます。
Claude Opus 5.5とは
続いて Anthropic 側です。
Anthropicは詩と歌から名前をとる
Anthropicのモデルもおさらいしておきます。小さい順にHaiku(俳句)、Sonnet(ソネット)、Opus(オーパス)、そして最上位のFable(フェイブル)。歌や詩にちなんだ名前が付けられています。
今回はこのOpusが5から5.5にバージョンアップしました。Anthropicによると、Claude 5.5ファミリーの第一弾という位置づけです。
Fable並みの性能を、安く速く
公式の説明から主なポイントを引用すると、次のとおりです。
- ほとんどの仕事で、Claude Fable 5.1と同等の性能を発揮する
- Opus 5と比べて、典型的なワークロードで 40%コストが下がる
- デフォルト設定での出力速度は、Opus 5より 30%以上速い
先行テスターからは、同じタスクをOpus 5の約半分のターン数、半分の時間、半分の出力トークンで完了したという報告も出ています。
つまり、最上位の Fable 並みの性能を、安く、速く使えるようになったという発表です。
ベンチマークでは最上位のFableを上回る
コーディング作業をAIエージェントに処理させるベンチマークでは、Opus 5.5が 66.4%、Fable 5.1が 55.8% という結果でした。ひとつ下のクラスであるOpus 5.5が、最上位モデルのFableより良い結果を出しているという報告です。
話し方も変わった
性能以外の変化として、Opus 5.5は話し方が変わったとされています。専門用語を使いにくくなり、重要な情報をメッセージの冒頭に置くようになりました。冗長さも減ったと説明されています。
使えるプラン
Claude Opus 5.5 は、Claudeの有料プランとAPI経由で利用できます。残念ながら、無料プランでは使えません。
ちなみに、Sonnet 5.5とHaiku 5.5も数週間以内に公開すると予告されています。
外部の評価では、どちらが上なのか
ここまでは各社の公式発表を見てきました。ただ、公式の発表はどうしても自社に有利な数字が並びます。先ほどのOpenAIの発表も、比較相手はOpus 5.5ではなくOpus 5でした。
そこで、外部の評価も見ていきます。今回参照するのは、AIモデルの比較ランキングを公開している次の2つのサイトです。
Artificial Analysis:Opus 5.5が1位
結論から言うと、Artificial AnalysisではClaude Opus 5.5が1位になっています。
興味深いのは、Opus 5.5がOpenAIの最上位モデルであるAstra、そしてAnthropic自身の最上位モデルであるFable 5.1の両方を上回ったことです。ここはかなりインパクトがありました。
一方、GPT-6 SolとLunaについて、Artificial Analysisは「Intelligence Indexのベンチマークでは、GPT-5.6世代と同じ水準にとどまっている」とコメントしています。その代わり価格が半分になったので、コスト効率の面では評価されています。
OpenAIの今回の発表は、「賢さは横ばい、だけど安さで勝負」とも読み取れます。
Arena:こちらもOpus 5.5が1位
Arenaは、人間が2つのAIの回答を見比べて、どちらが良いかを投票する形式のランキングです。
9月25日更新のテキスト部門のランキングでは、1位はClaude Opus 5.5でした。GPT-6 SolとLunaは、Opus 5.5より下位にとどまっています。
ただし、ここにも注意点があります。Opus 5.5、Sol、Lunaは9月25日にランキングへ追加されたばかりで、投票数がまだ少なく、スコアの誤差が大きい状態です。今後、順位が動く可能性は十分にあります。
外部評価のまとめ
| 評価サイト |
結果 |
| Artificial Analysis |
Opus 5.5が1位。Astra、Fable 5.1も上回る。Sol・Lunaは賢さ横ばいでコスト効率が評価 |
| Arena(テキスト部門・9月25日更新) |
Opus 5.5が1位。Sol・Lunaはそれより下位。ただし投票数はまだ少ない |
現時点では、どちらの評価サイトでもClaude Opus 5.5がランキングの上位にいます。
実際に試してみた感想
私も Claude Code と Codex の環境で、それぞれのモデルを試してみました。
端的にまとめると、そこまで大きな違いは感じませんでした。結局はタスク次第、というのが正直な感想です。
| タスク |
結果 |
| レポートの内容に誤りがないかのファクトチェック |
GPT-6 Solのほうが誤りを拾ってくれる回数が多かった |
| 200ほどのファイルから特定の情報を抽出 |
精度は同じ。GPT-6 Solのほうがタスク完了までの時間がやや早かった |
| プロジェクトの概要を読んで改善案を出す |
両者変わらず。どちらも同じ内容を提案 |
| モーショングラフィックスの作成 |
Claude Opus 5.5のほうが好ましい結果 |
あるタスクではGPTのほうが良く、別のタスクではClaudeのほうが良い。「すべてのタスクでChatGPTが上」「すべてのタスクでClaudeが上」とは感じませんでした。
外部の評価ではOpus 5.5が上位にランクインしていますが、実際に自分が使う環境では、すべてのタスクでOpus 5.5が上ということにはならないと思います。
なお、最後のモーショングラフィックスの作成については、AIでモーショングラフィックスを作る方法 で詳しく紹介しています。
モデルを上げる前に「思考の深さ」を上げる
次に、Anthropicが紹介したモデルの使い方のベストプラクティスを見ていきます。Claude Codeの公式ブログ「What a task costs on Opus 5.5」で公開された内容で、かなり実践的でした。
上位モデルに切り替える前にできること
ポイントの一つが、モデルを変える前に、思考の深さを調整するのがおすすめという話です。
たとえば、Claude Codeや Claude Cowork でAIエージェントを使って作業を進めていたとします。アプリ開発中にバグに遭遇し、Opusに修正を依頼したものの、解決できなかった。
こうしたとき、私はこれまで、Opusより上のFableにモデルを切り替えて「バグを解決してください」と頼んでいました。
しかしAnthropicは、上位のモデルに変えるのではなく、その前に思考の深さをより深く設定することを推奨しています。たとえば思考の深さがミディアムだったなら、ハイやエキストラハイに上げてみる、ということです。これは私も実践していなかったので、面白いと感じました。
思考の深さ(effortレベル)の考え方については、Claude Opus 4.7のベストプラクティス でも触れています。
バグ修正以外にも使える考え方
アプリ開発のバグを例にしましたが、この考え方は他のタスクにも使えます。
たとえば、数十〜数百の書類から特定の情報を抽出したい、情報を横断的に検索したい。でも、Sonnetではなかなか達成できなかった。
そんなときも、安易にモデルを上げるのではなく、まず思考の深さを上げて対応してみる。こうした順番で試すのがよさそうです。
Anthropicが勧めるモデルの使い分け
同じブログでは、モデルの使い分けについても言及されていました。
| モデル |
使いどころ |
| Opus |
普段のコーディングやレビュー、デバッグなど、直接監視するメイン作業 |
| Fable |
Opus+high設定でも解決しない高難度の問題や、放置型のタスク |
| Sonnet / Haiku |
検索やログ解析、ファイル特定などのサブエージェント用(コード記述以外) |
メインのコーディングや編集作業は、SonnetやHaikuではなくOpusで進めていく。そのため、コーディング系の作業はOpusをメインに進めるのが良さそうだと感じました。
そして、サブエージェントが担う周辺の細かいタスクは、SonnetやHaikuで拾っていく。こうした役割分担が勧められています。
まとめ
- 9月22日、OpenAIからGPT-6 SolとLuna、AnthropicからClaude Opus 5.5が同じ日に発表されました。SolとLunaは前世代から半分のコストに、Opus 5.5はFable 5.1並みの性能をより安く使えるようになりました。
- 外部の評価では、Artificial AnalysisとArenaの両方でClaude Opus 5.5が1位でした。ただし、私が実際に試した感触では、どちらが上かはタスクによりけりです。
- 特定のモデルで対応できないタスクは、一つ上のモデルに切り替える前に、思考の深さを上げて対応するのが望ましいとAnthropicは説明しています。
AnthropicはSonnet 5.5とHaiku 5.5も数週間以内に公開すると予告しています。GoogleのGemini 4の噂もあり、年末に向けてAI業界はまだまだ盛り上がりそうです。
普段のタスクでも、まずは思考の深さを変えてみるところから、ぜひ試してみてください。