Artificial Analysis

AIの最新動向を毎日お届け。要点だけをシンプルに。

→ 注目トピックはこちら

[お知らせ] iOS版をリリースしました🎉

Artificial Analysis

NVIDIAがNemotron 3.5 Lightningを発表

  • NVIDIAが、31.6B総パラメータ・3.6Bアクティブパラメータの小型モデル「Nemotron 3.5 Lightning」を公開した
  • Intelligence Indexスコア24でgpt-oss-120bと同水準に達しつつ、DeepInfraの事前テストで約670トークン/秒の出力速度を計測
  • エージェント評価GDPval-AA v2でgpt-oss-120bやNemotron 3 Superを上回り、商用利用可能なOpenMDW-1.1ライセンスで提供
Artificial Analysis

Muse Glimmer

  • MetaがLlama 4以来となるオープンウェイトモデル「Muse Glimmer」を公開した
  • 30Bパラメータながら同規模のGemma 4 31Bを5点上回り、Apache 2.0ライセンスで商用利用もほぼ無制限
  • エージェント性能(GDPval-AA v2で953 Elo)や幻覚率(82%)が同クラスのQwen3.6 27Bなどに劣る弱点がある
Artificial Analysis

Artificial Analysis Intelligence Indexのv4.1.1をリリース

  • Artificial Analysis Intelligence Indexがv4.1.1にアップデートされ、採点モデルが刷新された
  • HLE・AA-LCR・AA-OmniscienceはGPT-5.6 Lunaによる採点に統一され、精度と一貫性を向上
  • スコアへの影響は軽微で、ほとんどのモデルは1ポイント未満の変動、首位はClaude Opus 5(63点)を維持
Artificial Analysis

Metaが新モデルMuse Spark 1.2を公開

  • Metaが「Muse Spark 1.2」をリリースし、Artificial Analysisのベンチマークでスコア54を記録した
  • 前バージョンから最も大きく改善したのはエージェント業務能力。スコアが1371から1631へと260ポイント上昇した
  • タスクあたりのコストは$0.40で、同スコア帯のモデルの中ではGrok 4.5とGPT-5.6 Solに次ぐ低コスト。しかし、前バージョンより0.11ドル高くなっている
Artificial Analysis

DeepSeek V4 Flash 0731、Artificial Analysis Intelligence Indexで50点を獲得——前バージョンのDeepSeek V4 Flashより10点上回る

  • DeepSeek V4 Flash 0731がリリースされ、前世代から知能指数が大幅に向上した
  • エージェント性能の評価スコア(GDPval-AA v2)が1189から1559へと大きく上昇し、コーディングや科学問題など全評価項目で改善
  • GPT-5.6 Luna(max)と同等の知能水準ながら、コストは約60%低く、98%のキャッシュヒット割引が主な要因
Artificial Analysis

Inkling Smallは、パラメーター数が3分の1以下でありながら、Artificial Analysis Intelligence IndexでInklingとほぼ同等のスコアを達成

  • Thinking Machines LabがInklingの小型版「Inkling Small」をリリースした
  • 総パラメータ276B・アクティブ12BのMoEモデルで、Artificial Analysis Intelligence Indexスコアは40と、旗艦モデルInkling(41)とほぼ同水準
  • 同規模以下のオープンウェイトモデルでこのスコアを上回るものはなく、エージェントタスクや事実知識では旗艦モデルに劣るものの、コーディングや難問推論では一部上回る
Artificial Analysis

Agnes AIがAgnes 2.5 Pro Alphaをリリース

  • シンガポールのAIラボAgnes AIが推論モデル「Agnes 2.5 Pro Alpha」をリリースし、Artificial Analysis Intelligence Indexで39点を記録
  • 入力$0.45・出力$0.90(100万トークンあたり)と同水準モデルの中で2番目に安く、コーディング性能(58.8)は同価格帯トップクラス
  • 推論トークン数はDeepSeek V4 Flash比51%減、GPT-5.4 mini比72%減と効率が高い
Artificial Analysis

Claude Opus 5:エージェント型ナレッジワークの新たなリーダー

  • Claude Opus 5がリリースされ、自社ベンチマーク「AA-Briefcase」でトップのEloスコア1720を記録した
  • max設定でのタスク単価は$17.79でFable 5より20%安く、high設定ではFable 5を上回る性能を半額以下の$10.41で実現
  • 分析品質では約300 Elo差でFable 5を大幅に上回る一方、プレゼン品質ではGPT-5.6 Sol (max)に約40 Elo届かない
Artificial Analysis

Opus 5:低コストでFable 5レベルの知性を実現

  • Claude Opus 5がリリースされ、Artificial Analysis Intelligence Indexでスコア61を記録しトップに立った
  • エージェント型知識作業ベンチマーク(GDPval-AA v2・AA-Briefcase)でFable 5を100点以上上回り、コーディングでも最高水準
  • タスクあたりのコストはFable 5より低い一方、事実知識の正確さはFable 5に及ばず、幻覚率が50%と14ポイント上昇
Artificial Analysis

Thinking Machines LabのInklingがエージェント型ナレッジワークでどのような性能を発揮するか

  • Thinking Machines LabのInklingがエージェント型知識作業ベンチマーク「AA-Briefcase」でEloスコア836を記録
  • ルブリックスコアは19.3%で、MiMo-V2.5-Pro(21.4%)を下回るが、DeepSeek V4 Flash(18.7%)は上回る
  • プレゼンテーション品質(Elo 863)は分析品質(Elo 764)より高く、非標準ファイル形式のタスクでスコアが最も低い
Artificial Analysis

Kimi K3:AA-BriefcaseでFable 5に次ぐ第2位

  • Moonshot AIがKimi K3をリリースし、独自ベンチマークAA-BriefcaseでElo 1543を記録、Claude Fable 5に次ぐ2位
  • 分析品質はFable 5と同水準だが、プレゼンテーション品質は他モデルより低く、1タスクあたり平均56.4分かかる
  • タスク単価は平均$10.57と高コストで、Fable 5の約2.5倍の時間と83ターン/タスクを要する
Artificial Analysis

Gemini 3.6 FlashとGemini 3.5 Flash-Lite:タスクあたりの時間を半減

  • GeminiシリーズのFlash最新2モデル(Gemini 3.6 FlashとGemini 3.5 Flash-Lite)がリリースされた
  • 両モデルとも前世代比でタスク処理時間を約50%短縮。Gemini 3.5 Flash-LiteはIntelligence Indexスコアが11ポイント上昇した一方、Gemini 3.6 Flashの知性スコアは前世代と同等
  • Gemini 3.6 Flashはコスト微減、Gemini 3.5 Flash-Liteはトークン消費量が減ったにもかかわらず新価格設定によりタスク単価が約2倍に増加
Artificial Analysis

8日間で4つのフロンティアモデルがリリース:Artificial Analysis Intelligence Indexで50点超えのモデルを持つラボが6社に

  • 8日間で4つの主要モデルが公開され、Intelligence Indexで50超のモデルを持つ研究所が2社から6社に増えた
  • Kimi K3はスコア57で総合3位に入り、長期的な知識作業ベンチマークではGPT-5.6 Solを上回る2位を記録
  • トップ水準の性能がタスクあたり約3分の1のコストで得られるなど、8日間でコストが大幅に下落した
Artificial Analysis

Thinking MachinesがInklingをリリース、米国における新たなトップのオープンウェイトモデルに

  • Thinking MachinesがオープンウェイトAIモデル「Inkling」を公開し、知性指数で41点を記録した
  • 米国のオープンウェイトモデルとして最高水準に達し、競合モデルより少ないトークンで同等以上の性能を示した
  • テキスト・画像・音声を同時に扱える点や自律タスクへの強さは、オープンウェイトモデルの中で差別化要因となっている
Artificial Analysis

GPT-5.6のSol、Terra、Lunaを知性とコストの観点で比較する

  • GPT-5.6の3モデル(Sol・Terra・Luna)は、いずれもGPT-5.5を知能・コスト効率の面で上回る
  • TerraはSolとLunaに比べ、同じコストで知能が劣るか、同じ知能でコストが高くなる
  • GPT-5.6シリーズ内でもモデル間に明確な優劣があり、選択次第でコスト効率が大きく変わる
Artificial Analysis

Muse Spark 1.1:Metaが3ヶ月でインテリジェンス指数を8ポイント向上

  • Muse Spark 1.1が知能指数51を記録し、前バージョンから8ポイント上昇した
  • 同スコア帯のモデルの中で最もトークン効率が高く、1タスクあたり約$0.26で動かせる
  • 性能向上の一部は精度改善ではなく、誤答を減らす「回答の差し控え」によって達成されている
Artificial Analysis

GPT-5.6のベンチマーク:知性、速度、コストの比較

  • GPT-5.6シリーズ(Sol・Terra・Luna)が公開され、コーディングや文書作成など複数の評価で高い成績を記録した
  • Claude Fable 5とほぼ同等の性能をSolは約3分の1のコストで提供でき、用途に応じてモデルを使い分けられる
  • OpenAIとして初めてキャッシュ書き込み料金が導入され、価格体系がより実際の処理コストを反映する仕組みに近づいている
Artificial Analysis

EnterpriseOps-Gym-AA のご紹介

  • 企業向け業務をAIが実行できるか評価するランキング「EnterpriseOps-Gym-AA」が公開された
  • 最高スコアのClaude Fable 5でも51%にとどまり、現状のAIは複雑な業務の半分程度しか完遂できない
  • タスク単価が約90倍の差があるにもかかわらずコストと性能が比例しておらず、費用対効果の見極めが重要になる
Artificial Analysis

Grok 4.5がSpaceXAIを知能の最前線へと導く

  • Grok 4.5がリリースされ、知能指標でGrok 4.3より16ポイント向上した
  • OpenAIとAnthropicに次ぐ性能を持ちながら、同等モデルの5分の1以下のコストで動作する
  • 精度は上がった一方で幻覚率も上昇しており、高性能化に伴うトレードオフが残る