Artificial Analysis

AIの最新動向を毎日お届け。要点だけをシンプルに。

→ 注目トピックはこちら

[お知らせ] iOS版をリリースしました🎉

Artificial Analysis

Muse Spark 1.1:Metaが3ヶ月でインテリジェンス指数を8ポイント向上

  • Muse Spark 1.1が知能指数51を記録し、前バージョンから8ポイント上昇した
  • 同スコア帯のモデルの中で最もトークン効率が高く、1タスクあたり約$0.26で動かせる
  • 性能向上の一部は精度改善ではなく、誤答を減らす「回答の差し控え」によって達成されている
Artificial Analysis

GPT-5.6のベンチマーク:知性、速度、コストの比較

  • GPT-5.6シリーズ(Sol・Terra・Luna)が公開され、コーディングや文書作成など複数の評価で高い成績を記録した
  • Claude Fable 5とほぼ同等の性能をSolは約3分の1のコストで提供でき、用途に応じてモデルを使い分けられる
  • OpenAIとして初めてキャッシュ書き込み料金が導入され、価格体系がより実際の処理コストを反映する仕組みに近づいている
Artificial Analysis

EnterpriseOps-Gym-AA のご紹介

  • 企業向け業務をAIが実行できるか評価するランキング「EnterpriseOps-Gym-AA」が公開された
  • 最高スコアのClaude Fable 5でも51%にとどまり、現状のAIは複雑な業務の半分程度しか完遂できない
  • タスク単価が約90倍の差があるにもかかわらずコストと性能が比例しておらず、費用対効果の見極めが重要になる
Artificial Analysis

Grok 4.5がSpaceXAIを知能の最前線へと導く

  • Grok 4.5がリリースされ、知能指標でGrok 4.3より16ポイント向上した
  • OpenAIとAnthropicに次ぐ性能を持ちながら、同等モデルの5分の1以下のコストで動作する
  • 精度は上がった一方で幻覚率も上昇しており、高性能化に伴うトレードオフが残る
Artificial Analysis

Harvey LAB-AAの発表:実際の法律業務におけるAIエージェントの評価

  • 契約書と内部メモをもとに、支配権変更・譲渡条項の分析レポート作成が指示された
  • これはM&A取引チーム向けに、買収時のリスク条項を整理・報告する業務依頼である
  • 実際の契約内容が記事として提供されていないため、具体的な条項の詳細は不明である
Artificial Analysis

AutomationBench-AAのリリースを発表

  • AIエージェントが実際のSaaSワークフロー657タスクをこなせるか測る「AutomationBench-AA」が公開された
  • AnthropicのClaude Fable 5が48.6%で首位だが、全モデルでビジネスルール違反が発生し完全自動化には課題が残る
  • コストと精度のバランスではGemini 3.5 Flashが同等性能のGPT-5.5の約37%のコストで動作し、費用対効果の差が大きい
Artificial Analysis

AA-Briefcaseにおけるタスクごとの時間計測

  • 長期的な知識業務を測定する独自指標AA-Briefcaseで、各モデルの1タスクあたりの処理時間が比較された
  • 精度と速度のバランスでは、GPT-5.5(xhigh)がOpus 4.8の約半分の11分でトップ5入りし効率面で際立つ
  • 処理時間の大半は出力の長さや推論速度が占め、ツール実行の比重は約12%にとどまる
Artificial Analysis

Artificial Analysis スピーチ・トゥ・スピーチ インデックスの発表

  • 音声会話AIモデルを総合評価する新指標「Speech to Speech Index」が公開された
  • 総合首位はGPT-Realtime-2(High)の77.2%で、速度・コスト・性能のバランスにモデル間で明確な差がある
  • 特に自律タスク処理の難易度が高く、全モデルが53%未満にとどまっており、この領域が今後の課題となっている
Artificial Analysis

AA-Briefcaseの発表:フロンティアナレッジワーク評価

  • AA-Briefcaseは、データサイエンスや戦略など4分野・91タスクで構成された実務型AIエージェント評価指標で、Claude Fable 5が総合首位となった。
  • 最高性能モデルでも全条件を満たすタスクはわずか3%で、現状のAIは複雑な実務知識作業に対し依然限界がある。
  • タスク1件あたりのコストは最大800倍以上の差があり、性能とコストのバランスが実用選択の重要な判断軸となっている。
Artificial Analysis

GLM-5.2が、Artificial Analysis Intelligence Indexにおける最新のトップオープンウェイトモデルに

  • Z aiのGLM-5.2が、オープンウェイトモデルの中で知性指標スコア51の首位となった
  • 前世代のGLM-5.1より11点高く、科学的推論や実務エージェント性能で大幅に向上している
  • コストは1タスクあたり約0.46ドルと競合より高めだが、同水準の知性を持つモデルの中では最安となっている
Artificial Analysis

Artificial Analysis インテリジェンス インデックス v4.1:エージェント型ワークロードへのシフト

  • AIモデルの総合評価指標「Intelligence Index」がv4.1に更新され、自律的なタスクを重視した内容に刷新された
  • 現時点で利用可能な最高性能モデルはClaude Opus 4.8(スコア56)で、GPT-5.5(スコア55)がそれに続く
  • DeepSeek V4 Pro(スコア44)は1タスクあたり0.04ドルと、上位の有料モデルに比べ20〜45倍安く、コスト面で際立った存在となっている