Artificial Analysis

AIの最新動向を毎日お届け。要点だけをシンプルに。

→ 注目トピックはこちら

[お知らせ] iOS版をリリースしました🎉

Artificial Analysis

Artificial Analysis、Intelligence Index v4.3 で Claude Fable 5.1 と GPT-6 Astra が 53 の同点首位。タスク単価は Astra が 57% 下回った

  • 全目的をガードレール違反なく完遂できた業務ワークフローは Astra で 41.6%、Fable 5.1 で 32.1%
Artificial Analysis

OpenBMB の MiniCPM5-2B が Intelligence Index 15、4B 未満のオープンウェイトモデルで最高スコア

  • エージェント性能が強みで、実務タスク評価 GDPval-AA v2 の Elo 831 は 4B 未満モデルで首位
Artificial Analysis

Artificial Analysis、Intelligence Index を v4.2 に更新。非公開テストセットの比重を40%に倍増し Claude Fable 5.1 が首位

  • 新設の長文PDF読解 GDP.pdf では GPT-6 Astra が33.2%で首位、Claude Fable 5.1 は26.2%
Artificial Analysis

Artificial Analysis、GPT-6 Astra は Coding Agent Index で67点、価格2.5倍でタスク単価75%増

  • AA-Omniscience では幻覚率が max effort 時に92%から51%へ半減し、精度も同時に4ポイント向上
Artificial Analysis

Meta の Muse Spark 1.3 (xhigh) が Intelligence Index 61、タスク単価 $0.55 で59以上のモデル中最安

  • トークン単価は据え置きだが、エージェント評価の入力トークンが約57%増え、タスク単価は1.2の$0.40から上昇
Artificial Analysis

Artificial Analysis、Gemini 3.8 Flash の Intelligence Index を 59 と測定、前世代比3ポイント向上

  • トークン単価は据え置きだが出力トークンが30%増え、タスクあたりコストは$0.40から$0.58へ約40%上昇
Artificial Analysis

Artificial Analysis、Claude Fable 5.1 が Intelligence Index 66 で計測史上最高、タスク単価は20%高

  • キャッシュ読み取りは1Mトークン$1から$0.25へ75%引き下げられ、タスクあたり約$1.40の節約
Artificial Analysis

Artificial Analysis、Agnes 2.5 Pro BetaのIntelligence Indexを49と評価。前世代比9ポイントの上昇はエージェント能力が主導

  • AA-Omniscienceの改善は回答を控えた結果で、回答率は94%から45%、正答率は33%から17%へ半減
Artificial Analysis

ポケットサイズのインテリジェンス:小規模モデルとスマートフォンのベンチマーク

  • スマートフォン向け小規模AIモデルの性能を測る新ベンチマーク「Mobile Device Benchmark Set」をArtificial AnalysisとLiquid AIが共同で公開した
  • iPhone 17 Proでの結果では、LFM2.5-2.6BとNanbeige4.2-3Bがともにスコア63で首位だが、LFM2.5-2.6Bは応答8.0秒・2.3GBと、Nanbeige4.2-3Bの21.4秒・4.0GBより大幅に効率が高い
  • コンテキスト上限を16Kに設定しているのは、64K対応モデルでは1回の生成に20分超かかる場合があり、モバイル利用に非現実的なためで、16K・64K・1分制限の3種の結果を公開している
Artificial Analysis

Artificial Analysis Search Indexの発表:同じエージェント、異なる検索

  • Artificial AnalysisがSearch APIプロバイダーを比較評価するリーダーボード「Artificial Analysis Search Index」を公開した
  • 同インデックスはDeepSearchQA・BrowseComp・AA-Omniscienceの3ベンチマークを均等平均したスコアで、ローンチ時点ではParallel Search(advanced)が75点で首位
  • 検索品質が高いプロバイダーはモデルのトークン使用量を削減できるため、検索コスト単体が高くても総コストが下がる場合がある
Artificial Analysis

Optima 発表:あなたのユースケースに合わせたカスタムベンチマークを作成しよう

  • Artificial Analysisが、自分のデータでAIモデルを比較評価できるプラットフォーム「Optima」を公開した
  • 既存のデータセット・エージェントのログのアップロード、コーディング環境からの生成、ユースケースの説明による自動生成の3通りでベンチマークを作成できる
  • モデルの性能スコアだけでなく、タスクあたりのコストと処理時間も並べて比較できる
Artificial Analysis

Gemini 3.7 Flash:知性とタスクあたりの処理時間におけるパレートフロンティアの最前線

  • Googleが「Gemini 3.7 Flash」を公開し、前モデルより知能指数スコアが4ポイント向上した
  • タスクあたりの平均処理時間が1.7分で、GPT-5.6 Terra比40%高速なPareto frontier上に位置する
  • 年末までの割引価格(100万トークンあたり入力$0.75/出力$3.75)で、タスクあたりコストが前モデル比30%減
Artificial Analysis

Upstage Solar Pro 4:ベンチマークと分析

  • Upstage AIが新フラッグシップ推論モデル「Solar Pro 4」をリリースし、Solar Pro 3から置き換え
  • 実世界のエージェント作業(GDPval-AA v2)でEloスコアが498から1277へと大幅に向上し、人間ベースライン(1000)を超えた
  • 幻覚率は88%から24%に改善したが、質問への回答試行率が92%から41%に低下しており、スコア改善の主因は回答の棄権
Artificial Analysis

NVIDIAがNemotron 3.5 Lightningを発表

  • NVIDIAが、31.6B総パラメータ・3.6Bアクティブパラメータの小型モデル「Nemotron 3.5 Lightning」を公開した
  • Intelligence Indexスコア24でgpt-oss-120bと同水準に達しつつ、DeepInfraの事前テストで約670トークン/秒の出力速度を計測
  • エージェント評価GDPval-AA v2でgpt-oss-120bやNemotron 3 Superを上回り、商用利用可能なOpenMDW-1.1ライセンスで提供
Artificial Analysis

Muse Glimmer

  • MetaがLlama 4以来となるオープンウェイトモデル「Muse Glimmer」を公開した
  • 30Bパラメータながら同規模のGemma 4 31Bを5点上回り、Apache 2.0ライセンスで商用利用もほぼ無制限
  • エージェント性能(GDPval-AA v2で953 Elo)や幻覚率(82%)が同クラスのQwen3.6 27Bなどに劣る弱点がある
Artificial Analysis

Artificial Analysis Intelligence Indexのv4.1.1をリリース

  • Artificial Analysis Intelligence Indexがv4.1.1にアップデートされ、採点モデルが刷新された
  • HLE・AA-LCR・AA-OmniscienceはGPT-5.6 Lunaによる採点に統一され、精度と一貫性を向上
  • スコアへの影響は軽微で、ほとんどのモデルは1ポイント未満の変動、首位はClaude Opus 5(63点)を維持
Artificial Analysis

Metaが新モデルMuse Spark 1.2を公開

  • Metaが「Muse Spark 1.2」をリリースし、Artificial Analysisのベンチマークでスコア54を記録した
  • 前バージョンから最も大きく改善したのはエージェント業務能力。スコアが1371から1631へと260ポイント上昇した
  • タスクあたりのコストは$0.40で、同スコア帯のモデルの中ではGrok 4.5とGPT-5.6 Solに次ぐ低コスト。しかし、前バージョンより0.11ドル高くなっている
Artificial Analysis

DeepSeek V4 Flash 0731、Artificial Analysis Intelligence Indexで50点を獲得——前バージョンのDeepSeek V4 Flashより10点上回る

  • DeepSeek V4 Flash 0731がリリースされ、前世代から知能指数が大幅に向上した
  • エージェント性能の評価スコア(GDPval-AA v2)が1189から1559へと大きく上昇し、コーディングや科学問題など全評価項目で改善
  • GPT-5.6 Luna(max)と同等の知能水準ながら、コストは約60%低く、98%のキャッシュヒット割引が主な要因
Artificial Analysis

Inkling Smallは、パラメーター数が3分の1以下でありながら、Artificial Analysis Intelligence IndexでInklingとほぼ同等のスコアを達成

  • Thinking Machines LabがInklingの小型版「Inkling Small」をリリースした
  • 総パラメータ276B・アクティブ12BのMoEモデルで、Artificial Analysis Intelligence Indexスコアは40と、旗艦モデルInkling(41)とほぼ同水準
  • 同規模以下のオープンウェイトモデルでこのスコアを上回るものはなく、エージェントタスクや事実知識では旗艦モデルに劣るものの、コーディングや難問推論では一部上回る
Artificial Analysis

Agnes AIがAgnes 2.5 Pro Alphaをリリース

  • シンガポールのAIラボAgnes AIが推論モデル「Agnes 2.5 Pro Alpha」をリリースし、Artificial Analysis Intelligence Indexで39点を記録
  • 入力$0.45・出力$0.90(100万トークンあたり)と同水準モデルの中で2番目に安く、コーディング性能(58.8)は同価格帯トップクラス
  • 推論トークン数はDeepSeek V4 Flash比51%減、GPT-5.4 mini比72%減と効率が高い