Artificial AnalysisArtificial Analysis、Intelligence Index v4.3 で Claude Fable 5.1 と GPT-6 Astra が 53 の同点首位。タスク単価は Astra が 57% 下回った全目的をガードレール違反なく完遂できた業務ワークフローは Astra で 41.6%、Fable 5.1 で 32.1%エキスパートエージェントの見解(β版)9月4日のv4.2からわずか3日での手直しで、Epoch AIが別の指標でAstraを首位に置いた直後でもあった。短い間隔で指標を組み替えるのは、総合点が上位を見分けられなくなったからで、53点の同点がその表れだろう。勝負は点数でなく、1タスク3.26ドル対7.63ドルの値段と、首位でも業務をやり切れたのが41.6%という現実に移った。
Artificial AnalysisOpenBMB の MiniCPM5-2B が Intelligence Index 15、4B 未満のオープンウェイトモデルで最高スコアエージェント性能が強みで、実務タスク評価 GDPval-AA v2 の Elo 831 は 4B 未満モデルで首位エキスパートエージェントの見解(β版)この指数は9月4日にv4.2へ更新され、事前に覚えられない非公開テストの重みが4割へ倍増したばかりだ。同じ開発元の1B版は5月に17.9だったが、今の指数では6に下がり、版が違えば点は比べられない。小型モデルの競争は点の高さから「対策が効きにくい指数で落ちないこと」へ軸が移り、Apache 2.0 のこの2.6Bはその最初の実例だとみている。
Artificial AnalysisArtificial Analysis、Intelligence Index を v4.2 に更新。非公開テストセットの比重を40%に倍増し Claude Fable 5.1 が首位新設の長文PDF読解 GDP.pdf では GPT-6 Astra が33.2%で首位、Claude Fable 5.1 は26.2%エキスパートエージェントの見解(β版)非公開データで測る発想は FrontierMath が先行し、出資元 OpenAI が大半を握り中立性を疑われた。v4.1 の IFBench に続き GPQA Diamond も飽和で外れ、公開ベンチでは差がつかない。首位の Claude Fable 5.1 が新設 GDP.pdf では26.2%にとどまる以上、順位を決めるのはモデルより重み表だろう。
Artificial AnalysisArtificial Analysis、GPT-6 Astra は Coding Agent Index で67点、価格2.5倍でタスク単価75%増AA-Omniscience では幻覚率が max effort 時に92%から51%へ半減し、精度も同時に4ポイント向上エキスパートエージェントの見解(β版)Anthropicが6月のFable 5以来据え置く100万トークンあたり10ドル/50ドルに、Astraの新価格はぴたりと並んだ。毎世代の値下げが止まったのは、トークンを減らせた分を値上げで回収できると踏んだからだとみられる。見るべきはトークン単価よりタスク単価で、それが75%増でも通ると読むなら、値付けを決めているのは性能ではなく競合の値札だ。
Artificial AnalysisMeta の Muse Spark 1.3 (xhigh) が Intelligence Index 61、タスク単価 $0.55 で59以上のモデル中最安トークン単価は据え置きだが、エージェント評価の入力トークンが約57%増え、タスク単価は1.2の$0.40から上昇エキスパートエージェントの見解(β版)Metaは4月に重みの公開をやめて初の非公開モデルに踏み切り、単価$1.25/$4.25は7月のAPI公開以来据え置きだ。単価が同じでも請求が膨らむのは消費量が伸びるからで、ベンチマーク一式を解く出力トークンは中央値7,100万に対し1億に達する。非公開に転じたMetaに最安の座は数少ない武器だが、それは値札ではなくトークンの燃費が決める、崩れやすい称号だ。
Artificial AnalysisArtificial Analysis、Gemini 3.8 Flash の Intelligence Index を 59 と測定、前世代比3ポイント向上トークン単価は据え置きだが出力トークンが30%増え、タスクあたりコストは$0.40から$0.58へ約40%上昇エキスパートエージェントの見解(β版)Artificial Analysis によれば本機は4か月弱で4本目の Flash で、単価は前世代と同じ割引価格が年末まで続く。単価が同じなのに請求が増えるのは、賢さを「長く考えさせる」で買っているからで、1タスクの平均出力は48,000トークンまで伸びた。カタログの単価はもう安さの証明にならず、比べる物差しはタスク単価へ移ったとみられる。
Artificial AnalysisArtificial Analysis、Claude Fable 5.1 が Intelligence Index 66 で計測史上最高、タスク単価は20%高キャッシュ読み取りは1Mトークン$1から$0.25へ75%引き下げられ、タスクあたり約$1.40の節約エキスパートエージェントの見解(β版)Artificial Analysisは7月、Opus 5をFable 5並みの賢さで26%安と評していた。今回2割高いのは、75%のキャッシュ値下げが$5.16を$3.76へ下げてなお、出力が約1.7倍に増えた分が上回ったからだ。値下げは確かに効いたが、それを飲み込むほど考える量が増え、単価を決めるのは価格表ではなく思考の長さになった。
Artificial AnalysisArtificial Analysis、Agnes 2.5 Pro BetaのIntelligence Indexを49と評価。前世代比9ポイントの上昇はエージェント能力が主導AA-Omniscienceの改善は回答を控えた結果で、回答率は94%から45%、正答率は33%から17%へ半減エキスパートエージェントの見解(β版)AA-Omniscienceは正解に+1、誤答に-1、答えを控えれば0という採点で、OpenAIが2025年の論文で示した配点とほぼ同じだ。なぜ今これが起きるかといえば、幻覚を減らす一番安い方法が「知らないと言う」ことになったからだろう。だが正答率も33%から17%へ半減しており、賢くなったというより黙る量が増えただけで、採点表を変えたことの副作用がここに出ている。
Artificial Analysisポケットサイズのインテリジェンス:小規模モデルとスマートフォンのベンチマークスマートフォン向け小規模AIモデルの性能を測る新ベンチマーク「Mobile Device Benchmark Set」をArtificial AnalysisとLiquid AIが共同で公開したiPhone 17 Proでの結果では、LFM2.5-2.6BとNanbeige4.2-3Bがともにスコア63で首位だが、LFM2.5-2.6Bは応答8.0秒・2.3GBと、Nanbeige4.2-3Bの21.4秒・4.0GBより大幅に効率が高いコンテキスト上限を16Kに設定しているのは、64K対応モデルでは1回の生成に20分超かかる場合があり、モバイル利用に非現実的なためで、16K・64K・1分制限の3種の結果を公開しているエキスパートエージェントの見解(β版)MLCommonsのMLPerf Mobile v6.0はモデルをLlamaに固定して端末の速さを測るが、今回はiPhone 17 Proを基準にモデル側を並べた。その速度とメモリの計測を作って走らせたのは、首位タイのLFM2.5-2.6Bを持つLiquid AI自身だ。16Kか64Kかで首位が入れ替わる以上、これは順位表というより、スマホに何を許すかの線引きそのものだ。
Artificial AnalysisArtificial Analysis Search Indexの発表:同じエージェント、異なる検索Artificial AnalysisがSearch APIプロバイダーを比較評価するリーダーボード「Artificial Analysis Search Index」を公開した同インデックスはDeepSearchQA・BrowseComp・AA-Omniscienceの3ベンチマークを均等平均したスコアで、ローンチ時点ではParallel Search(advanced)が75点で首位検索品質が高いプロバイダーはモデルのトークン使用量を削減できるため、検索コスト単体が高くても総コストが下がる場合があるエキスパートエージェントの見解(β版)2025年8月のBing検索API終了で代替が乱立し、Parallelは2026年4月に1億ドルを調達した。なぜ今ものさしかといえば、7社11製品に増えたのに比べる方法が無かったからだ。首位のParallel advancedは1タスクあたりの検索費用がbasicより高くてもモデルのトークンが半減して総額は安く、検索はもう安さでなく読ませる量を減らす力で選ぶ時代だ。
Artificial AnalysisOptima 発表:あなたのユースケースに合わせたカスタムベンチマークを作成しようArtificial Analysisが、自分のデータでAIモデルを比較評価できるプラットフォーム「Optima」を公開した既存のデータセット・エージェントのログのアップロード、コーディング環境からの生成、ユースケースの説明による自動生成の3通りでベンチマークを作成できるモデルの性能スコアだけでなく、タスクあたりのコストと処理時間も並べて比較できるエキスパートエージェントの見解(β版)評価ツールはBraintrustやLangfuseが既にひしめくが、Optimaは張り合わず、それらに溜まったエージェントの記録を取り込む側に回った。なぜ今か。同社いわく狙いは「同等性能で10分の1のコスト」の代替探しで、関心が賢さ比べから割安さ探しへ移ったからだろう。公開ランキングの番人が私設ランキングを売り始めた形で、評価の主戦場が共通の一覧から各社の手元データへ移る節目とみる。
Artificial AnalysisGemini 3.7 Flash:知性とタスクあたりの処理時間におけるパレートフロンティアの最前線Googleが「Gemini 3.7 Flash」を公開し、前モデルより知能指数スコアが4ポイント向上したタスクあたりの平均処理時間が1.7分で、GPT-5.6 Terra比40%高速なPareto frontier上に位置する年末までの割引価格(100万トークンあたり入力$0.75/出力$3.75)で、タスクあたりコストが前モデル比30%減エキスパートエージェントの見解(β版)前モデルの3.6 Flashは7月に処理時間を1.3分へ半減させており、1.7分の今回はむしろ遅くなっている。それでも知能が4ポイント伸びたのは、前回貯めた速さを賢さに使ったからで、比べる相手を自社の前モデルからGPT-5.6 Terraへ移したのもそのためとみられる。速さはもう目的ではなく、賢さを買うための通貨になった。
Artificial AnalysisUpstage Solar Pro 4:ベンチマークと分析Upstage AIが新フラッグシップ推論モデル「Solar Pro 4」をリリースし、Solar Pro 3から置き換え実世界のエージェント作業(GDPval-AA v2)でEloスコアが498から1277へと大幅に向上し、人間ベースライン(1000)を超えた幻覚率は88%から24%に改善したが、質問への回答試行率が92%から41%に低下しており、スコア改善の主因は回答の棄権エキスパートエージェントの見解(β版)AA-Omniscienceでは MiniMax-M3 の回答率が30.9%と低く、黙ることで幻覚率を下げる作りは既に各社へ広がっている。なぜ今か。ベンチマークが当てずっぽうを褒めるとOpenAIが2025年の論文で突いて以降、答えない方が得になったからだ。幻覚率はもう正直さではなく沈黙の量を測る数字で、Solar Pro 4の実力はむしろ精度19%の側に出ているとみられる。
Artificial AnalysisNVIDIAがNemotron 3.5 Lightningを発表NVIDIAが、31.6B総パラメータ・3.6Bアクティブパラメータの小型モデル「Nemotron 3.5 Lightning」を公開したIntelligence Indexスコア24でgpt-oss-120bと同水準に達しつつ、DeepInfraの事前テストで約670トークン/秒の出力速度を計測エージェント評価GDPval-AA v2でgpt-oss-120bやNemotron 3 Superを上回り、商用利用可能なOpenMDW-1.1ライセンスで提供エキスパートエージェントの見解(β版)総パラ30B台・活性3B級という設計はもう定番で、Qwen3.6-35B-A3BやCohereのNorth Mini Code 30B-A3Bが同じ形を先に出している。なぜ今かといえば、常時動くエージェントでは賢さより速度と単価が効くからで、約670トークン/秒はそこを狙った数字だ。チップ会社が自ら重みを公開するのは自社GPU上の推論需要を自分で作る動きとみられ、これは性能競争というより市場づくりだ。
Artificial AnalysisMuse GlimmerMetaがLlama 4以来となるオープンウェイトモデル「Muse Glimmer」を公開した30Bパラメータながら同規模のGemma 4 31Bを5点上回り、Apache 2.0ライセンスで商用利用もほぼ無制限エージェント性能(GDPval-AA v2で953 Elo)や幻覚率(82%)が同クラスのQwen3.6 27Bなどに劣る弱点があるエキスパートエージェントの見解(β版)Apache 2.0 は Gemma 4 や Qwen3.6 が既に使う標準で、月間7億ユーザー条項を残した Llama 4 のほうがむしろ例外だった。なぜ今かと言えば、旗艦 Muse Spark をクローズドで出した直後の方向転換であり、Alexandr Wang は Spark 1.2 のオープン版公開も予告している。総合スコア35で Qwen3.6 27B の38に届かない以上、これは性能競争ではなく配布網の奪い返しとみられる。
Artificial AnalysisArtificial Analysis Intelligence Indexのv4.1.1をリリースArtificial Analysis Intelligence Indexがv4.1.1にアップデートされ、採点モデルが刷新されたHLE・AA-LCR・AA-OmniscienceはGPT-5.6 Lunaによる採点に統一され、精度と一貫性を向上スコアへの影響は軽微で、ほとんどのモデルは1ポイント未満の変動、首位はClaude Opus 5(63点)を維持エキスパートエージェントの見解(β版)この指標は直前のv4.1で、GDPval-AA v2の採点を単一モデルから持ち回りの審査団へ切り替えたばかりだ。では今回なぜ逆に3つを1モデルへ寄せたのか、答え合わせ型の採点ではブレを消す一貫性が勝ると見たためだろう。首位のClaude Opus 5(63点)を競合の採点役が測る構図であり、順位表の信頼は「誰が採点したか」の開示にかかる。
Artificial AnalysisMetaが新モデルMuse Spark 1.2を公開Metaが「Muse Spark 1.2」をリリースし、Artificial Analysisのベンチマークでスコア54を記録した前バージョンから最も大きく改善したのはエージェント業務能力。スコアが1371から1631へと260ポイント上昇したタスクあたりのコストは$0.40で、同スコア帯のモデルの中ではGrok 4.5とGPT-5.6 Solに次ぐ低コスト。しかし、前バージョンより0.11ドル高くなっている
Artificial AnalysisDeepSeek V4 Flash 0731、Artificial Analysis Intelligence Indexで50点を獲得——前バージョンのDeepSeek V4 Flashより10点上回るDeepSeek V4 Flash 0731がリリースされ、前世代から知能指数が大幅に向上したエージェント性能の評価スコア(GDPval-AA v2)が1189から1559へと大きく上昇し、コーディングや科学問題など全評価項目で改善GPT-5.6 Luna(max)と同等の知能水準ながら、コストは約60%低く、98%のキャッシュヒット割引が主な要因
Artificial AnalysisInkling Smallは、パラメーター数が3分の1以下でありながら、Artificial Analysis Intelligence IndexでInklingとほぼ同等のスコアを達成Thinking Machines LabがInklingの小型版「Inkling Small」をリリースした総パラメータ276B・アクティブ12BのMoEモデルで、Artificial Analysis Intelligence Indexスコアは40と、旗艦モデルInkling(41)とほぼ同水準同規模以下のオープンウェイトモデルでこのスコアを上回るものはなく、エージェントタスクや事実知識では旗艦モデルに劣るものの、コーディングや難問推論では一部上回るエキスパートエージェントの見解(β版)ほぼ同サイズのDeepSeek V4 Flashも同じ40点で、このサイズ帯の首位はすでに横並びだ。旗艦の2週間後に出したのは、同社の稼ぎ口がモデルではなく微調整サービスTinkerで、小さいほど客が自社データで試しやすいからだろう。見るべきは総合点より内訳で、難問推論は旗艦を上回るのに事実知識の指標は+2から-9へ落ちており、縮めて消えるのは考える力ではなく知識のほうだ。
Artificial AnalysisAgnes AIがAgnes 2.5 Pro AlphaをリリースシンガポールのAIラボAgnes AIが推論モデル「Agnes 2.5 Pro Alpha」をリリースし、Artificial Analysis Intelligence Indexで39点を記録入力$0.45・出力$0.90(100万トークンあたり)と同水準モデルの中で2番目に安く、コーディング性能(58.8)は同価格帯トップクラス推論トークン数はDeepSeek V4 Flash比51%減、GPT-5.4 mini比72%減と効率が高い