Artificial AnalysisMuse Spark 1.1:Metaが3ヶ月でインテリジェンス指数を8ポイント向上Muse Spark 1.1が知能指数51を記録し、前バージョンから8ポイント上昇した同スコア帯のモデルの中で最もトークン効率が高く、1タスクあたり約$0.26で動かせる性能向上の一部は精度改善ではなく、誤答を減らす「回答の差し控え」によって達成されている
Artificial AnalysisGPT-5.6のベンチマーク:知性、速度、コストの比較GPT-5.6シリーズ(Sol・Terra・Luna)が公開され、コーディングや文書作成など複数の評価で高い成績を記録したClaude Fable 5とほぼ同等の性能をSolは約3分の1のコストで提供でき、用途に応じてモデルを使い分けられるOpenAIとして初めてキャッシュ書き込み料金が導入され、価格体系がより実際の処理コストを反映する仕組みに近づいているエキスパートエージェントの見解(β版)記事のCoding Agent IndexではSolが全3評価をリードするが、SWE-Bench ProではFable 5が80%対64.6%と逆転し、どの物差しを取るかで勝者が入れ替わる。なぜ今キャッシュ書き込み課金なのか——先行するAnthropicも書き込みに割増を課しており、OpenAIの追随は推論コストを価格へ映す業界の収れんとみられる。見出しの「Fable 5に肉薄」より本質的なのは、最上位の知性が用途別に値付けされる商品化であり、競争軸は生の性能からコスト効率へ移った。
Artificial AnalysisEnterpriseOps-Gym-AA のご紹介企業向け業務をAIが実行できるか評価するランキング「EnterpriseOps-Gym-AA」が公開された最高スコアのClaude Fable 5でも51%にとどまり、現状のAIは複雑な業務の半分程度しか完遂できないタスク単価が約90倍の差があるにもかかわらずコストと性能が比例しておらず、費用対効果の見極めが重要になる
Artificial AnalysisGrok 4.5がSpaceXAIを知能の最前線へと導くGrok 4.5がリリースされ、知能指標でGrok 4.3より16ポイント向上したOpenAIとAnthropicに次ぐ性能を持ちながら、同等モデルの5分の1以下のコストで動作する精度は上がった一方で幻覚率も上昇しており、高性能化に伴うトレードオフが残る
Artificial AnalysisHarvey LAB-AAの発表:実際の法律業務におけるAIエージェントの評価契約書と内部メモをもとに、支配権変更・譲渡条項の分析レポート作成が指示されたこれはM&A取引チーム向けに、買収時のリスク条項を整理・報告する業務依頼である実際の契約内容が記事として提供されていないため、具体的な条項の詳細は不明である
Artificial AnalysisAutomationBench-AAのリリースを発表AIエージェントが実際のSaaSワークフロー657タスクをこなせるか測る「AutomationBench-AA」が公開されたAnthropicのClaude Fable 5が48.6%で首位だが、全モデルでビジネスルール違反が発生し完全自動化には課題が残るコストと精度のバランスではGemini 3.5 Flashが同等性能のGPT-5.5の約37%のコストで動作し、費用対効果の差が大きい
Artificial AnalysisClaude Sonnet 5:タスクあたりのコストは高いが、エージェント性能は優秀Claude Sonnet 5が公開され、知能指数53を記録しGPT-5.5やOpus 4.8に迫る性能を示した処理能力は上がったが、トークン使用量増加によりOpus 4.8より約15%タスク単価が高くなった9月1日までの期間限定値下げが設定されており、通常価格では費用対効果の評価が変わりうる
Artificial AnalysisAA-Briefcaseにおけるタスクごとの時間計測長期的な知識業務を測定する独自指標AA-Briefcaseで、各モデルの1タスクあたりの処理時間が比較された精度と速度のバランスでは、GPT-5.5(xhigh)がOpus 4.8の約半分の11分でトップ5入りし効率面で際立つ処理時間の大半は出力の長さや推論速度が占め、ツール実行の比重は約12%にとどまる
Artificial AnalysisArtificial Analysis スピーチ・トゥ・スピーチ インデックスの発表音声会話AIモデルを総合評価する新指標「Speech to Speech Index」が公開された総合首位はGPT-Realtime-2(High)の77.2%で、速度・コスト・性能のバランスにモデル間で明確な差がある特に自律タスク処理の難易度が高く、全モデルが53%未満にとどまっており、この領域が今後の課題となっている
Artificial AnalysisAA-Briefcaseの発表:フロンティアナレッジワーク評価AA-Briefcaseは、データサイエンスや戦略など4分野・91タスクで構成された実務型AIエージェント評価指標で、Claude Fable 5が総合首位となった。最高性能モデルでも全条件を満たすタスクはわずか3%で、現状のAIは複雑な実務知識作業に対し依然限界がある。タスク1件あたりのコストは最大800倍以上の差があり、性能とコストのバランスが実用選択の重要な判断軸となっている。
Artificial AnalysisGLM-5.2が、Artificial Analysis Intelligence Indexにおける最新のトップオープンウェイトモデルにZ aiのGLM-5.2が、オープンウェイトモデルの中で知性指標スコア51の首位となった前世代のGLM-5.1より11点高く、科学的推論や実務エージェント性能で大幅に向上しているコストは1タスクあたり約0.46ドルと競合より高めだが、同水準の知性を持つモデルの中では最安となっている
Artificial AnalysisArtificial Analysis インテリジェンス インデックス v4.1:エージェント型ワークロードへのシフトAIモデルの総合評価指標「Intelligence Index」がv4.1に更新され、自律的なタスクを重視した内容に刷新された現時点で利用可能な最高性能モデルはClaude Opus 4.8(スコア56)で、GPT-5.5(スコア55)がそれに続くDeepSeek V4 Pro(スコア44)は1タスクあたり0.04ドルと、上位の有料モデルに比べ20〜45倍安く、コスト面で際立った存在となっている
Artificial AnalysisAA-AgentPerf初の結果:エージェント時代のためのハードウェアベンチマークAIエージェント向けの新しい推論ベンチマーク「AA-AgentPerf」を公開1メガワットあたりの同時エージェント数を主要指標とし、実際の性能を測定ハードウェア購入者がエージェント用途の機器選定に活用できる
Artificial Analysisガードレールモデルの安全性、拒否率、レイテンシのベンチマーク評価複数のガードレールモデルを3つのデータセットで性能比較した安全なコンテンツを誤拒否せず、危険なコンテンツを検出するバランスが重要用途に応じて検出優先か誤拒否低減優先かを選ぶことが推奨される
Artificial AnalysisClaude Fable 5、Artificial Analysis Intelligence Indexで第1位を獲得してローンチClaude Fable 5がAIベンチマークで総合1位を獲得推論精度・エージェント作業・知識の正確さで他社モデルを上回るAPI利用は入力$10/出力$50(100万トークン)で、高性能だがコストも高い
Artificial AnalysisClaude Fable 5: 初の公開MythosクラスモデルAnthropicがClaude Fable 5を一般公開実務タスクのベンチマークで1位を獲得有害クエリの安全機能と代替モデルの切り替え機能を搭載
Artificial AnalysisNorth Mini Code: CohereのコーディングにフォーカスしたスモールMoEモデルコーディング特化の小型AIモデル「North Mini Code」をリリースコーディング性能は同サイズ帯でトップクラスだが、非コーディング作業は苦手処理速度が速くApache 2.0で公開され、実務に導入しやすい
Artificial AnalysisMiniMax-M3: オープンウェイトモデルの先駆け、ウェイトのリリース時期についてMiniMax初のマルチモーダルモデル「M3」をリリース画像・動画入力と100万トークンの文脈処理に対応約10日以内に重みが公開予定で、オープン系モデル最高水準になる見込み
Artificial AnalysisNVIDIA Nemotron 3 Ultra リリース:高速、高性能、そしてオープンNVIDIAが新しい大規模オープンモデル「Nemotron 3 Ultra」を公開米国製オープンモデル最高の知能スコアを持ちつつ毎秒400トークン超の高速推論を実現エージェント作業や推論タスクで速度と精度を両立したい開発者に有用
Artificial AnalysisFun-Realtime-TTS: Artificial Analysisリーダーボードで首位を獲得した新しいテキスト音声変換モデルAlibbaのFun-Realtime-TTSが音声合成ランキング1位を獲得Googleを上回るEloスコアで、価格は100万文字あたり約27ドルAPIで利用可能で、音声クローンや多言語対応など機能が豊富