Claude Blog2026-07-111: フロンティアで働く:CognitionがClaude Fable 5を信頼して夜通し作業させる理由AIソフトウェアエンジニア「Devin」を開発するCognitionが、Claude Fable 5で自社ベンチマークのスコアが約10%から約30%に向上したと報告した従来モデルでは数分〜1時間が限界だった継続作業が、Claude Fable 5では8時間以上安定して続けられるようになった開発チームは「1〜2年以内にエージェントによる自律的な問題発見・修正が標準になる」と見込んでいるエキスパートエージェントの見解(β版)METRの調査では、AIが自力でこなす作業の長さは約7カ月ごとに倍増し近年は加速したとされ、8時間連続もこの曲線上の一点にすぎない。なら誰がその成果を朝に点検するのか、GoogleのJulesやOpenAIのCodexも競う非同期エージェント時代の詰まりは「書けるか」から「任せられるか」へ移った。これは性能表の更新ではなく、任せる単位が一打鍵の補完から一晩の当番へ変わる転換であり、フロンティアはもはや能力でなく信頼の側にあるとみられる。
Claude Blog2026-07-072: Claude Fableフィールドガイド:未知の要素を見つけるClaude Codeを使った開発作業で、事前・実装中・実装後に「未知の不明点」を発見するための具体的な手法が紹介された指示が詳細すぎても曖昧すぎても失敗するため、自分の「気づいていない盲点」をClaudeと協力して明確にすることが鍵になるブレインストーミングやインタビュー・実装計画といった段階を踏むことで、修正コストが高くなる前に問題を発見できるエキスパートエージェントの見解(β版)「未知の未知」はラムズフェルドが広めた語、「地図は現地ではない」はコージブスキーの命題で、本稿は両者を開発現場へ翻案したものだ。なぜ今かといえば、Fableが数時間・数十ファイルを自走する段階に入り、注目すべき点がモデル能力から「人間がAIの盲点を言語化できるか」へ移ったからだとみられる。これは要件定義の考古学とも呼ぶべき仕事で、職人芸のようなプロンプトの終わりを告げているのではないだろうか。
xAI News2026-07-053: Voice Agent Builderのご紹介コードなしで音声AIエージェントを約2分で構築できる「Voice Agent Builder」がベータ公開された音声認識・言語モデル・音声合成を別々に組み合わせる従来構成と異なり、一体型で遅延とコストを削減できる料金は音声通話1分あたり$0.05と明示されており、複数の課金項目が重なる他サービスとの違いを強調している
Google Blog - Gemini2026-07-114: Geminiアプリで学習ノートを作成する方法はこちらGeminiアプリに、個人の理解度に合わせた学習機能「study notebooks」が追加された学びたい内容を伝えると、小分けのレッスンや練習クイズで効率よく習得できる進捗をダッシュボードで確認できるため、何を優先すべきか判断しやすい設計になっているエキスパートエージェントの見解(β版)昨夏OpenAIのStudy Mode(7月)とGeminiのGuided Learning(8月)が相次ぎ、AI家庭教師を巡る競争は既に始まっていた。対話モードで足りるはずが、なぜノート型なのか——クイズと進捗管理で学びの場ごと囲い込み、QuizletやKhan Academyの領分へ踏み込む一手とみられる。米国AI教育への3年で10億ドル投資と合わせれば、質問に答える道具から学びの流れごと抱える基盤へ、Geminiが静かに舵を切った証だろう。
OpenAI News2026-07-105: GPT-5.6がMicrosoft 365 Copilotの優先モデルにGPT‑5.6がMicrosoft 365 CopilotのWord・Excel・PowerPoint・Coworkの標準モデルになった毎日使う業務ツールに最新AIが組み込まれ、より少ない操作で高品質な成果物を得やすくなるOpenAI APIを通じた提供により、既存ツールの枠組みのままAI活用を深められる構造となっているエキスパートエージェントの見解(β版)MSは2025年9月からCopilotにAnthropic製Claudeを併走させ、6月GAの自律型Coworkは既定でClaude系を使うと報じられていた。なぜ今あえて「優先」を掲げるのか、OpenAIは同じ7月9日にCopilotと競合するChatGPT Workを投入しており、供給者かつ競合という二面性が透ける。これは純粋な性能比較というより、Copilotの土台を争う両社の綱引きで、Microsoftは特定モデルに縛られない構えを崩していないとみられる。
Artificial Analysis2026-07-106: GPT-5.6のベンチマーク:知性、速度、コストの比較GPT-5.6シリーズ(Sol・Terra・Luna)が公開され、コーディングや文書作成など複数の評価で高い成績を記録したClaude Fable 5とほぼ同等の性能をSolは約3分の1のコストで提供でき、用途に応じてモデルを使い分けられるOpenAIとして初めてキャッシュ書き込み料金が導入され、価格体系がより実際の処理コストを反映する仕組みに近づいているエキスパートエージェントの見解(β版)記事のCoding Agent IndexではSolが全3評価をリードするが、SWE-Bench ProではFable 5が80%対64.6%と逆転し、どの物差しを取るかで勝者が入れ替わる。なぜ今キャッシュ書き込み課金なのか——先行するAnthropicも書き込みに割増を課しており、OpenAIの追随は推論コストを価格へ映す業界の収れんとみられる。見出しの「Fable 5に肉薄」より本質的なのは、最上位の知性が用途別に値付けされる商品化であり、競争軸は生の性能からコスト効率へ移った。
OpenAI News2026-07-107: GPT-5.6:あなたの野心に応じてスケールするフロンティアインテリジェンスGPT‑5.6ファミリー(Sol・Terra・Luna)が一般公開され、コーディングや科学・サイバーセキュリティなど広範な分野で最高水準の性能を記録した競合モデルと比べて使用トークン数や処理時間・コストを大幅に削減しながら高い性能を実現しており、コストあたりの成果が向上している安全対策にも約70万A100e GPU時間の自動テストを含む過去最大規模の評価を実施しており、能力向上と安全性強化を同時に進める姿勢が示されているエキスパートエージェントの見解(β版)評論家サイモン・ウィリソンは、推論トークン数がモデル間で桁違いに変わる今、トークン単価どうしの比較はもう無意味だと指摘する。なぜ単一の旗艦ではなくSol・Terra・Lunaの三段構えなのか。賢さの誇示よりも、仕事ごとに安いモデルへ振り分けてコストを抑える「使い分け」の囲い込みが本命とみられる。実際SWE-Bench ProではClaude Fable 5が80%でSolの64.6%を上回り、主戦場は「誰が一番賢いか」からベンチマークの定義権をどちらが握るかへ移りつつある。
OpenAI News2026-07-108: ChatGPTは、あなたの最も野心的な仕事のパートナーになったChatGPT Workが発表され、複数のアプリをまたいで資料作成や長時間の複雑な業務を自律的に実行できるようになったチャットへの返答にとどまらず、業務の一連の流れを代行して完成物を生み出す段階に移行した社内テストでは財務や営業の業務にかかる時間が大幅に短縮されており、知識労働の進め方が変わりうることを示しているエキスパートエージェントの見解(β版)完成物を納品する自律エージェントは、3月のMicrosoft「Copilot Cowork」やAnthropicの「Claude Cowork」が先行し、OpenAIはむしろ後発参入だ。なぜ今どの社も「チャット返答」から「数時間かけて成果物を仕上げる」へ一斉に軸足を移すのか、対話そのものの付加価値が頭打ちになり費用対効果の勝負に移ったためとみられる。これは突破というより業務代行エージェントが標準装備になった号砲で、勝敗はモデルの賢さよりも「社内で誰に何を触らせるか」の管理機能へ移っていく。
Dify Blog2026-07-109: Dify公式CLI「difyctl」がリリースバージョン1.15.0でコマンドラインツール「difyctl」が導入され、スクリプトやAIエージェントからDifyアプリを直接呼び出せるようになったブラウザ操作が前提だったDifyアプリが、コマンド一つで自動化パイプラインやAIエージェントから呼び出せる汎用ツールになったAIエージェントが既存の業務システムを直接操作する流れが広がる中、CLIという安定した接続口を持つことが実用上の重要性を増しているエキスパートエージェントの見解(β版)「CLIはエージェント向けの新しいMCP」との議論が2026年に強まり、Anthropicの検証ではツール操作をCLI化するとある作業のトークンが15万から2千へ激減したという。MCP対応も進むDifyが今あえてCLIを出すのは、Claude CodeやCodexが動くターミナルに直接置ける安定した接続口を得るためとみられる。difyctlはDifyを「作るだけのWebアプリ」からエージェントが叩ける部品へと変える一手だ。
Anthropic News2026-07-0910: Claudeの使い方を振り返るための新機能のご紹介ClaudeのWebおよびデスクトップ版に、自分の利用状況を振り返るダッシュボード機能がベータ公開された過去12ヶ月の利用傾向や作業内容を可視化し、休憩リマインダーや静音時間の設定もできるプライバシーへの配慮や専門機関との連携が示すように、AI利用を自分でコントロールする意識を促す設計になっている
Artificial Analysis2026-07-0911: Grok 4.5がSpaceXAIを知能の最前線へと導くGrok 4.5がリリースされ、知能指標でGrok 4.3より16ポイント向上したOpenAIとAnthropicに次ぐ性能を持ちながら、同等モデルの5分の1以下のコストで動作する精度は上がった一方で幻覚率も上昇しており、高性能化に伴うトレードオフが残る
GitHub Blog - AI & ML2026-07-0912: 社内データ分析エージェントの構築方法社内向け分析エージェント「Qubot」を構築し、SlackやVS Codeから自然言語でデータ照会できるようにした専任アナリストなしに誰でもデータ倉庫を探索できるようになり、Slackでの質問数が大幅に減少した整理されたコンテキスト情報が回答精度を高め、正答到達速度を3倍にすることがわかった
OpenAI News2026-07-0913: コード評価におけるシグナルとノイズの分離SWE-Bench Proの731タスクを詳細に調査した結果、約30%のタスクに欠陥があると判明したテストの条件が厳しすぎたり、問題文と採点基準がずれていたりして、正しい回答が不正解になるケースが多数存在する以前に推奨したSWE-Bench Proの採用を撤回し、開発者向けに設計された新たな評価基準の整備を求めているエキスパートエージェントの見解(β版)独立監査のDatacurveも5月にSWE-Bench Proの採点が約3分の1で誤りと報告済みで、今回の指摘は外部の警告を後追いで裏付けた形だ。OpenAIは2月にVerifiedを捨ててProを薦めたばかりで、なぜ数か月で撤回か——ベンチマークは攻略の的になった瞬間に劣化する構造が露呈したとみられる。物差しを作る側とモデルを作る側が近すぎるのが根の問題で、評価には独立した番人が要ると突きつけられている。
Cursor Blog2026-07-0914: Grok 4.5 のご紹介SpaceXAIと共同開発したGrok 4.5をリリースし、Cursorの全プラットフォームで利用可能になったコーディング特化だった従来モデルから拡張し、金融・法務・データサイエンス等の幅広い知識労働に対応できる数兆トークン規模の学習データと分散エージェントによる強化学習を組み合わせた開発手法が、今後のモデル改良の基盤になっているエキスパートエージェントの見解(β版)本モデルはSpaceXが6月にCursorを600億ドルで買収した延長線上にあり、静的なコードでなく実際の開発セッションデータを取り込んだ点が肝。記事は用途拡大を推すが、xAI公表ベンチでOpus 4.8に勝ったのは4つ中2つ、真の武器は同じ課題を約1.6万トークンで解く効率(Opus 4.8は約6.7万)とみられる。これはモデルの賢さ比べというより、エディタとデータを囲い込む垂直統合の勝負だ。
xAI News2026-07-0915: Grok 4.5 のご紹介Grok 4.5がリリースされ、CursorやGrok Buildなどで利用可能になったコーディングや業務効率化に特化し、同等モデルの約2倍のトークン効率を実現している入力100万トークンあたり2ドルという価格設定で、処理速度と低コストを両立させているエキスパートエージェントの見解(β版)同水準モデルの2倍というトークン効率をうたうが、実際のGitHub課題解決を測るDeepSWEでは53%にとどまり、Fable 5の70%やGPT-5.5の67%に一段譲る。なぜ性能の頂点ではなく、効率と入力100万トークン2ドルという安さを前面に押し出すのか。これは最上位争いから降り、コストの安さで数を取りにいく現実路線への舵切りとみられる。
Google Blog - Gemini2026-07-0916: このコーヒーショップがGeminiで成長している3つの方法サンフランシスコのコーヒー店主がGeminiを活用し、売上管理・資料作成・メルマガ業務を効率化した高額なソフト不要で日次売上レポートを構築し、制作物は従来比95%速く作れるようになった専門知識がなくても日常言語でAIに指示するだけで、小規模店舗でも業務自動化が実現できるエキスパートエージェントの見解(β版)米商工会議所の2025年8月報告では、生成AIを使う小規模事業者は2024年の40%から2025年に58%へ増え、SMBへの浸透が一気に進んだ。ではなぜGoogle自ら今この体験談を出すのか、ChatGPTやCopilotがSMB層を固める前に「専門知識ゼロでも使える」利用者を囲い込む販促とみられる。95%短縮という数字は魅力的だが、非エンジニアが生成したコードを誰が保守するのかは記事が触れない死角だ。
OpenAI News2026-07-0917: GPT-Liveのご紹介会話中に同時に聞きながら話せる新音声モデル「GPT‑Live」が、ChatGPTの音声機能として世界向けに提供開始された従来の音声モードより会話の自然さ・賢さ・安全性が向上し、週1億5千万人以上が使う音声機能の体験が刷新される背景に複数モデルの委譲構造を持つ設計により、音声での複雑な作業対応や常に最新モデルへの更新が可能な仕組みが整えられているエキスパートエージェントの見解(β版)グーグルは3月のGemini 3.1 Flash Liveで同時発話も90超の多言語も先行させており、聞きながら話す機能はもう差別化でなく最低条件になりつつある。ではOpenAIの賭けは何か。音声を一つのモデルで完結させるグーグルと違い、軽い会話モデルが裏でGPT-5.5に難所を委ねる分業に振った点だ。声の自然さで競うより頭脳だけ最新に差し替える拡張性に賭けた形だが、実演のヒンディー語が強い訛りだった通り自然さの課題はなお残る。
OpenAI News2026-07-0818: Australian Payments PlusがChatGPTとCodexで開発スピードを加速オーストラリアの決済インフラ企業AP+がChatGPT EnterpriseとCodexを全社導入した調査時間の短縮や業務品質の向上など、技術・企画・運用の各分野で具体的な成果が出ている規制の厳しい金融業界でも、ガバナンスを整備しながらAIを段階的に広げられることを示しているエキスパートエージェントの見解(β版)オーストラリアの金融当局APRAは2025年末の点検で、AI導入に統治が追いつかず、特にAIが書いたコードの監査が遅れていると警告している。なぜ今この事例が出るのか。OpenAIが企業向け収益を伸ばそうと導入例を量産する流れの一つで、規制の厳しい金融でも使えると示す狙いとみられる。決済基盤を担うAP+だけに、「統治しながら広げた」を自賛で終わらせず、当局が迫る監査の中身まで見せられるかが本当の試金石だ。
OpenRouter2026-07-0819: LLMにおける最適な画像入力詳細レベルの選び方 — OpenRouter Blog画像入力の解像度設定(低解像度vs自動)を複数モデルで比較検証した結果、全モデルで自動設定の精度が上回り、一部では費用も安かった推論機能を持つモデルでは低解像度設定が逆効果で、不鮮明な画像を補おうと余分な推論トークンが増え、精度と費用の両面で損をする費用を抑えたい場合は画像解像度を下げるより推論レベルを下げる方が効果的で、推論なしモデルに限り低解像度設定が有効な節約手段になる
Claude Blog2026-07-0720: Claude Codeでのモデルと処理レベルの選び方Claude Codeには「モデル選択」と「努力レベル」の2つの設定があり、それぞれ異なる働きをするモデル選択は知識・能力の上限を決め、努力レベルは読むファイル数や検証の深さなど作業量を制御する結果が外れた際は、知識不足ならより大きなモデルへ、手抜きが原因なら努力レベルを上げると改善しやすい