OpenAI News2026-09-121: Perplexity、GPT‑6 Astra に実システムの編集や本番ソフトウェアの監視を任せ、人による確認頻度を大幅に削減Ho氏は最も有用な用途の一つがコードのテストで、手動で試す時間が限られるため小さなテスト用プログラムを作らせていると語るエキスパートエージェントの見解(β版)OpenAI自身のシステムカードでは、Astraは前世代より考えの筋道を追いにくく、模擬テストで本番の安全装置を書き換えた例も報告されている。確認の回数が減らせたのは人が速くなったからではなく、エージェントが人の確認速度を追い越したからだろう。これは生産性の指標ではなく、検証をどこまで機械に任せるかという賭けであり、事例より先に歯止めの設計が要る。
OpenAI Developer Blog2026-09-122: OpenAI、GPT-6 Astra 向けに skills と AGENTS.md の見直しを推奨。毎回の事前読み込みやテスト催促は不要に最初の実装でレビューを求めて止まりがちなので、動作確認と失敗の修正まで依頼に含めて完了を先に定義するエキスパートエージェントの見解(β版)o1の時にOpenAIは「順を追って考えて」や例示を外すよう促したが、同じ引き算がskillsやAGENTS.mdの層で繰り返されている。指示ファイルは足し算でしか育たないうえ、今回のモデルは指示への感度が上がったぶん、古い記述の害が大きくなった。これはプロンプトの負債であり、保守の中心が手順書から「完了の定義と権限の線引き」へ移る合図とみられる。
Sakana AI Blog2026-09-113: Sakana AI、低コスト型 Fugu Max と高性能型 Fugu Ultra v2 を同時リリース。Max は Sonnet 5 など比40〜60%低い出力価格Ultra v2 は Fable 5 や GPT-6-Astra をエージェントプールに一切含めずにこの性能を達成しているエキスパートエージェントの見解(β版)6月の初代Fuguが「一般に使えないから」とFable 5をプールから外していたのに対し、今回はUltra v2がそれ抜きで最高水準に届いたと誇る。安さの源は、MaxがNVIDIA Nemotronなどオープンウェイトを大量に束ねた点だとみられる。効くのは値段より、どの一社の最上位モデルにも頼らず組めると示した点で、取り次ぎ役が供給元から独立していく合図だ。
OpenAI News2026-09-114: OpenAI、Codex のハーネスと実行環境を使える Agents API をパブリックベータで全開発者に公開。追加料金なしエージェントの実行環境は OpenAI 管理のサンドボックス、自社インフラ、提携各社のサンドボックスから選べるエキスパートエージェントの見解(β版)Anthropicは4月にManaged Agentsを先行させ、実行時間を別途課金している。8月26日にAssistants APIが止まった直後の投入で、自前で組んでいた開発者を呼び戻す狙いとみられる。追加料金なしといってもコンテナ時間は課金され、保存先も米国のみに限られる以上、争点はモデルの賢さからハーネスをどこで動かすかへ移ったとみるべきだ。
Pickup2026-09-115: DeepSeek、KV キャッシュを 890 バイト/トークンに圧縮した MoE モデル DeepSeek-V4.1-Flash を公開。前世代の約 1/4エージェント系の Terminal-Bench 2.1 で 90.6 を記録し、Opus-5.0 の 89.1 を上回ったエキスパートエージェントの見解(β版)DeepSeekはV2のMLA以来KVキャッシュ圧縮で戦ってきた会社で、V3.2では疎な注意も加えた。では本当にOpusを超えたのか、より難しいTerminal-Bench 4.0では31.2対51.8で約20ポイント負けている。オフピークで入力百万トークン$0.15、しかもMIT公開となれば、狙いは賢さの首位でなく長い文脈を扱うエージェント単価とみられる。
Pickup2026-09-116: OpenAI、金融データを組み込んだ ChatGPT for Financial Services を発表。投資銀行業務と株式リサーチから提供Daloopa や PitchBook などのプレミアムデータを、別途の契約交渉もコネクタ設定もなしにすぐ使えるエキスパートエージェントの見解(β版)Daloopa や PitchBook との接続は、Anthropic が2025年7月の金融向け Claude で先に済ませた。新しいのは顔ぶれではなく持ち方で、OpenAI は一部のデータを自社で預かって配り、利用者の契約も接続の手間も消した。争点はモデルの賢さからデータの入り口を誰が握るかへ移り、ChatGPT は金融の端末になりに来たとみられる。
Pickup2026-09-117: UMGとElevenLabsが複数年ライセンス契約、参加アーティストの楽曲をファンがリミックスできるAI音楽創作プラットフォームを立ち上げElevenLabsがメジャーレーベルと契約するのはこれが初めてで、ライセンスだけでなく製品の共同開発にも及ぶエキスパートエージェントの見解(β版)UMGは2025年10月にUdio、ワーナーは11月にSunoと、いずれも訴訟の和解とセットで契約した。ElevenLabsはレーベルから訴えられないまま2025年8月にMerlinやKobaltとライセンスを積み上げてきた側で、今回そこにメジャーが乗った。AI音楽の入場券は和解金から事前の許諾へ移ったが、公開時期も料金も未定で、枠組みが先に決まった段階だ。
OpenAI News2026-09-118: OpenAI、金融機関向け ChatGPT for Financial Services を提供開始。GPT‑6 Astra と金融データを内蔵組み込み済みのプレミアム金融データは、個別のデータ契約交渉もコネクタ設定も不要ですぐ使い始められるエキスパートエージェントの見解(β版)Anthropicは2025年7月に金融向けClaudeを出し、DaloopaやPitchBookと既につないでいた。では何が新しいのかといえば、データ契約を顧客ではなくOpenAIが結び、データを自前で抱えた点だ。設計にMorgan StanleyとEvercoreが入ったことも合わせ、競争の軸はモデルの賢さからデータ流通の主導権へ移ったとみられる。
OpenAI News2026-09-119: OpenAI、聞きながら話せる音声モデル GPT‑Live‑1 を API で提供開始。1分$0.05で、推論はバックエンドに委譲できるSpeak の初期評価では、学習者が考える時間が増え、従来のターン制システムに比べ割り込みが約80%減ったエキスパートエージェントの見解(β版)聞きながら話す方式は新しくなく、ByteDanceは4月にSeeduplexをDoubaoへ載せた。新しいのは考える部分を別モデルへ渡す設計で、1分$0.05は会話の層だけの値段、推論は別料金になる。音声モデルは「頭脳」から「受付係」へ降りたわけで、7月のChatGPT公開から2か月遅れのAPI開放は、競争が自然さから安さへ移った合図とみられる。
Pickup2026-09-1010: Anthropic、2030年の米国経済へのAIの影響モデルを公開。extremeシナリオでは年15%成長でも知識労働者の賃金と雇用が悪化成長が通常の2倍程度までのシナリオなら失業は歴史的な範囲に収まり、賃金は業種次第で横ばいか上昇するエキスパートエージェントの見解(β版)下書きに意見を寄せた顔ぶれには、AIによる生産性の伸びを10年で最大0.66%と見るアセモグル氏も並ぶ。2025年5月のアモデイ氏の失業率10〜20%予測が統計にまだ現れない今、確率を付けない3つの筋書きとして語り直したとみられる。GDPが3割増えても労働分配率が45.2%へ下がる以上、これは予測ではなく成長と取り分は別だという売り手自身の警告だ。
Pickup2026-09-1011: NSA・CISA・FBI、中国AI企業6社が Claude・GPT などから数十億トークンを蒸留と認定。米AI企業に3つの即時対応を勧告蒸留目的と判断した利用者には劣化モデルへの切り替えを知らせず、AI安全研究者や第三者評価者には知らせるよう求めているエキスパートエージェントの見解(β版)Anthropicは中国3社が偽アカウント2万4千超で1600万回超Claudeを使ったと公表済みで、政府もそれを認めた形だ。残る問いは見分けがつくのかで、24時間止まらない利用や契約直後の全開という兆候は、普通の企業の自動化と重なる。争点は中国ではなく、黙って品質を落とす運用を認めるかで、安全研究者にだけ知らせる線引きがその危うさを示すとみられる。
OpenAI News2026-09-0912: OpenAI が画像モデル ChatGPT Images 2.5 を全ティアに公開。生成レイテンシを Images 2.0 比で最大50%削減API には既定の GPT‑Image‑2.5 Flare と、生成は遅いが編集制御が緻密な Sunburst の2モデルを投入エキスパートエージェントの見解(β版)速い標準モデルと、遅いが細かく直せるモデルという二段構えは、GoogleがNano Bananaの通常版とPro版で先に作った形だ。なぜ今かといえば、画像生成が一発勝負から何度も直す作業へ移り、待ち時間が直した回数だけ積み上がるからだ。焦点は絵の美しさから直しの回転速度へ移り、OpenAIは先行するGoogleの型に追いついた側だとみられる。
Claude Blog2026-09-0913: Claude、claude-api skill に prompt-audit など3コマンドを追加。ベンチマークでコスト約52〜73%減最新モデルに移ったら、確認の念押しや徹底さを求める旧世代向けの指示は削るのが基本、残すと性能まで落ちるエキスパートエージェントの見解(β版)モデル移行時のプロンプト書き直しは、AWSが2026年5月にBedrockへ移行ツールを載せるなど既に業界共通の作業だった。ベンチマークの52〜73%減はキャッシュやバッチを束ねた数字で、旧世代向け指示を削る効果だけなら同社検証でコスト14.6%減・精度5.3%向上だ。プロンプトは資産ではなく、モデル更新のたびに払う保守費になったとみるべきだ。
Artificial Analysis2026-09-0814: Artificial Analysis、Intelligence Index v4.3 で Claude Fable 5.1 と GPT-6 Astra が 53 の同点首位。タスク単価は Astra が 57% 下回った全目的をガードレール違反なく完遂できた業務ワークフローは Astra で 41.6%、Fable 5.1 で 32.1%エキスパートエージェントの見解(β版)9月4日のv4.2からわずか3日での手直しで、Epoch AIが別の指標でAstraを首位に置いた直後でもあった。短い間隔で指標を組み替えるのは、総合点が上位を見分けられなくなったからで、53点の同点がその表れだろう。勝負は点数でなく、1タスク3.26ドル対7.63ドルの値段と、首位でも業務をやり切れたのが41.6%という現実に移った。
OpenAI News2026-09-0715: OpenAI、自社計測で「自動研究インターン」の目標に到達 人間1労働日あたり3.1エージェント労働日を使用直近6ヶ月で成功した4〜8時間タスクの半数超は人間の介入を1回以上伴い、なお相当な舵取りが必要エキスパートエージェントの見解(β版)この夏、プリンストンらが未公開のNeurIPS課題でAIに6日と3千ドルを与えた検証では、出た論文を出題者本人が却下した。なぜ今「到達」なのかと言えば、9月という期限自体をアルトマンが昨秋に自ら設けたからで、出題者も採点者もOpenAIだ。3.1は使った量にすぎず、直近半年の4〜8時間タスクでは成功例の半数超に人の手が入ったという方が実力に近い。