注目トピック🔥

Claude Blog

1: フロンティアで働く:CognitionがClaude Fable 5を信頼して夜通し作業させる理由

  • AIソフトウェアエンジニア「Devin」を開発するCognitionが、Claude Fable 5で自社ベンチマークのスコアが約10%から約30%に向上したと報告した
  • 従来モデルでは数分〜1時間が限界だった継続作業が、Claude Fable 5では8時間以上安定して続けられるようになった
  • 開発チームは「1〜2年以内にエージェントによる自律的な問題発見・修正が標準になる」と見込んでいる
Claude Blog

2: Claude Fableフィールドガイド:未知の要素を見つける

  • Claude Codeを使った開発作業で、事前・実装中・実装後に「未知の不明点」を発見するための具体的な手法が紹介された
  • 指示が詳細すぎても曖昧すぎても失敗するため、自分の「気づいていない盲点」をClaudeと協力して明確にすることが鍵になる
  • ブレインストーミングやインタビュー・実装計画といった段階を踏むことで、修正コストが高くなる前に問題を発見できる
xAI News

3: Voice Agent Builderのご紹介

  • コードなしで音声AIエージェントを約2分で構築できる「Voice Agent Builder」がベータ公開された
  • 音声認識・言語モデル・音声合成を別々に組み合わせる従来構成と異なり、一体型で遅延とコストを削減できる
  • 料金は音声通話1分あたり$0.05と明示されており、複数の課金項目が重なる他サービスとの違いを強調している

4: Geminiアプリで学習ノートを作成する方法はこちら

  • Geminiアプリに、個人の理解度に合わせた学習機能「study notebooks」が追加された
  • 学びたい内容を伝えると、小分けのレッスンや練習クイズで効率よく習得できる
  • 進捗をダッシュボードで確認できるため、何を優先すべきか判断しやすい設計になっている
OpenAI News

5: GPT-5.6がMicrosoft 365 Copilotの優先モデルに

  • GPT‑5.6がMicrosoft 365 CopilotのWord・Excel・PowerPoint・Coworkの標準モデルになった
  • 毎日使う業務ツールに最新AIが組み込まれ、より少ない操作で高品質な成果物を得やすくなる
  • OpenAI APIを通じた提供により、既存ツールの枠組みのままAI活用を深められる構造となっている

6: GPT-5.6のベンチマーク:知性、速度、コストの比較

  • GPT-5.6シリーズ(Sol・Terra・Luna)が公開され、コーディングや文書作成など複数の評価で高い成績を記録した
  • Claude Fable 5とほぼ同等の性能をSolは約3分の1のコストで提供でき、用途に応じてモデルを使い分けられる
  • OpenAIとして初めてキャッシュ書き込み料金が導入され、価格体系がより実際の処理コストを反映する仕組みに近づいている
OpenAI News

7: GPT-5.6:あなたの野心に応じてスケールするフロンティアインテリジェンス

  • GPT‑5.6ファミリー(Sol・Terra・Luna)が一般公開され、コーディングや科学・サイバーセキュリティなど広範な分野で最高水準の性能を記録した
  • 競合モデルと比べて使用トークン数や処理時間・コストを大幅に削減しながら高い性能を実現しており、コストあたりの成果が向上している
  • 安全対策にも約70万A100e GPU時間の自動テストを含む過去最大規模の評価を実施しており、能力向上と安全性強化を同時に進める姿勢が示されている
OpenAI News

8: ChatGPTは、あなたの最も野心的な仕事のパートナーになった

  • ChatGPT Workが発表され、複数のアプリをまたいで資料作成や長時間の複雑な業務を自律的に実行できるようになった
  • チャットへの返答にとどまらず、業務の一連の流れを代行して完成物を生み出す段階に移行した
  • 社内テストでは財務や営業の業務にかかる時間が大幅に短縮されており、知識労働の進め方が変わりうることを示している
Dify Blog

9: Dify公式CLI「difyctl」がリリース

  • バージョン1.15.0でコマンドラインツール「difyctl」が導入され、スクリプトやAIエージェントからDifyアプリを直接呼び出せるようになった
  • ブラウザ操作が前提だったDifyアプリが、コマンド一つで自動化パイプラインやAIエージェントから呼び出せる汎用ツールになった
  • AIエージェントが既存の業務システムを直接操作する流れが広がる中、CLIという安定した接続口を持つことが実用上の重要性を増している
Anthropic News

10: Claudeの使い方を振り返るための新機能のご紹介

  • ClaudeのWebおよびデスクトップ版に、自分の利用状況を振り返るダッシュボード機能がベータ公開された
  • 過去12ヶ月の利用傾向や作業内容を可視化し、休憩リマインダーや静音時間の設定もできる
  • プライバシーへの配慮や専門機関との連携が示すように、AI利用を自分でコントロールする意識を促す設計になっている

11: Grok 4.5がSpaceXAIを知能の最前線へと導く

  • Grok 4.5がリリースされ、知能指標でGrok 4.3より16ポイント向上した
  • OpenAIとAnthropicに次ぐ性能を持ちながら、同等モデルの5分の1以下のコストで動作する
  • 精度は上がった一方で幻覚率も上昇しており、高性能化に伴うトレードオフが残る

12: 社内データ分析エージェントの構築方法

  • 社内向け分析エージェント「Qubot」を構築し、SlackやVS Codeから自然言語でデータ照会できるようにした
  • 専任アナリストなしに誰でもデータ倉庫を探索できるようになり、Slackでの質問数が大幅に減少した
  • 整理されたコンテキスト情報が回答精度を高め、正答到達速度を3倍にすることがわかった
OpenAI News

13: コード評価におけるシグナルとノイズの分離

  • SWE-Bench Proの731タスクを詳細に調査した結果、約30%のタスクに欠陥があると判明した
  • テストの条件が厳しすぎたり、問題文と採点基準がずれていたりして、正しい回答が不正解になるケースが多数存在する
  • 以前に推奨したSWE-Bench Proの採用を撤回し、開発者向けに設計された新たな評価基準の整備を求めている
Cursor Blog

14: Grok 4.5 のご紹介

  • SpaceXAIと共同開発したGrok 4.5をリリースし、Cursorの全プラットフォームで利用可能になった
  • コーディング特化だった従来モデルから拡張し、金融・法務・データサイエンス等の幅広い知識労働に対応できる
  • 数兆トークン規模の学習データと分散エージェントによる強化学習を組み合わせた開発手法が、今後のモデル改良の基盤になっている
xAI News

15: Grok 4.5 のご紹介

  • Grok 4.5がリリースされ、CursorやGrok Buildなどで利用可能になった
  • コーディングや業務効率化に特化し、同等モデルの約2倍のトークン効率を実現している
  • 入力100万トークンあたり2ドルという価格設定で、処理速度と低コストを両立させている

16: このコーヒーショップがGeminiで成長している3つの方法

  • サンフランシスコのコーヒー店主がGeminiを活用し、売上管理・資料作成・メルマガ業務を効率化した
  • 高額なソフト不要で日次売上レポートを構築し、制作物は従来比95%速く作れるようになった
  • 専門知識がなくても日常言語でAIに指示するだけで、小規模店舗でも業務自動化が実現できる
OpenAI News

17: GPT-Liveのご紹介

  • 会話中に同時に聞きながら話せる新音声モデル「GPT‑Live」が、ChatGPTの音声機能として世界向けに提供開始された
  • 従来の音声モードより会話の自然さ・賢さ・安全性が向上し、週1億5千万人以上が使う音声機能の体験が刷新される
  • 背景に複数モデルの委譲構造を持つ設計により、音声での複雑な作業対応や常に最新モデルへの更新が可能な仕組みが整えられている
OpenAI News

18: Australian Payments PlusがChatGPTとCodexで開発スピードを加速

  • オーストラリアの決済インフラ企業AP+がChatGPT EnterpriseとCodexを全社導入した
  • 調査時間の短縮や業務品質の向上など、技術・企画・運用の各分野で具体的な成果が出ている
  • 規制の厳しい金融業界でも、ガバナンスを整備しながらAIを段階的に広げられることを示している
OpenRouter

19: LLMにおける最適な画像入力詳細レベルの選び方 — OpenRouter Blog

  • 画像入力の解像度設定(低解像度vs自動)を複数モデルで比較検証した結果、全モデルで自動設定の精度が上回り、一部では費用も安かった
  • 推論機能を持つモデルでは低解像度設定が逆効果で、不鮮明な画像を補おうと余分な推論トークンが増え、精度と費用の両面で損をする
  • 費用を抑えたい場合は画像解像度を下げるより推論レベルを下げる方が効果的で、推論なしモデルに限り低解像度設定が有効な節約手段になる
Claude Blog

20: Claude Codeでのモデルと処理レベルの選び方

  • Claude Codeには「モデル選択」と「努力レベル」の2つの設定があり、それぞれ異なる働きをする
  • モデル選択は知識・能力の上限を決め、努力レベルは読むファイル数や検証の深さなど作業量を制御する
  • 結果が外れた際は、知識不足ならより大きなモデルへ、手抜きが原因なら努力レベルを上げると改善しやすい