Google Research BlogGoogle Research、GeminiとVeo上で動くマルチエージェント枠組みを発表。一貫性を保った数分規模の動画を自動生成動画全体を一括で最適化し、人物・場所・物の状態を記録し続ける設計で、ショット間で衣装や背景が変わるずれを抑えるエキスパートエージェントの見解(β版)GoogleのAPI文書では、Veo 3.1は1本8秒で、延長を重ねても最大148秒にとどまる。それでも同社の研究チームいわく10分の連続動画を作れたのは、モデル自体より、人物や背景の状態を書き留める記録係を外側に置く設計が効いたからとみられる。動画AIの勝負は画質から、長い物語を崩さず管理する「制作進行」へ移りつつあるとみられる。
Google Research BlogGoogle Research、機密を明かさずミドルマイル物流の現実的なベンチマークを生成する「MilleMiglia」をオープンソース化荷物が中継拠点で複数の車両を乗り継ぎ、数日かかることも多いため、既存の配送計画(VRP)ソルバーは使えないエキスパートエージェントの見解(β版)ラストマイルでは2021年にAmazonが実際の配送ルートを匿名化して公開したが、今回は実データを出さず統計から物流網を作る逆の道だ。なぜ今かといえば、Googleはミドルマイル向け最適化APIを一部の提携先に試験提供中で、自社ソルバーを測る物差しが先に要るからとみられる。研究者への贈り物にとどまらず、問題を作る側と解く側を兼ねて土俵を押さえる一手だ。
Google Research BlogGoogle Research、生成UIで教師がカリキュラムに合わせた対話型シミュレーションを作成可能に。STEM向け30本超のライブラリを公開任意のSTEM概念での新規生成依頼はGoogle Workspace for Education利用校のパイロット参加が条件エキスパートエージェントの見解(β版)理科の教材シミュレーションは、2002年から続くPhETが125本超を無料で配ってきた分野だ。なぜ今かといえば、2025年11月のGemini 3で登場した生成UIが検索にも広がり、その応用先として教育が選ばれたとみられる。教材が棚から選ぶものから注文して作らせるものへ変わる合図であり、公開の30本超は見本、本命はパイロットでの囲い込みだろう。
Google Research BlogGoogle Research、検索の query fan-out を拡散モデルに蒸留する Retrieve-for-Train を発表。自己回帰比 12〜20 倍高速検索品質は落とさず、入念に最適化された Best-of-N ベースラインも両方の検索タスクで上回ったエキスパートエージェントの見解(β版)Googleは6月にDiffusionGemmaも出しており、文章生成から検索の裏側まで拡散モデルに賭けている。なぜ今かといえば、AI Modeでは一つの質問がいくつもの細かい検索に分かれ、遅さがそのまま待ち時間と費用に化けるからだろう。53.9Mという小ささが示すのは、賢さを推論時に買う路線から訓練時に前払いする路線への転換であり、速度は副産物にすぎない。
Google Research BlogGoogle Research、ツール利用データを答え先行で生成するToolGradを開発。12BモデルがBFCLで83.1を記録gemini-2.5-pro の83.2、claude-4.5 Opus の82.8 に並び、gpt-5 の74.4 を上回るエキスパートエージェントの見解(β版)答えから問いを逆算する発想はMetaが2023年に示した手法の延長で、6万件を検証で揃えたSalesforceに対し、ToolGradは500回の生成で済ませた。驚くべきは83.1という点数より、道具の使い方が500件で移せる「作法」にすぎないと示したことだ。ただし評価はBFCLの単発呼び出し(v1/v2相当)に限られ、道具利用の値崩れの始まりとみられる。
Google Research BlogGoogle Research、UK Biobankからの転移学習PRSはBiobank Japanのサンプル15,000超で精度が低下集団間で遺伝の似た形質は2万5千〜4万人超まで欧州データ併用が有利な一方、脂質や血糖はより少ない人数で逆転エキスパートエージェントの見解(β版)今年1月のNature Communicationsは、All of Usのアフリカ系で転移学習が自前データだけの手法を200%超上回ったと報じた。だが分かれ目の15,000人は低く、約20万人のBiobank Japan自身がとうに越えた線だ。欧州データは解決策ではなく自前のデータが育つまでの足場であり、問いは「いつ手を離すか」へ移ったとみられる。
Google Research BlogGoogle Research、オスのショウジョウバエの脳と中枢神経系の完全な配線図を公開 16万6,000超のニューロンで現時点最大の脳地図配線図はオープンソースの可視化ツールNeuroglancerで閲覧・探索・ダウンロードできるエキスパートエージェントの見解(β版)2024年のメス脳地図FlyWireは約14万ニューロンで脳だけだったが、今回は体を動かす腹側神経索まで含む初の完全な中枢神経系だ。電子顕微鏡による配線図づくりはNature Methodsの2025年「今年の手法」に選ばれ、焦点は作れるかから比べられるかへ移った。最大の脳地図という看板より、オスとメスを配線で比べる比較解剖学の起点と呼ぶべきだ。
Google Research BlogGoogle Research と NASA JPL、メタン点源を自動検出する MAPL-EMIT と全球プルームデータベースを公開NASA の標準データセットとの比較で、専門家が確認したプルームの84%を捉え、約50%多いプルーム候補を追加検出エキスパートエージェントの見解(β版)8,800万ドルのMethaneSATが2025年6月に失われ、メタン監視は新しい衛星より既存の機材をソフトで伸ばす流れに移った。検出が増えれば漏れが止まるわけではなく、国連IMEOの通報システムMARSでは2025年の応答率が12%超、9割近くは無反応のままだ。見つける力は無料の公共インフラに変わり、足りないのはセンサーではなく現場を動かす仕組みだ。
Google Research BlogGoogle Research、多変量予測をネイティブ対応した時系列基盤モデル TimesFM-3 を公開。3ベンチマークでトップランク外部データや他系列の情報を使わない単変量モードのままでも、既存の競合基盤モデルに匹敵か上回るエキスパートエージェントの見解(β版)同じGIFT-EvalとFEV-Benchの首位は、先にAmazonのChronos-2が主張していた。なぜ今多変量かといえば、単変量の精度はもう横並びで、販促や天候を扱えるかに差が移ったからだろう。しかもTimesFM-3の重みは非商用・非本番限定で、Apache 2.0のChronos-2とは土俵が違い、ベンチ首位と現場投入は別物だ。
Google Research BlogGoogle Research、自然言語から地理空間モデルを自律構築する PPE を発表。CDC 21健康指標で平均R² 76.8%と専門家の手作業を上回ったDRCのエボラ流行の週次予測で新たに感染が及んだ18保健区のうち15を的中させ、既存最高のベイズモデルを10.3ポイント上回ったエキスパートエージェントの見解(β版)衛星の基盤モデルはもう独占物ではなく、NASAとIBMのPrithviは2023年に公開され軌道上でも動いた。希少なのはモデルではなく、どのデータを選ぶかという判断で、PPEはそこを自動化しにきたとみられる。DRCではエボラワクチン7万回分の割り当てが決まり初回16,250回分が届いた段階で、次の保健区を当てる予測は「どこに配るか」の指示に変わる。
Google Research BlogGoogle Research、血糖トレンドと短期変動を分離する CGM 基盤モデル GlucoFM を公開。14 評価の平均 PR-AUC を 54.7 から 58.8 に改善ラベルがクラスあたり1人、観測の1%という最も少ない条件でも平均PR-AUCは他手法を上回ったエキスパートエージェントの見解(β版)2026年Nature掲載のGluFormerが1万812人分で学習したのに対し、GlucoFMの事前学習は477人分と桁が違う。処方箋なしで買えるDexcom SteloやLingoが広がり、測る人は増えても臨床ラベルは増えない——少ラベルでの強さが今の焦点だ。競争軸は集めた人数から信号の分け方へ移ったとみられるが、論文が公開を約束したのはコードまでで、重みは含まれていない。
Google Research BlogGoogle、XRの会話エージェントに発話と同期する手のジェスチャーを与える「AgentHands」を発表。12人の調査で物体の位置特定が有意に改善LLMが応答内にトリガー語と結びついたジェスチャー指示を埋め込み、単語単位の時刻情報で発話と手の動きを同期させるエキスパートエージェントの見解(β版)発話に合わせた身振りの自動生成は新しくなく、2001年のBEATが入力文からルールで手と声を同期させていた。今なのは、2025年10月発売のGalaxy XRでGeminiが端末に組み込まれ、AIが同じ部屋を見る前提が実機に載ったからだ。AgentHandsはアバターの復活ではなく、手だけを切り出した「空間版のマウスカーソル」で、12人の検証は方向の確認どまりとみられる。
Google Research Blogモビリティが言語モデルに場所のより深い理解をもたらす方法言語モデルによる場所の理解に、匿名化された移動データを組み合わせる新フレームワーク「ME-POIs」を発表した訪問意図の予測で最大81.9%、価格帯分類で75.1%、混雑推定で24.7%の精度向上を未知の場所で確認データが少ない小規模店舗には、周辺の近隣施設の移動パターンを統計的に転用して補完する仕組みを採用エキスパートエージェントの見解(β版)Foursquareは2024年11月に1億超の地点データを無償公開し、「場所が何か」はほぼタダになった。差がつくのは「どう使われるか」で、Googleは2025年に位置履歴を端末内へ移しウェブ版も廃止したため、まとめた人の動きはむしろ手に入りにくい。混雑の表示は2015年からある機能で、伸びが最大だったのが訪問意図の81.9%という点に本当の狙いが出ているとみられる。
Google Research Blogウェアラブルセンサーデータから候補バイオマーカーを優先順位付けするためのAIツールウェアラブルセンサーデータからバイオマーカー候補を優先順位付けするマルチエージェントシステム「Biomarker Discovery Framework」を発表した計9,279件の参加者観察を含む3コホートに適用し、精神的健康分野で41件、代謝疾患分野で25件のデジタルバイオマーカー候補を特定した15名の専門家による盲検評価で全7品質次元において最高スコアを獲得し、生成したレポート内容の平均56.9%が保持に値すると評価された(比較システムは18.8〜30.4%)エキスパートエージェントの見解(β版)FDAが制度発足以来に正式認定したバイオマーカーは8件、そのうちセンサー由来のデジタル指標はゼロだ。候補を作る手間が安くなった今、詰まる場所は検証と規制の側へ移っており、だからこの手の道具が先に出てくるのだとみられる。専門家が残したのは56.9%で、これは発見の自動化というより下書きの自動化に近く、認定の壁を崩す力はまだ別の話だ。
Google Research Blogスマートフォンの画像でBMIを超えた心臓代謝リスクを推定するスマートフォンの写真から体組成を推定し、インスリン抵抗性を予測する深層学習手法「PhotoScan」を開発したAUROCは人口統計ベースラインの0.692から0.760へ改善し、DXAスキャン(0.773)に近い精度を達成した内臓脂肪比率(A/G比・V/S比)を推定できる点がBIAセンサーにはない強みで、これらがインスリン抵抗性予測に重要な特徴量となっているエキスパートエージェントの見解(β版)スマホ写真から体脂肪を測る発想自体は新しくなく、Amazonが2020年のHaloで商品化し2023年7月に終了している。なぜ今かといえば、今回スマートウォッチのBIAはベースラインをまったく改善できず、狙いが脂肪の量から付く場所へ移ったからだ。見た目の数字を捨て、脂肪の付き方の偏りという臨床寄りの指標を取りに行った転換点だが、検証は132人規模の研究段階にとどまる。
Google Research Blog棚が空っぽ、それとも鍵をなくした?想起こそがパラメトリックな事実性のボトルネックである最先端のLLMは事実をほぼ全てエンコード済みだが、想起(recall)に失敗することが判明したGemini-3-ProとGPT-5では95〜98%の事実がエンコードされているにもかかわらず、26〜34%の事実を直接想起できない「思考(thinking)」機能はエンコード済みで想起できない事実の約40〜65%を回復できるが、未エンコードの事実には効果が薄いエキスパートエージェントの見解(β版)2023年の「逆転の呪い」は同じ失敗を学習の欠落と見たが、本研究はそれを取り出しの失敗として読み替えた。事実の95〜98%が既に入っているなら、学習データを増やしても事実性は伸びず、伸びしろは推論時の計算側に移るだろう。幻覚の正体は知識の欠落ではなく取り出し口の詰まりで、OpenAIが2025年に示した「評価が当て推量を促す」説と並ぶ、もう一つの診断軸とみられる。
Google Research BlogAMIEを専門家レベルの視聴覚による臨床診察に向けて進化させるGoogleのAMIEがリアルタイムビデオ診察に対応し、模擬診察の無作為化比較試験で専門医と同等の性能を示した会話・臨床推論・視聴覚認識を並列処理する3エージェント構成により、自然な応答速度と診断精度を両立している患者俳優との模擬環境での結果であり、実際の患者での検証が実用化判断に不可欠な次のステップとされているエキスパートエージェントの見解(β版)Microsoftは2025年、MAI-DxOがNEJM症例で85.5%、医師は20%と発表したが、医師側は同僚や資料の参照を禁じられていた。動画での実患者検証が次の関門だが、Googleはテキスト版なら実患者100人の試験を2026年3月に公表済みで、空白は形式の差に絞られている。模擬患者を使う比較試験はもう限界で、勝負は診断精度から現場での運用へ移ったとみられる。
Google Research BlogAI生成論文、参考文献の最大21%が実在せず——Googleの新方式はゼロにAIが自動生成した論文75本を検査したところ、一部のシステムでは参考文献の最大21%が実在しない論文だった。 Googleの試作はこれをゼロにしている。文献を記憶から書き起こさせず、外部の学術データベースから取得したものだけを使うからだ。 AI自身の記憶、知識に頼らないことが、この種の誤りを消す近道になる。
Google Research BlogSymptomAI: 日常的な症状評価のための会話型AIエージェントの実現に向けてGoogleがGemini Flash 2.0を使った会話型AI症状チェッカー「SymptomAI」の大規模研究を実施した参加者13,917人を対象とした無作為化試験で、AIが生成した鑑別診断は50%超の事例で臨床医のものより高く評価されたAIが積極的に追加質問を行う設計が精度向上に有効で、Fitbitの生体データとの相関でもAI診断の妥当性が確認された
Google Research Blog誤りから学ぶ量子コンピュータの実現に向けて量子コンピュータの計算中に強化学習でパラメータを自動補正するフレームワークをNatureで発表したWillowプロセッサでのRLチューニングにより、論理エラー率をさらに20%抑制し、エラー訂正サイクル1000回あたり1回未満という最低記録を達成した数百量子ビット・数万制御パラメータのシミュレーションで、RLの学習に必要な反復回数がシステム規模に依存しないことを確認し、大規模化への見通しを示した