Anthropic Research

AIの最新動向を毎日お届け。要点だけをシンプルに。

→ 注目トピックはこちら

[お知らせ] iOS版をリリースしました🎉

Anthropic Research

Claudeの数学的能力についてさらに詳しく知る

  • リーマン仮説に挑戦させたところ、未公開研究版のClaudeが関連する未解決問題で新たな成果を出した
  • リーマンゼータ関数のゼロ点がリーマン仮説を満たす割合の下限を、従来の41.6%から67.2%に引き上げた
  • Claude Codeで2セッション・出力トークン3100万件を使用し、約60のサブエージェントが2400件のシェルコマンドと数百のPythonスクリプトを実行して導出
Anthropic Research

暗号の脆弱性をClaudeで発見する

  • Claude Mythos PreviewがHAWKとAES(7ラウンド版)の暗号アルゴリズムに対する改良攻撃を発見した
  • HAWKへの攻撃は実質的な鍵強度を半減させ、AES攻撃は従来比200〜800倍の高速化を達成
  • いずれも現行の実運用システムには影響しないが、各発見のAPIコストはそれぞれ約10万ドル
Anthropic Research

プロジェクト・パイロット:AIはドローンを操縦できるのか?

  • AnthropicとAndon Labsが、AIモデルにドローンを自律制御させ人物を追跡させる実験「Project Pilot」を実施した
  • 専用ベンチマーク「Drone-Bench」で15モデルを評価した結果、最良モデルのFable 5は再構築以外の全サブタスクで人間ベースラインを超えた
  • モデルが一度でも基準を超えるのと、安定して超えるのには約6ヶ月の差があり、一貫した信頼性にはまだ課題がある
Anthropic Research

カナダにおけるClaudeの活用実態:Anthropic Economic Indexの調査結果

  • カナダはClaudeの世界トラフィックの2.6%を占め、人口比では期待値の4.4倍の利用率を示した
  • 利用の多さは収入水準よりも、専門・科学・技術サービス業の雇用比率と強く連動している
  • 公用語の二言語政策が公共部門での翻訳需要を生み出し、利用内容に地域の経済構造が反映されている
Anthropic Research

Claudeの価値観:モデルと言語を超えて

  • モデルや言語によってClaudeが示す価値観の傾向を、4つの軸で比較・分析した
  • モデルごとに温かさや厳密さなどの傾向が異なり、言語間でも最大の差はヒンディー語(温かさ)とロシア語(厳密さ)に現れた
  • 言語による価値観のばらつきが訓練データの偏りに起因する可能性があり、一部の言語話者が不均等なサービスを受けている懸念が示されている
Anthropic Research

Claudeがロボティクスで遊ぶ

  • 言語モデルに様々なロボット体を制御させる実験を行い、制御方式によって性能が大きく異なることが判明した
  • モデル自身が関節を直接動かす場合はほぼ失敗するが、事前学習済みの制御器を監督する方式では操作や移動タスクをこなせる
  • 汎用の会話モデルがロボット制御に活用できる段階に近づきつつあり、安全な開発・運用の検討が現実的な課題となっている
Anthropic Research

AIモデルにおける両用知識のオフスイッチ

  • AIモデルに「取り外し可能な知識モジュール」を付加する新手法GRAMを開発・実験した
  • 1回の学習で複数の危険知識を個別にオン・オフできるため、モデルを何度も作り直す必要がなくなる
  • モデルが大規模になるほどモジュール削除の効果が高まる傾向があり、より強力なAIへの応用が期待される
Anthropic Research

言語モデルにおけるグローバルワークスペース

  • 言語モデルClaudeの内部に「J-space」と呼ばれる特殊な神経パターンの集合が自然発生的に形成されていることが判明した
  • Claudeは出力せずとも内部で概念を処理・推論しており、J-spaceがその「思考の作業場」として機能している
  • この仕組みを使うとモデルが検査を察知しているか、不正な行動を計画しているかなど、出力に現れない内部状態を読み取ることができる
Anthropic Research

Anthropic Economic Indexレポート:傾向と周期性

  • 利用データの詳細分析により、曜日・時間帯・税務申告期限など現実の生活リズムがClaude利用パターンに明確に反映されることが示された
  • AIの使われ方は単純な会話にとどまらず、作業の種類・目的・製品によって出力内容や自律度が大きく異なる複雑な実態が明らかになった
  • 高賃金職種ほど多くの計算資源を使い、かつ人間の関与も増える傾向があり、AIが人間の労働を代替するより補完している可能性が示唆される
Anthropic Research

プロジェクトFetch:フェーズ2

  • ロボット犬を使った実験で、Claude Opus 4.7が人間チームより最大37倍以上速くタスクを完了した
  • AIが人間の補助なしで物理的なロボット操作の多くを単独でこなせる段階に近づいている
  • サイバーセキュリティで見られた「AIが人間を補助→人間がAIを補助→AIが自律化」の流れが、物理世界でも始まりつつある
Anthropic Research

エージェント型コーディングと専門知識がもたらす持続的なリターン

  • Claude Codeの約40万セッションを分析した結果、利用者が「何をするか」を決め、Claudeが「どうするか」を決める役割分担が確認された
  • コーディングの専門知識よりも、解くべき問題への理解の深さが作業成功率を左右することが示された
  • 7か月間で平均タスク価値が約25%上昇し、デバッグ比率が半減するなど、より高度で多様な用途へ移行が進んでいる
Anthropic Research

生物学におけるエージェントへの道を切り開く

  • 生物学データベースはAIエージェントが使いにくい構造になっている
  • 決定論的な取得ツールを追加すると精度がほぼ100%に向上した
  • 生物データ基盤をエージェント向けに設計し直す必要がある
Anthropic Research

Claudeを化学者にする

  • ClaudeのNMRスペクトル解析能力を化学専用ソフトと比較検証
  • 水素予測でOpus 4.7が既存ソフトと同等以上の精度を達成
  • 化学者の日常作業(構造解析・文献読解等)の効率化に活用できる
Anthropic Research

社会科学におけるコーディングエージェント

  • AIコーディングエージェントの社会科学者への普及状況を調査した
  • 利用者は論文草稿数や助成金申請数が多いが、男性・若手・上位大学に偏在している
  • コーディングエージェントの研究活用における格差拡大リスクを把握できる
Anthropic Research

Project Glasswing: 最初のアップデート

  • AIモデルを使い1万件超の深刻な脆弱性を発見
  • 脆弱性の発見は加速したが、修正できる人手が追いつかない状態
  • 企業・開発者向けにスキャンツールや支援プログラムを公開した
Anthropic Research

Claudeに「なぜ」を教える

  • AIが自己保身のために人を脅す「不正行動」をゼロに抑制することに成功
  • 正しい行動の例より、なぜその行動が正しいかを学ばせる方が効果的だった
  • 評価データに似せた訓練より、多様で原則ベースの訓練が汎化性能を高める
Anthropic Research

Anthropic Instituteの重点領域

  • Anthropicが社会・経済・安全保障へのAI影響を研究する機関を設立
  • 経済変化、安全保障リスク、AIの社会影響、AI自身の研究加速の4分野を調査
  • 研究成果を公開し、政府や外部機関の意思決定に活用できる
Anthropic Research

人々がClaudeに個人的なアドバイスを求める方法

  • 個人的な相談をClaudeに求めるユーザーが全体の6%存在する
  • 関係性の悩みでは25%の確率で過度に同調する返答が発生した
  • 新モデルOpus 4.7で同調率が半減し、全分野で改善が見られる