Thinking Machines LabThinking Machines Lab、スキャフォールドなしの text-to-SQL モデル ReViSQL-K2.6 が 92.97% で人間を初めて上回ったスキャフォールドは基盤モデルの能力という天井にぶつかり、そこに込めたタスク知識は訓練信号の側に入れるべきだと主張エキスパートエージェントの見解(β版)Tinkerという学習APIを売る同社がUIUCのKangらと組んだ成果で、超えた92.96%はBIRD付属の人間の代理値にすぎない。動いたのはモデルより物差しの側で、彼らが評価データの52.8%の誤りを直したことが効いている。だが1回生成なら91.37%、超えたのは16本の多数決(1件0.56ドル)の時だけで、外付けを畳み込んだ話の最後の一押しが外付けなのは皮肉だ。
Thinking Machines Lab安全性研究助成金の発表オープンウェイトモデルの安全性研究を対象に、最大5万ドル相当のクレジット「Tinkerグラント」を開始した研究対象は「防御・攻撃能力の非対称な強化」「訓練データのフィルタリング」「改ざん耐性のある安全訓練」「報酬ハッキングの検出」など多岐にわたる公開後のモデルが悪意ある微調整を受けた際の最悪リスク推定や、スケーリングによる安全性変化の予測も重点テーマとして挙げているエキスパートエージェントの見解(β版)OpenAIが2025年8月、公開直後のgpt-ossに賞金50万ドルで弱点探しを募ったように、開けた側が守りを外に委ねる型はもう定番だ。Thinking Machines自身も7月にInklingを開いており、今回はその後始末にあたる。5月の対話性研究には現金10万ドル+クレジット2.5万ドルを出したのに安全性はクレジットだけで、守りの値付けに本音が出ているとみられる。
Thinking Machines LabInkling-Smallのご紹介Inkling-Smallがリリースされ、Inklingの4分の1のサイズで同等の性能を達成した総パラメータ数276B・アクティブ12BのMixture-of-Experts構造で、推論やコーディングのベンチマークではInklingを上回る結果も出たフルウェイトを公開し、Tinkerでのファインチューニングおよびテキスト・画像・音声チャットにも対応している
Thinking Machines Labインタラクティビティ研究助成金の発表人間とAIのリアルタイム協調を高める「インタラクティビティ研究」を対象に助成金を公募した1件あたり10万ドル(加えてTinkerクレジット2万5千ドル)を複数件付与し、応募締切は2026年6月19日評価手法の開発、マルチモーダル安全性、生成UIによる説明、長期タスク中の人間による操作介入などが想定テーマ
Thinking Machines Lab金融タスクにおける専門家の判断を再現する学習汎用LLMは投資家向けの情報フィルタリングタスクで精度約50〜78%にとどまり、実用水準を下回った専門家によるアノテーションで学習した独自モデルは平均精度84.7%を達成し、最良の汎用モデルより誤りを29.8%削減した独自モデルは小型のため推論コストが汎用モデルの13.8分の1に抑えられ、組織全体へのAI展開を現実的にする
Thinking Machines LabInkling: オープンウェイトモデルのご紹介「Inkling」という総パラメータ975B・有効41BのMoEモデルをフルウェイト公開したテキスト・画像・音声をネイティブに処理でき、思考量を調整してコストと性能をバランスできるファインチューニング基盤としての活用を想定し、TinkerプラットフォームでのFTと各社APIを通じた推論に対応