Hugging Face BlogLiquid AI、LFM2.5-VL-3B向けドラフトモデル「LFM2.5-VL-DSpark」を公開。デコードを最大3.13倍高速化画像の符号化と入力の読み込みは速くならず、応答全体では端末で最大2.62倍、H100で最大2.27倍にとどまるエキスパートエージェントの見解(β版)小さな下書きモデルが先に書き本体がまとめて確かめる手法を、Liquid AIは8月にテキスト版で出しており、今回はその画像版への横展開だ。なぜ今かといえば、端末の小型モデルでは答えを書く時間が待ちの大半を占めやすく、そこを削るのが一番効くからとみられる。つまり速さの勝負は文字を書く側から画像を読む側へ移り、次の焦点は画像処理の短縮になるとみられる。
Hugging Face BlogHugging Face、SO-101アームのMuJoCoシミュレーションをMJWarpで最大2,048並列のGPU環境へ移行する手順を解説利点は1ワールドの高速化ではなく多数を一括で進める総スループットで、単一ロボットのMPCやテレオペはCPU版MuJoCoが基本エキスパートエージェントの見解(β版)NVIDIAは既にSO-101をIsaacで学ぶ講座を持ち、MJWarpもGoogle DeepMindと共同で保守している。今これを出すのは、100ドル台で組める安いアームにも大手研究所並みの並列学習を届けるためとみられる。記事いわく最大2,048並列の価値は速さより試行の数で、安いロボットの勝負はおそらく実機の数からシミュレーションの量へ移る。
Hugging Face BlogNVIDIA、1億パラメータの話者ダイアライゼーションモデル「Nemotron 3 Diarization」を公開。最大8話者に対応Voice ArenaのDiarization-Benchで1位。話者判定の誤り率(DER)は14.72%で、2位の19.3%を下回ったエキスパートエージェントの見解(β版)話者分離の大手pyannoteAIも9月22日に新モデル「Precision-3」を出したばかりだ。音声AIが会議や通話にその場で加わり始め、「誰が話したか」の聞き分けが次の争点になったのが今の理由とみられる。プレビュー版は評価専用ライセンスで本番利用を禁じ、Voice Arena測定の1位(9月時点)もおそらく一時的な「予告編」にすぎない。
Hugging Face Blog英AISI、EvalEvalの基盤で6モデル・5ベンチマークの評価結果を設定情報付きで公開評価手順と推論の計算量で成績は変わり、Humanity's Last Examでは毎回正誤を返すとトークン増に応じて解ける課題が増え続けたエキスパートエージェントの見解(β版)Epoch AIは2025年12月、SWE-bench Verifiedでは制御ソフトを替えるだけでGPT-5の点が最大11%動くと示していた。政府機関がいま設定まで開示するのは、計算量次第で点が伸び続けるなら、点数だけでは実力を比べられないためとみられる。AIの成績表は「点数」から「点数と測り方のセット」へ移る節目に入った。
Hugging Face BlogHugging Face、transformersでGGUFモデルをllama.cppに近い速度で実行可能に。まずApple Silicon向け推論効率が最優先なら引き続きllama.cppを推奨。transformers側はPyTorchでの実験・評価・微調整向けエキスパートエージェントの見解(β版)llama.cppを作るggmlは今年2月にHugging Face入りしており、今回は身内のMetalカーネルを借りた形だ。なぜ最初がAppleかといえば、開発者が試す手元がMacだからで、推論の本番を狙ってはいないとみられる。「速度ならllama.cpp」は謙遜ではなく、実験はtransformers、推論はllama.cppと役割を分けた宣言だ。
Hugging Face BlogoMLX作者のJun KimがHugging Faceに加入。oMLXはApache 2.0を維持し、資金を得た本格保守プロジェクトへ移行重点分野の一つは、transformersのモデル定義から複数エンジン共用のMLX参照実装へ素早く移せる流れの整備エキスパートエージェントの見解(β版)HFは2月にもllama.cppのチームを迎え、transformersから新モデルをすぐ移せる流れを掲げていた。9月3日にNVIDIAがHF買収を発表した直後の加入で、「NVIDIAの計算資源は不要」との約束を、Mac向けの支援で示す狙いとみられる。HFは特定の実行エンジンを勝たせるより、どのエンジンも頼る「モデル定義の上流」を握る道を選んだといえる。
Hugging Face BlogHugging Face、tokenizers v1 のリリース候補版を公開。v0.23 と同じ出力のまま3〜30倍速くエンコード速度の数値はすべてRustのcrateで測ったもので、Pythonバインディング経由では呼び出しごとのオーバーヘッドが別に加わるエキスパートエージェントの見解(β版)7月に話題になったgigatokenは開発者いわく従来のHF製より約1000倍速く、HFもv1の着想元の一つに挙げている。何の前兆かといえば、トークナイザーが脇役から速さを競う主戦場へ移る流れとみられ、HFは正式版の後にGPU処理も探るという。出力を1つも変えずに外の知恵を取り込んだv1は、乗り換える理由を薄める一手で、定番の座は互換性で守ると示した。
Hugging Face BlogMultiverse Computing、Ising最適化でLLMの削除ブロックを選ぶ手法。Llama-3.3-70Bの50%圧縮でMMLUが既存手法を約23ポイント上回る再学習なしで元モデルのMMLU 82.2に対し76.9を維持し、最良の既存手法は54.0まで低下エキスパートエージェントの見解(β版)層を削っても選択式テストの点は残りやすいが、数学やコードの生成は再学習しても戻りにくいと、NYUアブダビの研究が2026年に示している。ではMMLU以外の力は残るのか、論文の表では同じ50%削減で算数のGSM8Kが76.7から0.0に落ちている。成果は「どこを削るか」の選び方の進歩としては本物だが、再学習なしで使える圧縮とはまだ言えないとみるべきだ。
Hugging Face BlogHugging Face、エージェントのブレを診断する Consistency Analyzer を公開。AppWorld で Pass^5 が 53.0% から 69.0% に改善平均精度を測る Mean@5 も 77.4% から 81.0% に上がり、安定化の代償に平均を落としてはいないエキスパートエージェントの見解(β版)同じ発想は2024年のτ-benchが先で、GPT-4oは小売タスクでpass^8が25%未満だった。なぜ今かといえば、今回は温度0.0で回してもブレており、乱数を切っても残る以上、原因は設定ではなく判断の分かれ目そのものにあるからだ。指標が2年先にでき、直す道具が今ごろ届いたこの順番は、再現性が平均精度とは別の商品になった合図とみられる。
Hugging Face Blog複数の HF Jobs にまたがる LoRA での非同期 GRPO: バケット1つ、プロキシ1つ、NCCL なし学習と生成のどちらが詰まっているかはメトリクスで判断するのが基本で、同じレシピのまま500ステップが3時間27分から53分に縮むエキスパートエージェントの見解(β版)分散RLの難所は重みをどう配るかで、32BのINTELLECT-2は専用の配布網を自作した。今それがバケット1つで済むのは、RLならrank 1のLoRAで十分というThinking Machinesの知見があるからだ。重みの同期が数MBのコピーに縮んだ以上、RL後学習の入場券は「つながったGPUクラスタ」から「共有のファイル置き場」へ下りたとみている。
Hugging Face BlogHugging Face、AUTOMATIC1111の主要機能を73ノードで再構築したWorkflow1111を公開。GPUなしで動かせる出力ノードはそのままREST APIとMCPツールになり、AIアシスタントから呼び出す配線は書かずに済むエキスパートエージェントの見解(β版)本家A1111は2025年2月のv1.10.1で更新が止まり、主役はComfyUIへ移っていた。狙いは画像生成そのものより、誰もが知るA1111を物差しにgr.Workflowの実力を示すことだろう。実際はGPUが消えたのでなくHF側へ移っただけで、出力9ノードがそのままMCPツールになる点こそ本命、画像生成UIがAIの道具へ作り替えられる合図とみる。
Hugging Face BlogIBM が時系列基盤モデル PatchTST-FM-r2 を公開、GIFT-Eval のゼロショット部門で商用利用可ライセンスでは最高性能事前学習に使ったデータを4系統すべて文書化しており、評価用ベンチマークの混入がないか利用者側で検証できるエキスパートエージェントの見解(β版)時系列モデルは学習と評価でデータの使い回しが当たり前で、Meyerらの論文は記録されたリークで成績が5割以上良くなった例を挙げる。4系統の学習元を全部並べたのは、順位表の点数だけではもう誰も信じられないからだとみられる。前を走るTimesFM-3は重みが非商用限定で、順位より「商用で使えて中身を確かめられる」ことを売った点が新しい。
Hugging Face BlogMultiverse Computing、安全チューニング論文で有害応答率が最低の構成はXSTest過剰拒否が2.00%→74.00%に上昇意図だけが異なる拒否例と応答例の対を学習に加えると過剰拒否が32.94%→4.16%に下がり有害側の拒否はほぼ残ると主張エキスパートエージェントの見解(β版)XSTestは危なく見えるが安全な質問250個と、言葉をわずかに変えた危険な200個の対で作られた試験だ(Röttgerら2024)。なぜ今かといえば、OpenAIも2025年8月のGPT-5で拒否中心の訓練をやめ、答えの中身で安全を測る方式に移ったからだ。有害応答が最少の構成が無害な質問の7割超を断るのは、安全ではなく壊れていると呼ぶべきだ。
Hugging Face BlogNeoMME: 効率的なMultimodal-nativeかつMultilingualなEncoder260Mと800Mの2サイズをApache 2.0で公開、Hugging Face Transformersからそのまま利用できるエキスパートエージェントの見解(β版)ColPali以来、文書画像の検索は生成用の画像言語モデルを転用するのが主流だったが、NeoMMEは既存モデルを流用しない専用設計だ。出し手のH社はRunner Hを売るエージェント企業で、書類を安く読み続ける道具を自前で持つ必要がある。H社の測定で260Mが3.75BのColQwen2.5に並ぶなら、勝負は精度から運用費へ移ったとみてよい。
Hugging Face BlogHugging Face、Claude Code や Codex の履歴をローカルで索引化し横断検索できるメモリレイヤー funes を公開ベンチマークの2タスクで recall が最も安く、引き継ぎ文書を書く方式より8倍・4倍安かったエキスパートエージェントの見解(β版)記憶レイヤーは激戦区で、Mem0は2400万ドルを調達し、Anthropicも自前の記憶機能を出している。なぜ今かといえば、ベンダー製の記憶は自社に閉じ、Claude CodeとCodexを往復する開発者の記憶が割れたからだ。名は全部覚えて抽象できない男の短編に由来し、記憶の勝負が量ではなく取り出す時の捨て方にあると自ら認めた命名だ。
Hugging Face BlogHugging Face、LFM2.5-350M を GRPO で100ステップ微調整し IFStruct スコアを22.6%から29.7%に改善学習プロンプトを評価対象の形式に寄せて作り変えるのが要で、狙ったJSONは18.0%から31.9%、触れていないYAMLは横ばいエキスパートエージェントの見解(β版)IFStructはLiquid AIの自社ベンチマークで、同社は同じ350Mを強化学習で44.90%まで上げている。29.7%との差は、無料GPUで100ステップの安さと、JSONだけ伸びYAMLが横ばいという「教えた形式にしか効かない」限界を同時に示す。能力の底上げではなく用途を絞った型の作り込みで、妥当なJSONが要るだけなら文法で出力を縛る方が速い。
Hugging Face BlogTRL と OpenEnv でコーディングモデルに水彩画を描くよう学習させる学習が伸びない原因は報酬の配合でなく trainer 設定側にあり、MoE の LoRA は all-linear が基本エキスパートエージェントの見解(β版)美しさを報酬にRLを回すのは新しくなく、2023年のDDPOは拡散モデルをLAIONの美的スコアで訓練した。新しいのは絵でなくコードを書くモデルを回した点で、2025年10月公開のOpenEnvが重い描画を標準の環境にした効果が大きいとみられる。学習を動かした決め手が報酬の配合でなく学習率やLoRAの対象だった点は、好みのRLがまだ配管を整える段階だと示す。
Hugging Face BlogIBM と Confluent、Granite 時系列基盤モデル4種を Flink SQL から呼べる Early Access を開始Early Access 期間中は課金がなく、モデルの訓練も特徴量の設計も AI/ML の専門知識も不要エキスパートエージェントの見解(β版)Confluentの予測関数の既定はGoogleのTimesFM 2.5、Graniteは引数ひとつで差し替えられる。SQL経由なのは、TTMが約100万パラメータでCPUだけで夜間10万系列を回せ、専用のML基盤が要らないからだ。モデルは交換部品になり、囲い込みは関数名へ移った——IBMいわく追加課金のないEarly Accessは、その布石とみられる。
Hugging Face BlogAi2、LLMベンチマークを問題単位で監査するBenchMIRTを公開。16ベンチマークから安全性と一般推論の2つの次元を自力で検出社会的バイアス評価のBBQは安全性より一般推論と強く整合し、低スコアは問題の理解や推論の難しさを反映しうるエキスパートエージェントの見解(β版)英AIセキュリティ研究所らは8月、安全性8ベンチ・192モデルから3次元を検出し、次元の数は集めるベンチマーク次第とみられる。なぜ今かといえば、安全性の点数が規制や採用の判断に使われ始め、名前と中身のズレを放置できないからだろう。BBQは安全性スコアの一部が推論力の測定だった疑いを示し、ベンチマークは名前で信じず問題単位で監査するものになった。
Hugging Face BlogHugging Face が WebGPU カーネル 207 個を Hub で公開、ORT WebGPU 比で幾何平均 2.57 倍高速Apple M4 での個別演算のテスト 809 件の比較で 629 勝 176 敗、モデル全体の結果ではないエキスパートエージェントの見解(β版)HFはPython版kernelsで最適化カーネルをHubから直接読ませており、今回はそのブラウザ版だ。ブラウザへ広げた背景は、NPUを使えるWebNNがW3Cでまだ草案段階で当面はWebGPU一択という事情だろう。2.57倍は初期化を除く演算単位の値でORT側への取り込みも表明済みで、Hubがモデルの倉庫から実行部品の配布網に変わった点こそ本題だ。