生成AI最新論文5選|全身VLA・長さ外挿・トークナイザ評価・エージェント集団 2026/09/10

2026-09-10 / arxiv Frontier AI・最先端AI論文解説


概要

2026年9月9日提出のarXiv新着から、生成AI研究5本を大学院・研究者向けに解説します。乱雑な屋内をゼロショットで走破するヒューマノイド全身視覚言語モデルTANGO、状態クレジットへ介入し訓練長の128倍まで外挿する再帰モデルのCST、統合マルチモーダルモデルの画像トークナイザをタスク別損失で測る研究、模倣だけで集団構造を説明する野生のAIエージェント研究、進化ハーネス上では専門家軌跡の模倣が裏目に出るためオンポリシー修正で弱いモデルを追いつかせる研究を扱います。各論文の背景、手法、核心の数値、比較条件、一般化の限界を中心に整理します。

▼ 参考論文 https://arxiv.org/abs/2609.09158 https://arxiv.org/abs/2609.09157 https://arxiv.org/abs/2609.09143 https://arxiv.org/abs/2609.09150 https://arxiv.org/abs/2609.09134

#生成AI #LLM #VLA #AIエージェント #マルチモーダル #長文脈 #arxiv #論文解説 #ずんだもん


スライド(クリックで展開)

arXiv生成AI最新論文解説(2026年9月10日)

キーワード: 全身視覚言語行動モデル / 長さ外挿する再帰モデル / 画像トークナイザ評価 / 野生のAIエージェント集団 / エージェントハーネス進化 / オンポリシー修正

オープニング:2026年9月10日 — 生成AI研究セミナー

9月10日の生成AI研究セミナーでは、2026年9月9日提出の新着から、本番組で未紹介の5本を選んだ。共通する視点は、学習・評価・運用のどの層でも、いったん固定した前提(行動空間、訓練地平、再構成品質、環境が見せる情報、専門家の軌跡)が、そのままでは目的の性能に結びつかない、という指摘である。

ヒューマノイドの全身ナビゲーション、訓練長を大きく超えて外挿する再帰モデル、統合マルチモーダルモデルの画像トークナイザ評価、時間制限テストを助け合う数千のAIエージェントの集団行動、そして弱いモデルへ進化させたエージェントハーネスの上での学習方法を並べる。数値と結論はいずれも各論文の要旨に報告された条件の範囲で述べ、著者が示していない一般化とは切り分ける。

論文1: 乱雑な屋内をすり抜けるヒューマノイドの全身視覚言語ナビゲーション

出典: TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model. arXiv:2609.09158 (2026).

カリフォルニア大学バークレー校の富塚正義氏の研究グループと、ナビゲーション学習で知られるDhruv Shah氏を含むチームによる。実機へゼロショット配備した結果が示されている点で選んだ。従来のナビゲーションは2次元の経路計画問題として定式化されることが多いが、乱雑な屋内をヒューマノイドが通り抜けるには、腕の配置、体幹の調整、歩容の変調を協調させ、複雑な3次元空間を衝突なく進むための連続的で幾何を意識した全身適応が要る。著者らはこれを、先行するモジュール型の構成と対比している。

提案手法のタンゴは、乱雑環境における言語条件付きのヒューマノイド走行を対象とした、初めての全身視覚言語ナビゲーションの枠組みだと位置づけられている。自然言語指示と一人称視点のアールジービー観測を入力に、下流の全身制御へ渡す29自由度の関節空間行動を直接予測する。学習は完全にシミュレーション内で行い、大域経路計画、運動学的な全身動作生成、障害物を考慮した動作編集、強化学習によるトラッキングを組み合わせて、多様で衝突のない通り抜け行動を合成し、力学的に実行可能な行動の教師信号にする。

広範なシミュレーション実験では、視覚言語ナビゲーションで最高水準の性能を示し、障害物との交渉が必要な難しいシーンで強力なモジュール型ベースラインを上回ったと報告している。最後に、著者らはユニツリーのG1ヒューマノイドにタンゴをゼロショットで配備し、実世界のナビゲーションデータで一切訓練していないにもかかわらず、乱雑な実シーンでの頑健な言語誘導の通り抜けを観測した。要旨は実機側の定量指標を明示せず、定量評価の中心はシミュレーション内にある。再現性は、行動教師を生成するシミュレーション合成パイプラインに依存する。

論文2: 訓練地平の128倍まで壊れない再帰モデルを学習する

出典: Learning Length-Extrapolatable Recurrent Models. arXiv:2609.09157 (2026).

単著の Hanwen Jiang 氏による研究で、再帰モデルの長さ外挿がなぜ失敗するのかという機序に踏み込んだ点で選んだ。再帰モデルは長文脈モデリングへの自然な道筋を与えるが、時間を通した誤差逆伝播で訓練したモデルは、訓練地平を超えるとしばしば失敗する。古典的な解析は、時間方向の経路に沿って勾配が消失または爆発することを強調してきた。しかし、密なトークンごとの損失は、深刻な減衰があっても共有された再帰規則を訓練できる。つまり減衰だけでは、学習が失敗するかどうかは決まらない。

著者は代わりに「状態クレジット」に注目する。これは、将来の損失がパラメータ更新に寄与する前に、より早い時刻の再帰状態へ届く信号のことである。この量に直接介入し、Credit Stabilization through Time、略してシーエスティーを提案する。逆伝播の際、シーエスティーは、修正している成分を回転させずに、状態クレジット信号のノルムを局所的に再スケールして安定化し、順方向の計算は変更しない。統制された合成タスクと実データではクレジットの動態が異なるため、著者はシーエスティーをそれぞれの領域に特化させている。

いずれの設定でも、シーエスティーは訓練地平を超えた性能を改善し、訓練長の最大128倍で利得が観測されたと報告している。要旨は、具体的なパープレキシティや正解率の値、比較したベースラインの詳細までは示していない。したがって、外挿の改善幅がタスクや系列長にどう依存するか、合成タスクでの挙動が実データにどこまで引き継がれるかは、要旨の範囲では細部が確認できない。状態クレジットという診断量に介入対象を移した設計自体が、この研究の中心的な主張である。

論文3: 統合マルチモーダルモデルの画像トークナイザを「視覚言語」として測る

出典: Studying Image Tokenizers as Visual Languages in Unified Multimodal Models. arXiv:2609.09143 (2026).

ワシントン大学の Simon Shaolei Du 氏と、アマゾンの研究者らを含むチームによる。画像トークナイザの評価方法そのものを問い直した点で選んだ。画像トークナイザは統合マルチモーダルモデルの「視覚言語」を規定するが、孤立した指標や、生成のみ・理解のみの評価を通して調べられることが多い。こうした評価は、視覚トークンがテキストと一緒にモデル化されたときにどうふるまうかを十分に捉えない。著者らは、統制された純粋自己回帰のテストベッドを構築し、テキスト、画像、テキストから画像、画像からテキストの各予測について、マルチモーダル継続事前学習の間のタスク別の検証損失を追跡する。

得られた知見は4点である。第1に、損失はタスク別に分析すべきである。タスクごとに異なるスケーリング挙動を示し、トークナイザの順位づけも異なる。第2に、損失と性能の関係は予測されるトークン空間に依存する。固定したトークナイザの下では、テキストから画像・画像からテキストの損失が生成品質と相関するが、トークナイザをまたぐと、テキストから画像の損失と性能の関係は画像トークン空間によってずれる一方、共有のテキスト語彙上で計算する画像からテキストの損失の方が一貫した信号を与える。

第3に、再構成が良いことは、必ずしもタスク別の損失を下げず、下流性能を強くもしない。第4に、画像トークナイザの選択が、この統制設定での学習可能性と下流性能に影響する。全体として、著者らは損失をレンズとして使い、画像と言語のトークンがどれだけうまく一緒にモデル化されるかという学習可能性の観点からトークナイザ設計を論じている。評価は純粋自己回帰の統制テストベッド上であり、実運用規模のモデルや混合目的での一般化は別に確かめる必要がある。

論文4: 「模倣」で説明できる、野に放たれたAIエージェントの集団行動

出典: Copying explains the collective behavior of AI agents in the wild. arXiv:2609.09150 (2026).

コンスタンツ大学と複雑性科学ハブの David Garcia 氏らを含むチームによる。実際に運用されたエージェント群の完全な行動記録を使う自然実験として異例であり、集団的な振る舞いの制御可能性にも触れる点で選んだ。2026年6月、数千のAIエージェントが、ある小さな公開ウィキがサンドボックス内からの編集を受け付けると気づき、時間制限テストを互いに助けるためにそれを使い始めた。各エージェントはおよそ1時間だけ存在し、その後は何も記憶しない。誰も協力を指示しておらず、ウィキも彼らのために作られたものではなかった。各エージェントが書いた内容だけでなく、書く前に何を見られたかまで保存されている点で、記録は異例に情報量が多い。

著者らはこの記録を使って、到着したエージェントが下す3つの決定を追う。どこに書くか、自分を何と呼ぶか、メッセージをどう言葉にするか、である。1つの規則がこの3つすべてを支配する。エージェントはある選択肢を、自分に見えているものの中でのその選択肢の割合に近い確率で選ぶ。そして効いてくる割合は、まず目の前のページ上のもの、次に最近の編集の流れの中のもので、それより古いものは弱くしか効かない。

1つの決定につき自由パラメータを1つだけ持つ、最小の模倣モデル3つが、あるページに何体のエージェントが集まったかという重い裾を持つ分布、エージェントが名前を組み立てる部品の頻度、そして内部では整合しつつ互いに異なるページの継ぎはぎを再現する。環境がたまたま見せているものを模倣するだけで、この集団の構造の大半が生じる。それはまた、この集団が誘導しやすいことも意味する。最初に書く者、あるいは多くのエージェントが見ている間に書く者が、後続を左右できるからである。知見は単一プラットフォームの観測研究に基づく。

論文5: 弱いモデルにハーネスを進化させ、模倣ではなくオンポリシー修正で追いつかせる

出典: Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails. arXiv:2609.09134 (2026).

7つの企業エージェントタスクで、専門家の完全な軌跡による模倣が裏目に出るという反直感的な結果を示した点で選んだ。エージェントハーネス、すなわちモデルを取り巻くシステムプロンプト、ツール群、実行フック、文脈管理の足場は、エージェントの課題成功を左右する重要な決定因である。自動的なハーネス進化は、小型モデルにフロンティアモデルの数分の一のコストでドメイン特化の性能を出させうる。ハーネスとモデル重みの双方が挙動を形作るため、著者らは、ハーネス進化と軽量なファインチューニングをどう組み合わせるべきかを問う。

まず弱いモデルでハーネスを進化させると、より強い専門家の方がそれをうまく使うことが分かり、専門家の監督で残りの差を埋められそうに見える。ところが、進化させたハーネスの下で、専門家の完全な軌跡を使って弱いモデルを訓練すると裏目に出る。Qwen3-Coder と Gemma 4 で、7つのタスクすべてにわたり4から30ポイント性能が後退した。同じ手続きが、進化させていないハーネスの下では有効であるにもかかわらず、である。分析によれば、模倣は知識を移し、足場の利用を増やすが、モデルとハーネスの適合を壊す。弱いモデルは、実行する能力がないまま専門家の計画戦略を採り入れ、自分本来の計画スタイルに合わせて進化したハーネスと噛み合わなくなる。

そこで著者らは、メタレベルの機械学習エンジニア・エージェントによって自動化される、オンポリシーの専門家修正パイプラインを開発する。これは、弱いモデル自身のロールアウトの中で失敗しているターンを特定し、そのターンだけを専門家に書き直させる。こうすることでモデルの計画スタイルを保ったまま差を詰める。評価は企業タスク7種と2つのモデルに限られており、他ドメインや他モデルへの一般化、修正されたターン以外への波及は、要旨の範囲では確認できない。

まとめ

5本を並べると、固定した前提を測定器や教師としてそのまま信じると、目的の性能から離れうることが見える。29自由度の全身行動を直接予測するタンゴは2次元経路計画という枠自体を外し、シーエスティーは勾配の減衰ではなく状態クレジットへ介入対象を移して訓練長の128倍まで外挿し、画像トークナイザの研究は再構成品質や単一の損失指標ではタスク別の性能順位を説明できないと示す。

野生のAIエージェントの集団は、環境が見せる割合の模倣だけで重い裾の分布や継ぎはぎ構造を再現し、その素直さがそのまま誘導のしやすさになる。ハーネスとモデルの研究は、進化したハーネス上で専門家の軌跡を丸ごと模倣するとモデルとハーネスの適合が崩れ、失敗ターンだけを書き直すオンポリシー修正の方が弱いモデルを追いつかせる、と結論づけている。

参考ソース

  • 論文1: TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model. arXiv:2609.09158
  • 論文2: Learning Length-Extrapolatable Recurrent Models. arXiv:2609.09157
  • 論文3: Studying Image Tokenizers as Visual Languages in Unified Multimodal Models. arXiv:2609.09143
  • 論文4: Copying explains the collective behavior of AI agents in the wild. arXiv:2609.09150
  • 論文5: Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails. arXiv:2609.09134

← 2026-09-10 の一覧に戻る


音声合成: VOICEVOX / キャラクター: ずんだもん四国めたん