知識蒸留は本当に能力を移す?最新8論文を徹底比較 2026/08/15
2026-08-15 / arxiv Frontier AI・最先端AI論文解説
概要
オンポリシー蒸留、自己蒸留、推論時能力移転、音声モデル圧縮を、数値と比較条件から解説します。
▼ 今日の論文ラインナップ ・オンポリシー蒸留は能力境界を広げるのか(arXiv:2608.11829) ・REOPD―信頼できるトークンだけ外挿する(arXiv:2608.11698) ・HPSE―新知識を使える形へ自己蒸留する(arXiv:2608.11660) ・LoongReflect―大域教師から反省方策を蒸留する(arXiv:2608.11967) ・推論時ハーネスによる訓練なし能力移転(arXiv:2608.12307) ・8層から1層へ進行的に蒸留する音声強調(arXiv:2608.12099) ・小型言語モデルの信頼性をどう継承するか(arXiv:2608.11981) ・翻訳では蒸留が強化学習の前線を越えなかった(arXiv:2608.10812)
▼ 参考論文(arXiv) https://arxiv.org/abs/2608.11829 — オンポリシー蒸留は能力境界を広げるのか https://arxiv.org/abs/2608.11698 — REOPD―信頼できるトークンだけ外挿する https://arxiv.org/abs/2608.11660 — HPSE―新知識を使える形へ自己蒸留する https://arxiv.org/abs/2608.11967 — LoongReflect―大域教師から反省方策を蒸留する https://arxiv.org/abs/2608.12307 — 推論時ハーネスによる訓練なし能力移転 https://arxiv.org/abs/2608.12099 — 8層から1層へ進行的に蒸留する音声強調 https://arxiv.org/abs/2608.11981 — 小型言語モデルの信頼性をどう継承するか https://arxiv.org/abs/2608.10812 — 翻訳では蒸留が強化学習の前線を越えなかった
#生成AI #LLM #知識蒸留 #モデル圧縮 #arxiv #論文解説 #ずんだもん
スライド(クリックで展開)
arXiv生成AI論文解説・知識蒸留/モデル蒸留特集(2026年8月15日)
キーワード: オンポリシー蒸留 / 自己蒸留 / 強弱能力移転 / 知識編集 / 小型モデル / 中間表現
蒸留を単なる小型化でなく、確率分布、軌跡、内部表現、外部ハーネスへ何を移す技術かという観点から8本を比較する。
論文1: オンポリシー蒸留は能力境界を広げるのか
オンポリシー蒸留は、学生自身が生成した軌跡に対して教師のトークン分布を与える。従来は教師の知識を取り込み、基盤モデルが解けなかった問題まで解けるようになると説明されてきた。本研究は推論時サンプリング数Kを変え、平均性能avg@Kと少なくとも一回成功するpass@Kを分離した。複数の蒸留法でavg@Kは全予算にわたり改善したが、Kを増やすとpass@Kの優位は蒸留前モデルへ移った。訓練中にも小さいKでの成功率が上がる一方、大きいKで見える能力境界は縮小した。pass@1024で問題別に調べると、蒸留で新たに解けた問題より、以前は解けたのに解けなくなった問題が多かった。蒸留は正解軌跡へ確率質量を集中させ、少数サンプルの効率を上げるが、支持集合そのものを必ずしも広げない。単発精度だけなら能力獲得と分布の先鋭化を取り違えるため、pass@K曲線を併記する評価が重要になる。
pass@1だけを見ると、正解軌跡へ確率質量が集まった効果を新しい推論能力と誤認する。pass@1024では解ける問題集合がむしろ狭まったため、この蒸留は探索空間を開拓したのでなく、既知の成功経路を引きやすくしたと解釈できる。少数サンプルで答えを返す製品には有利だが、多数候補から難問を解く探索器には、蒸留前モデルの長い裾が価値を持つ。avg@Kとpass@Kの逆転は、同じモデル更新でも運用予算によって優劣が反転する具体例である。
論文2: REOPD―信頼できるトークンだけ外挿する
報酬外挿型オンポリシー蒸留は、教師と参照モデルの対数尤度比を増幅し、単純模倣より強く学生を更新する。既存のExOPDは全トークンへ同じ係数lambdaを掛けるため、暗黙報酬の極端なピークへ適合して報酬ハッキングや不安定化を起こしうる。最適lambdaも領域ごとに違い、探索費用が大きい。REOPDはトークン単位の教師・参照互換度q_tと、バッチ単位の適応予算gamma_bを組み合わせ、lambda_{b,t}=1+gamma_b q_tとする。教師方向が信頼できる位置だけ外挿し、他は教師整合を保つ設計である。検証器、報酬モデル、価値モデル、標準OPD以外の追加ロールアウトを要しない。単一教師の数学と複数教師の両領域でG-OPDを上回り、単一教師のコードでは同等だった。改善が一様でない点は、細粒度係数が万能というより、領域と教師構成の不均一性へ適応した結果と読める。
一律lambdaの問題は、教師と参照モデルの差が大きいトークンをすべて有益とみなす点にある。REOPDはq_tで方向の互換性を測り、gamma_bでバッチ全体の外挿量を制約するため、局所判断と全体予算を分離した。数学ではG-OPD超え、単一教師コードでは同等という結果から、細粒度適応の利得は教師信号の不均一さに依存する。追加ロールアウトや検証器なしという条件は、改善分を推論計算の増量で説明できない点でも重要である。
論文3: HPSE―新知識を使える形へ自己蒸留する
非構造化知識編集は自由記述の一節をモデルへ注入するが、既存法は文章を再生できても、含まれる原子的事実への質問や複数事実の合成推論に失敗する。著者らはこの欠落をコンポーザビリティと呼び、固定文章だけを受動的な学習源にすることが原因だと捉えた。HPSEは編集後の特権的インコンテキスト状態を教師とし、外部教師なしで同じモデルへ自己蒸留する。純粋なオンポリシー軌跡では、新規知識をまだ持たない学生が必要事実をほとんど生成せず、教師信号を受ける場所自体が不足する。そこで学生軌跡の被覆が切れた位置だけ不足事実を挿入し、それ以外はオンポリシーを保つハイブリッド軌跡を作る。4種類のLLM基盤と2種類の知識編集器、複数条件でプラグイン型の改善を示した。蒸留で重要なのは教師の強さだけでなく、学生が教師信号へ到達できる軌跡支持を設計することだと分かる。
純粋オンポリシー蒸留が失敗する理由は、学生の誤答より前に、新規事実を含む軌跡を生成できない被覆欠損にある。HPSEは欠損位置だけ介入するため、全軌跡を教師生成へ置き換えず、学生が実際に訪れる文脈を保つ。4基盤と2編集器で改善したことは編集器固有の後処理ではない強みを示す。一方、複数事実をどこで挿入するかという方策が性能を左右し、自由記述が長く矛盾を含む場合には介入位置の選択自体が新たな誤差源になる。
論文4: LoongReflect―大域教師から反省方策を蒸留する
長期探索エージェントの反省は、証拠不足や信頼できない中間状態を見つけ、継続、修正、分岐放棄を選ぶ制御である。しかし判断は局所分岐で行われ、その価値は最終結果でしか分からないため、結果報酬は疎で遅い。LoongReflectは反省を可逆な軌跡木上のメモリ制御方策として定式化し、明示的なreflectとbacktrack行動を置く。反省時には検証済み事実、欠落証拠、分岐固有リスクを作業記憶へ圧縮し、後退時には不良分岐を文脈から外して短い教訓を残す。高速チャネルは全軌跡を見渡せる特権教師から、反省と後退トークンだけを蒸留する。低速チャネルは完全軌跡へ結果ベースGRPOを適用し、局所制御と最終成功を結ぶ。両信号は先読み型の外挿勾配機構で協調する。多段検索拡張生成と数学推論で、結果報酬だけの強化学習と自己蒸留を一貫して上回った。
この設計で蒸留するのは最終回答ではなく、いつ反省し、どの枝を捨て、何を記憶へ残すかという制御方策である。教師信号をreflectとbacktrackのトークンへ限定したため、内容生成まで教師模倣で覆わずに済む。結果報酬だけの強化学習と自己蒸留の双方を上回った点は、大域視点と最終成否が相補的だったことを示す。ただし可逆な軌跡木と明示的後退を持たない実行基盤では、同じ制御信号をそのまま移植できない。
論文5: 推論時ハーネスによる訓練なし能力移転
通常の蒸留は教師強制やオンポリシー訓練で学生パラメータを更新する。本研究は強い構築モデルが、弱い対象モデルを支える推論時ハーネスを作れば、重み更新なしでも能力を移せるか調べた。4種類の心の理論ベンチマークで、構築モデルはデータの5%を検証集合として複数ラウンド改善し、完成ハーネスを全テスト集合で評価した。対象モデルの平均性能は0.49から0.91へ上がり、ほぼ倍増した。利得の主因は長い思考を促すことや大量サンプリングではなく、不安定な推論を決定的コードへ移すこと、課題別ルーティング、厳密な回答形式だった。構築モデルの推論努力を増やすほどハーネス品質は単調に改善し、基盤プラットフォーム差は構築モデル自身の能力差より小さかった。弱い対象モデルほど利得が大きい。これは知識を重みに圧縮する蒸留ではなく、教師が作った認知構造を外部実行系として再利用する能力移転である。
0.49から0.91への上昇は大きいが、対象モデルの重みが賢くなったわけではない。不安定な推論を決定的コード、課題別ルーティング、形式制約へ外出しした結果であり、能力はモデルとハーネスの合成系に宿る。5%の検証集合でハーネスを反復改善する設定は、未知ベンチマークへ無調整で転移した結果とも異なる。弱いモデルほど利得が大きいのは、モデル規模を増やす代わりに強い構築モデルの設計費を一度払う選択肢を示している。
論文6: 8層から1層へ進行的に蒸留する音声強調
RT-SEMambaは因果的な時間周波数Mambaブロックを使うリアルタイム音声強調モデルである。Transformerのキー・バリューキャッシュは系列長とともに増えるが、Mambaは層ごとに固定長の再帰状態を伝えるため、長時間音声のメモリ帯域を抑えられる。進行的知識蒸留では8層教師を1層学生へ圧縮し、複素スペクトル出力と中間表現を同時に一致させる。Voicebank-DEMANDで8層教師はアルゴリズム遅延25ミリ秒の制約下でPESQ 3.32を得た。素朴な1層モデルはPESQ 3.06だが、蒸留学生は3.18へ改善した。学生の定常リアルタイム係数は素朴な1層版と同じで、教師より2.75倍高速だった。教師との差0.14を残しながら、素朴学生との差0.12を回収した形である。出力だけでなく中間状態も段階的に合わせる設計が、極端な8対1の深度圧縮で品質と遅延の折衷を改善した。
8層から1層という圧縮で、PESQは教師3.32から学生3.18へ0.14低下したが、素朴学生3.06からは0.12回復した。したがって蒸留は教師品質の完全再現ではなく、浅層化で失う品質のほぼ半分を取り戻した技術と位置づけられる。25ミリ秒制約、同じ学生RTF、教師比2.75倍速という三条件が揃い、品質と遅延の交換が数値で読める。固定長状態のMambaと進行的蒸留の寄与は合成されており、アーキテクチャ差と蒸留差を分離した追加比較には余地がある。
論文7: 小型言語モデルの信頼性をどう継承するか
小型言語モデルは初めから小さく事前学習する方法と、大型モデルを枝刈り、量子化、蒸留で圧縮する方法に分かれる。本研究は公平性、頑健性、プライバシー、倫理の複数軸で、事前学習型と圧縮型の信頼性を比較した。圧縮法同士では量子化が枝刈りより信頼性を大幅に保持した。さらに信頼できる大型モデルを量子化した小型モデルは、小型で一から学習したモデルより信頼性と適応性が高かった。信頼できる教師からの知識蒸留を追加すると、小型モデルの信頼性はさらに向上した。精度だけでなく教師の安全特性も学生へ移りうるという実務的結果である。一方、圧縮操作ごとに内部表現の歪み方が違うため、パラメータ数や平均タスク精度が同じでも安全挙動は同等とは限らない。蒸留教師の信頼性を前提にするため、教師の偏りも高忠実度で継承されうる点は設計上の対称的リスクになる。
量子化が枝刈りより信頼性を保持した結果は、圧縮率が同じでも削る対象によって安全特性の壊れ方が違うことを示す。信頼できる大型モデルの量子化版が小型事前学習モデルを上回り、さらに蒸留で改善したため、信頼性は容量だけで決まらず教師選択にも依存する。ただし公平性、頑健性、プライバシー、倫理は異なる失敗分布を測る。教師の偏りを忠実に継承する危険もあり、平均信頼性の上昇を全属性の改善と同一視できない。
論文8: 翻訳では蒸留が強化学習の前線を越えなかった
46言語のMiLMMT-46は、教師参照訳を使わない事後学習を検証した。教師あり微調整モデルから始め、二つの参照不要な品質推定器の平均を報酬にし、言語識別でゲートしたGRPOを適用する。最終モデルは教師ありチェックポイントと強化学習チェックポイントを線形補間して作った。46言語で教師あり版を一貫して改善し、Seed-X、HY-MT2、TranslateGemmaなどの公開ベースラインを上回った。評価したGoogle Translate、Gemini 3 Pro、GPT-5に対しても参照不要指標で先頭水準を報告した。同じ条件でオンポリシー蒸留も調べると、強化学習とチェックポイント補間が作った品質前線には到達したが、それを越えなかった。教師分布の模倣だけでなく、品質推定報酬による探索と、二つの解の補間が効いた比較である。蒸留を標準候補に置きつつ、同じ評価予算で強化学習とのパレート前線を比べる必要性を示す。
オンポリシー蒸留が強化学習と補間の品質前線へ届いても越えなかった事実は、教師模倣だけでは参照不要報酬が開く探索方向を超えられなかったことを示す。46言語で一貫した改善は広いが、順位は二つの品質推定器と言語識別ゲートが定めた参照不要指標上の結果である。チェックポイント補間は教師あり能力を残しながら強化学習の方向を加えるため、単一目的の蒸留とは更新幾何が異なる。蒸留を軽量な代替として使う場合も、同じ計算予算で到達する品質前線を比較すると役割が明瞭になる。
まとめ
8本を横断すると、蒸留は教師の知識を丸ごと複製する操作ではない。正解確率、信頼できるトークン、反省方策、中間表現、安全挙動、実行手順のどれを移すかで、性能、費用、能力境界が変わる。pass@Kや教師との差を含む多面的な評価が、蒸留の実効性を見分ける。
参考ソース
- 論文1: https://arxiv.org/abs/2608.11829
- 論文2: https://arxiv.org/abs/2608.11698
- 論文3: https://arxiv.org/abs/2608.11660
- 論文4: https://arxiv.org/abs/2608.11967
- 論文5: https://arxiv.org/abs/2608.12307
- 論文6: https://arxiv.org/abs/2608.12099
- 論文7: https://arxiv.org/abs/2608.11981
- 論文8: https://arxiv.org/abs/2608.10812