Appleの機械学習研究チームが、画像生成に用いる拡散Transformer(DiT)において、一部のトークンが過剰な注意を引きつける「外れ値トークン」問題の詳細な分析と対策を発表した。この現象は生成品質を劣化させる要因となるが、単純な除去では解決せず、局所的な意味表現の破綻が本質であることを示した点で、AIモデル設計の新たな指針を提供する。
エンコーダと拡散過程の両方に潜む外れ値トークン
研究は、現代的な画像生成パイプラインであるRAE-DiTの両段階で外れ値トークンが発生することを明らかにした。事前学習済みのViTエンコーダが画像を表現する段階で外れ値を生成しうることに加え、DiT自身も内部、とりわけ中間層で外れ値トークンを発達させる。従来、識別モデルでの報告はあったが、生成モデルにおける実態は未解明だった。両経路での発生を示したことで、対策はエンコーダとデノイザーの両面で必要になる。
マスキングの無効が示す「意味の破綻」という本質
高ノルムのトークンを単純に除去するマスキング手法では性能改善が見られなかった。この結果は、問題の本質が少数の極端な値そのものではなく、その背後にある局所的なパッチ意味表現の破綻にあることを示唆する。外れ値は結果であり原因ではない可能性が高く、対策は数値的な外れ値を取り除くことではなく、表現そのものを修正する方向へ向かう必要がある。これはモデル圧縮や量子化の手法にも影響を与えうる視点である。
二段階レジスタ介入が示す実装上の指針
研究チームは「Dual-Stage Registers(DSR)」を提案する。エンコーダ側では、学習済みレジスタが利用可能な場合はそれを用い、そうでない場合はテスト時に再帰的にレジスタを生成する。デノイザー側では拡散レジスタを挿入する。ImageNetおよび大規模テキスト画像生成で有効性を確認し、外れ値アーティファクトの低減と生成品質の一貫した改善を報告している。特定のプロプライエタリな製品に依存せず、アーキテクチャレベルでの介入として設計されている点が実用上の示唆に富む。
生成AIの産業構造に投げかける示唆
DiTはStable Diffusion 3やSoraなど、画像・動画生成の基盤アーキテクチャとして急速に採用が進む。外れ値トークン制御の知見は、クラウド事業者が提供するAPIの品質や推論コスト、エッジデバイス上でのモデル圧縮に直結するテーマである。日本市場においても、広告、ゲーム、製造業での検査画像生成など業務利用が拡大する中、生成品質の安定性と計算効率の両立は実導入の成否を左右する。本成果は、モデル開発者からクラウド事業者、導入企業まで、生成AIのバリューチェーン全体に影響を及ぼす基礎研究として位置づけられる。
今後の論点と検証すべき課題
本論文ではDSRの有効性が示されたが、実アプリケーションでの多様な条件下での挙動は今後の検証課題となる。また、外れ値トークンの発生と学習データ分布や学習手法との因果関係は依然として明らかになっていない。Appleが公式ブログで本成果を公開したことは、同社の画像生成分野での研究開発の方向性を示すものではあるが、具体的な製品への統合やロードマップは一切言及されていない。今後は、他の研究機関による再現実験や、異なるモダリティへの展開の有無が注目される。