📢 X投稿文
訓練不要で100フレームまでのストーリー画像生成に対応。グローバル参照クロスアテンションで前ラウンドの全参照画像を活用し、反復的に品質を改善
https://github.com/UCSC-VLAA/story-iter
🤖 AI考察
README抜粋から読み取れる情報で分析します。
■ **概要(1行)**
テキストから長編ストーリー(最大100フレーム)の画像系列を生成する際に、訓練不要な外部反復と全参照画像の段階的活用でセマンティック一貫性を維持するパラダイム。
■ **特徴・用途(2〜3行)**
既存の拡散モデルに訓練を加えずにプラグアンドプレイで統合できることが最大の強み。従来の「固定参照画像」ではなく、前ラウンドのすべての参照画像をGRCA(グローバル参照クロスアテンション)で段階的に活用し、セマンティック一貫性と微細な相互作用を両立。アニメーション生成・ビジュアルノベル・長編マンガ自動化など、ナラティブドリブンなコンテンツ生成に応用可能。
■ **結論(1行)**
実装未完成ながら、既存生成基盤への付加価値型アプローチとして、訓練コスト・計算効率・汎用性で実用的な先行事例になり得る。