📢 X投稿文
テキストから話し手の音声と動画を同時生成。Autoregressive Diffusionで単一モデルがテキスト→音声動画、音声→動画、動画→音声に対応。100万件超の学習データセットを公開
https://github.com/zhenye234/Talker-T2AV
🤖 AI考察
■ **概要**
テキスト、音声、動画を統一的に処理する自己回帰拡散モデル(Qwen3-0.6B + OT-CFM軽量ヘッド)により、単一モデルでT2AV/A2V/V2Aを実現。
■ **特徴・用途**
モーダル間の独立デノイジング(WhisperX-VAE + LIA-X)により、アーキテクチャ変更なく3タスクに対応。100万+の高品質学習データセット公開で追試・改善が容易。リアルタイム動画生成より、一貫性が求められるアニメーション生成やポッドキャスト・インタビュー動画化に適している(パッチ埋め込みの加算融合は入力の離散性が高い用途で有利)。
■ **結論**
マルチモーダル生成の統一化は実用的だが、25Hzの低フレームレート出力と拡散計算のレイテンシが、リアルタイムライブ配信への転用には課題。