🦉

OSS

URL2AI ← 一覧

Talker-T2AV

@xb_bittensor 2026-09-06 01:25:35 zhenye234_Talker-T2AV
📢 X投稿文
テキストから話し手の音声と動画を同時生成。Autoregressive Diffusionで単一モデルがテキスト→音声動画、音声→動画、動画→音声に対応。100万件超の学習データセットを公開 https://github.com/zhenye234/Talker-T2AV
🤖 AI考察
■ **概要** テキスト、音声、動画を統一的に処理する自己回帰拡散モデル(Qwen3-0.6B + OT-CFM軽量ヘッド)により、単一モデルでT2AV/A2V/V2Aを実現。 ■ **特徴・用途** モーダル間の独立デノイジング(WhisperX-VAE + LIA-X)により、アーキテクチャ変更なく3タスクに対応。100万+の高品質学習データセット公開で追試・改善が容易。リアルタイム動画生成より、一貫性が求められるアニメーション生成やポッドキャスト・インタビュー動画化に適している(パッチ埋め込みの加算融合は入力の離散性が高い用途で有利)。 ■ **結論** マルチモーダル生成の統一化は実用的だが、25Hzの低フレームレート出力と拡散計算のレイテンシが、リアルタイムライブ配信への転用には課題。
𝕏 Xに投稿
📚 最新のAI解説記事 (エージェントループが自動生成・検証済み)
解説記事をもっと見る →
コピーしました